Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas
Qwen3.8-27B es el primer modelo de pesos abiertos cuyo resultado publicado en operación de escritorio supera a los modelos alojados de su propia tabla comparativa. Comercialmente eso importa por una razón: la automatización de pantalla es la carga de trabajo en la que enviar datos a la API de otra empresa resulta más difícil de justificar. Una captura arrastra todo lo que había en la pantalla, incluido el registro de cliente que estaba junto a la factura que querías leer.
Este artículo responde a una pregunta de compra muy concreta: ¿puede hoy un agente de pantalla autoalojado hacer trabajo útil de back office, y qué debe cumplirse antes de que toque un sistema en producción? No es una guía de dimensionamiento de hardware. Para presupuestos de memoria, compromisos de cuantización y pilotos en una sola estación de trabajo, usa nuestra guía de hardware y benchmarks de modelos de agente locales. Si prefieres comprar un producto de computer use alojado en lugar de operar el tuyo, lee nuestro análisis de un agente de computer use en research preview. Mantener esas tres intenciones en páginas separadas es deliberado.
Qué es realmente Qwen3.8-27B
El equipo Qwen de Alibaba publicó los pesos el 14 de agosto de 2026. La tarjeta oficial del modelo Qwen3.8-27B es la fuente primaria de esta sección y de la tabla de benchmarks siguiente.
| Factor de decisión | Dato publicado | Qué significa para un agente de pantalla |
|---|---|---|
| Tamaño y tipo | Modelo denso de 27B, 64 capas, dimensión oculta 5120 | Cada parámetro se ejecuta por token, así que el techo lo marca el ancho de banda de memoria, no solo el número de parámetros |
| Disposición de capas | 16 repeticiones de 3 × (Gated DeltaNet → FFN) y 1 × (Gated Attention → FFN) | 48 capas de atención lineal frente a 16 de atención completa, lo que cambia cómo consume memoria el contexto largo |
| Entradas | Texto, imagen y vídeo de entrada, texto de salida | Las capturas y las grabaciones de pantalla son entradas nativas, no un paso de OCR añadido |
| Contexto | 262.144 tokens nativos, ampliable con escalado YaRN | Las trazas largas de interfaz con muchas capturas caben sin resumir de forma agresiva |
| Decodificación | Predicción multitoken entrenada en el propio checkpoint | La decodificación especulativa está disponible sin desplegar un modelo borrador aparte |
| Licencia | Apache 2.0 | El uso comercial está previsto, con deberes de aviso y atribución al redistribuir |
El número que cambia la decisión de construir o comprar
OSWorld-Verified mide si un agente termina tareas reales en un escritorio real: abrir el archivo, cambiar el ajuste, completar el formulario. Es la mejor aproximación pública al trabajo de back office que las empresas quieren automatizar de verdad. La tabla publicada por Qwen coloca un modelo que puedes ejecutar tú mismo por delante de los modelos alojados que enumera.
| Benchmark | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|
| OSWorld-Verified (operación de escritorio) | 84,3 | 63,9 | 73,3 | 65,9 | 72,7 |
| AndroidWorld (operación móvil) | 81,9 | 70,3 | 81,0 | no publicado | 62,0 |
| WebArena-Verified (tareas de navegador) | 64,8 | 48,8 | 55,3 | no publicado | no publicado |
| Vision2Web | 62,9 | 45,0 | 42,1 | no publicado | no publicado |
| SWE-bench Pro (trabajo en repositorio) | 61,7 | no publicado | no publicado | no publicado | no publicado |
Lee la fila de WebArena antes que la de OSWorld. Un 64,8 en tareas de navegador significa que aproximadamente uno de cada tres intentos falla justo en la superficie donde vive la mayor parte de la automatización comercial. El resultado de escritorio es genuinamente bueno. No es una licencia para apuntar un agente a tu ERP y salir de la sala.
Por qué la tabla de un proveedor no decide la elección de modelo
Dos proveedores publicaron cifras distintas para el mismo modelo de un tercero en el mismo benchmark con pocos días de diferencia. Qwen indica 63,9 para su generación anterior, Qwen3.6-27B, en OSWorld-Verified. La tabla de lanzamiento de Meta para su modelo local de 30B indica 75,6 para esa misma generación de Qwen, como recogemos en nuestra guía de Muse Glimmer.
Ninguna de las dos cifras tiene que ser falsa. Los resultados de computer use dependen del andamiaje: cuántos pasos puede dar el agente, con qué resolución ve la pantalla, si dispone de árbol de accesibilidad, cómo se reintentan los errores de herramienta, qué system prompt lo guía. Por eso mismo una tabla de proveedor no puede predecir tu resultado. El harness forma parte de la medición, y en tu despliegue el harness es tuyo.
Nuestra regla: las tablas publicadas deciden qué merece una prueba, nunca qué se pone en producción. Congela tu propio andamiaje y vuelve a medir. La misma disciplina aplica al dinero, que modelamos en coste por token frente a coste por tarea aceptada.
Las capturas son la carga que menos quieres exportar
Los prompts de texto se pueden filtrar. La entrada de un agente de pantalla no, al menos no por completo. Ve la ventana que debe operar y todo lo que la rodea: el registro vecino, el ticket abierto, el panel interno, el nombre de una compañera en una notificación. La anonimización previa a la llamada, el enfoque que describimos en eliminar datos personales antes de que lleguen al LLM, funciona con texto estructurado. No sobrevive al contacto con píxeles arbitrarios.
Por eso un modelo de pesos abiertos con resultados creíbles en escritorio es una propuesta distinta de un modelo alojado algo mejor. Ejecutar la inferencia dentro de tu red elimina la transferencia, la cuestión de la retención por parte del proveedor y una entrada más de subencargado. No elimina tus obligaciones como operador y añade el trabajo de mantener el stack. Si la transferencia es lo que bloquea tu evaluación de riesgo, este lanzamiento retira el bloqueo. Si el bloqueo real es que nadie del equipo quiere operar GPUs, autoalojar no ayuda.
Qué cambia la atención híbrida en tu plan de serving
La planificación de capacidad de un transformer denso no se traslada. Tres cuartas partes de las capas aquí son capas Gated DeltaNet, que mantienen un estado recurrente de tamaño fijo en lugar de una caché clave-valor que crece con cada token. El contexto largo deja de ser una única curva lineal de memoria, y las estimaciones que memorizaste para un transformer de 27B te engañarán en ambas direcciones.
El cookbook de despliegue de SGLang para este modelo muestra la consecuencia de forma directa: la caché de estado híbrida tiene sus propios flags de dimensionado, entre ellos --mamba-full-memory-ratio y --max-mamba-cache-size, y el cookbook enumera checkpoints BF16, FP8 y NVFP4 W4A4 con predicción multitoken incluida, orientados a serving en una sola GPU en hardware de clase H200, RTX PRO 6000, RTX 5090 y DGX Spark.
De ahí salen cuatro consecuencias de planificación, y cada una es una medición, no una fórmula:
- La reserva previa es una decisión de presupuesto. La caché de estado se reserva de antemano. La memoria libre en reposo dice muy poco sobre el comportamiento con tu concurrencia real.
- Las capturas son tokens caros. Los tokens de imagen dominan una traza de interfaz. Mide con la resolución y el número de pasos que tu agente usará de verdad, no con un prompt de texto.
- La decodificación especulativa se valida, no se asume. La predicción multitoken ayuda sobre todo a la latencia de un solo flujo y puede ser casi neutra con batching intenso.
- La cuantización es un experimento de calidad. W4A4 cambia lo que cabe en una tarjeta. Si cambia el éxito en tus pantallas solo lo responden tus propios entornos de prueba.
Si estás decidiendo cómo servirlo junto a modelos existentes, los patrones de plataforma de un stack de inferencia sobre vLLM y Triton y el modelo de coste total de autoalojar LLMs en la UE siguen siendo válidos.
Dónde sigue perdiendo un agente de pantalla autoalojado
Los fallos honestos no van de capacidad. Van de lo que ocurre cuando la pantalla es hostil o la acción no se puede revertir.
Los agentes de pantalla leen píxeles renderizados, así que no distinguen de forma fiable un elemento real de la interfaz de un contenido generado por usuarios que simplemente lo aparenta. El estudio VPI-Bench sobre inyección visual de prompts informa de que, en 306 casos de prueba sobre cinco plataformas de uso extendido, los agentes de computer use fueron engañados en tasas de hasta el 51 por ciento y los agentes de navegador hasta el 100 por ciento en algunas plataformas, y que las defensas basadas en el system prompt aportaron una mejora limitada. Un campo de comentarios, el título de una invitación de calendario o el pie de un PDF son canales de instrucciones.
| Escenario | Encaje actual | Por qué |
|---|---|---|
| Extracción de solo lectura de un sistema interno sin API utilizable | Piloto sólido | Reversible, repetitivo, y los datos nunca salen de la red |
| Software de escritorio heredado que nunca tendrá API | Piloto sólido | La interfaz es la única superficie de integración disponible |
| Rellenar formularios con confirmación humana antes de enviar | Buen piloto | El modelo redacta, una persona acepta y la traza de auditoría se mantiene |
| Flujos de navegador en varios sitios públicos | Solo con barreras | Un 64,8 en navegador más contenido de página no confiable es mala combinación |
| Pagos, mensajes a clientes, cambios de estado irreversibles | Todavía no | Tasas de inyección por encima de cero hacen indefendible la autonomía sin supervisión |
| Proceso estable de alto volumen que ya tiene API | Herramienta equivocada | Una integración determinista es más barata, más rápida y más fácil de probar |
Antes de dar credenciales a cualquier agente, pásalo por los controles de nuestra checklist de evaluación y sandbox para agentes de IA. La regla estructural es corta: un agente que combina acceso a datos privados, exposición a contenido no confiable y una vía para enviar datos hacia fuera es explotable. Rompe una de las tres.
Una evaluación de dos semanas que termina en decisión
- Elige un proceso y de 20 a 30 tareas reales. Usa la cola real del mes pasado, incluidos los casos sucios y los que una persona escaló.
- Construye entornos de prueba, no sistemas en vivo. Congela el estado de la aplicación para que una ejecución sea repetible y un fallo sea diagnosticable.
- Congela el andamiaje. Registra checkpoint y cuantización, versión del runtime, límite de pasos, resolución de captura, entradas de accesibilidad, system prompt, conjunto de herramientas y política de reintentos.
- Mide resultados aceptados, no demostraciones. Sigue la tasa de finalización, las acciones erróneas silenciosas, los minutos de corrección humana y los pasos por tarea.
- Mide el presupuesto de serving. Captura memoria máxima en la concurrencia objetivo, latencia de prefill con prompts cargados de imágenes, velocidad de salida y degradación con sesiones en paralelo.
- Atácalo a propósito. Planta instrucciones inyectadas en los campos que tus usuarios pueden editar y verifica que el agente se niega y registra el intento.
- Compáralo con la base aburrida. Ejecuta un script determinista o una API existente sobre las mismas tareas. A veces el agente pierde, y ese es un resultado útil.
- Pon precio a la tarea aceptada. Incluye capacidad de GPU, ingeniería, monitorización, tiempo de revisión y ejecuciones fallidas, y compáralo con el coste manual de hoy.
Aprobar no es "el modelo funcionó". Aprobar es una tasa de finalización por encima del umbral de tu proceso, ninguna acción destructiva silenciosa en el conjunto adversario, un presupuesto de serving que aguanta con concurrencia real y un coste por tarea aceptada mejor que el statu quo.
El trabajo de cumplimiento que autoalojar no elimina
Mantener la inferencia en casa acorta la conversación de protección de datos. No termina la conversación del Reglamento de IA. Según la guía de transparencia de la Comisión Europea sobre el artículo 50, esas obligaciones aplican desde el 2 de agosto de 2026, con un periodo de gracia limitado hasta el 2 de diciembre de 2026 para el deber de marcado y detección en sistemas que ya estaban en el mercado antes de esa fecha. Los deberes del responsable del despliegue son reales pero concretos: informar a las personas expuestas a reconocimiento de emociones o categorización biométrica, y etiquetar deepfakes y textos generados por IA sobre asuntos de interés público publicados sin revisión editorial humana.
Dos puntos prácticos para un agente de pantalla. Primero, una automatización interna de back office a menudo no es un sistema del artículo 50, así que documenta el razonamiento en lugar de dar por hecha cualquiera de las dos respuestas. Segundo, modificar de forma sustancial un modelo de pesos abiertos puede desplazarte en la cadena de valor hacia deberes de proveedor, y eso se resuelve con asesoría legal antes del ajuste fino, no después. Nuestra checklist de ingeniería del artículo 50 cubre la parte de implementación, y nuestro trust center dice con claridad qué certificamos y qué no. Esto es orientación operativa, no asesoramiento jurídico.
Ayuda para IA en producción
Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.
Ruta de servicio:
Preguntas frecuentes
¿Qué es Qwen3.8-27B?
¿Puede Qwen3.8-27B operar un ordenador o un navegador?
¿Un agente de computer use autoalojado es mejor para el RGPD?
¿Qué hardware necesita Qwen3.8-27B?
¿Cuál es el mayor riesgo en un piloto de agente de pantalla?
¿Puede una empresa usar Qwen3.8-27B comercialmente?
Reflexiones finales
La automatización de pantalla ha sido la carga de trabajo en la que la respuesta de capacidad y la de cumplimiento apuntaban en direcciones opuestas: los modelos lo bastante buenos para operar un escritorio eran aquellos a los que no podías enviar tu escritorio.
Qwen3.8-27B cierra esa brecha lo suficiente para justificar un piloto real sobre un proceso real. Toma las cifras publicadas como motivo para probar, construye entornos de prueba en lugar de experimentar en sistemas en vivo, ataca tu propio agente antes de que lo haga otro y mantén a una persona delante de cada acción irreversible. Si aprueba, la automatización se queda dentro de tu red. Si no, lo sabrás en dos semanas en lugar de después del despliegue.
