Asistente de programación con IA local multimodal: voz, OCR y arquitectura de privacidad
Un asistente de programación con IA local multimodal no es un gran modelo con micrófono. Es una cadena controlada: un modelo de voz transcribe la intención, un modelo de OCR o visión lee regiones seleccionadas de la pantalla, un modelo de razonamiento planifica el cambio y un intermediario limita el acceso al editor, terminal y repositorio. El valor empresarial no está en repetir “cero nube”. Está en tener un flujo de datos que se pueda inspeccionar, probar y mantener dentro de un límite aprobado.
Esta guía responde a la pregunta de integración que plantea un setup viral con DeepSeek V4 Flash, NVIDIA Nemotron 3.5 ASR, GLM-OCR y un HP ZGX Nano con NVIDIA GB10. No repite nuestro análisis de hardware y cuantización para DeepSeek V4 Flash, la review de producción de Nemotron 3.5 ASR ni la guía de compra de agentes de programación multimodelo. Aquí explicamos cómo encajan esas capacidades en un flujo privado, dónde fallan las promesas de privacidad y qué debe verificar una empresa antes de comprar hardware.
¿Qué es un asistente de programación con IA local multimodal?
Es un sistema que acepta algo más que texto escrito y ejecuta inferencia en infraestructura bajo tu control. La voz se convierte en texto, las imágenes elegidas en observaciones estructuradas y el contexto del repositorio en un conjunto acotado de evidencias. Solo entonces el modelo de razonamiento puede proponer o solicitar una acción de desarrollo.
| Rol | Ejemplo del setup viral | Responsabilidad en producción |
|---|---|---|
| Oídos | Nemotron 3.5 ASR 0.6B | Procesar voz en local, conservar términos técnicos y exponer incertidumbre. |
| Ojos | GLM-OCR 0.9B | Leer una captura, log o diagrama elegido sin acceso permanente a toda la pantalla. |
| Cerebro | DeepSeek V4 Flash | Combinar intención y evidencia, planificar y solicitar herramientas limitadas. |
| Corazón | HP ZGX Nano, NVIDIA GB10 | Aportar memoria unificada, runtimes, almacenamiento, aislamiento y capacidad local previsible. |
| Sistema nervioso | Extensión de IDE y servicios locales | Enrutar datos, aplicar permisos, registrar decisiones y detener acciones inseguras. |
La última fila suele faltar en las demos. Los modelos no deciden qué ventana se captura, si puede ejecutarse un comando ni dónde se guardan las transcripciones. Eso lo decide la integración. Trátala como un producto sensible a la seguridad, no como código de pegamento.
¿Son correctas las afirmaciones del setup de LinkedIn?
Los componentes son plausibles, pero “100 % local” debe comprobarse a nivel de sistema. Las fuentes primarias admiten despliegue local para cada familia. No demuestran que una extensión concreta de VS Code, el servicio de actualizaciones, la telemetría, el instalador o los registros no usen la red.
| Afirmación | Qué respaldan las fuentes | Qué falta por demostrar |
|---|---|---|
| Nemotron 3.5 ASR es un modelo de voz local de 0.6B | NVIDIA lista un checkpoint de streaming de 0.6B para 40 configuraciones regionales. | Precisión con tus acentos, términos de código, micrófonos y objetivo de latencia. |
| GLM-OCR es un lector visual local de 0.9B | Z.ai documenta 0.9B parámetros y autoalojamiento con vLLM o SGLang. | Precisión en terminales, interfaz del IDE, fuentes pequeñas y capturas adversarias. |
| DeepSeek V4 Flash puede ejecutarse en local | DeepSeek publica pesos MIT e instrucciones de serving local. | Revisión 0731 exacta, cuantización, contexto, velocidad y tasa de aceptación en un GB10. |
| Un ZGX GB10 puede alojar el flujo | HP especifica el ZGX Nano con GB10 y 128 GB de memoria unificada coherente. | Que el razonamiento, contexto, modelos pequeños e IDE sigan respondiendo juntos. |
| Cero llamadas a la nube | Ninguna ficha de modelo puede probar esta propiedad del sistema. | Tráfico saliente, DNS, telemetría, actualizaciones, errores, conectores y copias. |
También existe una trampa de versiones. La identificación pública oficial actual es deepseek-ai/DeepSeek-V4-Flash, mientras “0731” describe una versión fechada en conversaciones de la comunidad. Un manifiesto de producción debe fijar una revisión o digest, no confiar en un nombre móvil.
Arquitectura de referencia en siete etapas acotadas
- Captura: acepta audio mediante pulsar para hablar o una región de pantalla elegida. No grabes continuamente la sala o el escritorio por defecto.
- Percepción: transcribe audio y extrae texto o diseño de la imagen en servicios locales separados.
- Normalización: conserva la evidencia bruta solo el tiempo necesario y entrega campos estructurados como intención, archivo, error y confianza.
- Cuarentena: marca OCR, logs, páginas y código como datos no confiables. No mezcles sus instrucciones con la política del sistema.
- Razonamiento: entrega al planificador el mínimo contexto necesario para proponer el cambio y sus pruebas.
- Autorización: pasa cada acción de editor o terminal por una política determinista y solicita aprobación cuando cruza un límite.
- Verificación: ejecuta pruebas, inspecciona el diff, registra versiones y acepta o revierte el cambio.
Esta separación permite sustituir modelos. Un mejor ASR no necesita nuevos permisos. Un OCR más pequeño no obtiene acceso al terminal. Un nuevo modelo de razonamiento recibe las mismas observaciones estructuradas y los mismos criterios de aceptación.
¿Por qué usar modelos pequeños y especializados?
Los modelos de percepción pequeños reducen latencia, presión de memoria y exposición de datos cuando la tarea está bien delimitada. El modelo de voz no necesita escribir en el repositorio. El OCR no necesita ver toda la pantalla. Ambos devuelven un resultado reducido y revisable al orquestador.
Eso no garantiza precisión. Crea evaluaciones específicas:
- audios con nombres de librerías, rutas, siglas, idiomas mezclados y ruido;
- capturas de terminal con letra pequeña, trazas partidas, temas oscuros y líneas truncadas;
- diagnósticos del IDE donde color, icono o posición alteran el significado;
- capturas con instrucciones visibles u ocultas que intentan redirigir al agente;
- casos en los que la respuesta correcta es “no estoy seguro, pregunta”.
Consulta la review específica de Nemotron para niveles de idioma, límites de streaming y alternativas. Usa el análisis de DeepSeek para memoria y cuantización. Sumar cifras de fichas técnicas no sustituye probar el flujo combinado.
Cómo demostrar “cero llamadas a la nube”
La inferencia offline es una propiedad del comportamiento de red medido y de la configuración, no una etiqueta. Visual Studio Code documenta conexiones para actualizaciones, marketplace, sincronización y telemetría. Su guía de red lista los servicios y la guía de telemetría explica cómo desactivarla. Microsoft también advierte que algunas extensiones tienen comportamiento propio.
Una prueba defendible debe:
- partir de un inventario con versiones fijadas de modelos y extensiones;
- desactivar sincronización, telemetría, actualizaciones automáticas y extensiones innecesarias;
- bloquear tráfico saliente por defecto y permitir solo destinos necesarios;
- capturar DNS y flujos durante voz, OCR, planificación, edición, pruebas y fallos;
- revisar logs, informes de error, retención de transcripciones, cachés y copias;
- repetir después de cada actualización;
- publicar el límite real: offline, solo local, híbrido o asistido por nube.
“No entrenar con tus datos”, “retención cero” y “sin transferencia” son compromisos distintos. Algunos servicios empresariales ofrecen controles contractuales. Anthropic documenta acuerdos de retención cero para clientes API elegibles. La ejecución local puede seguir siendo la mejor decisión, pero conviene comparar flujos verificables, contratos, capacidad y coste, no tratar toda nube como igual.
Local no elimina el riesgo de seguridad
Un agente local puede filtrar secretos, borrar archivos o ejecutar instrucciones hostiles sin enviar prompts al proveedor. El riesgo se desplaza hacia el endpoint, la cadena de suministro, la autorización de herramientas y la recuperación.
- Trata el OCR como entrada hostil. La guía de OWASP sobre prompt injection cubre instrucciones multimodales ocultas y recomienda privilegio mínimo, control de acciones y aprobación humana.
- Verifica cada artefacto descargado. La guía de cadena de suministro LLM de OWASP cubre modelos, adaptadores, paquetes, licencias y componentes obsoletos.
Ejecuta la integración bajo otra identidad del sistema o contenedor cuando sea viable. Monta solo el worktree activo, permite pocos comandos, mantiene secretos fuera del entorno legible y exige revisión antes de commits, pushes, despliegues o acciones destructivas.
¿Cabe todo en un GB10 con 128 GB?
Los dos modelos de percepción son pequeños. La cuantización de DeepSeek y el contexto deciden el margen. Un ASR de 0.6B y un OCR de 0.9B son modestos frente a un modelo mixture-of-experts de 284B parámetros totales. Cuantizaciones agresivas pueden caber en 128 GB, pero el sistema, runtime, estado de contexto, buffers, IDE y servicios concurrentes necesitan memoria.
- Residente: mantén todos los modelos cargados después de medir el pico de memoria.
- Por etapas: mantén ASR y razonamiento residentes y carga OCR solo para una captura explícita.
- Dividido: mueve la percepción a otro dispositivo aprobado si memoria o latencia perjudican al modelo principal.
No compres una estación porque los pesos cargan una vez. Mide tiempo al primer token, parciales de voz, OCR, viajes de herramientas, temperatura y éxito durante una sesión realista. Nuestro marco de rentabilidad de modelos locales frente a API cubre amortización, utilización, energía e ingeniería sin duplicar aquí la intención de TCO.
¿Construir, comprar o usar un enfoque híbrido?
| Opción | Mejor encaje | Ventaja | Coste principal |
|---|---|---|---|
| Montar un stack local abierto | Equipo experto, límite estricto, flujo estable | Máximo control y sustitución | Integración, evaluación, parches y soporte |
| Comprar producto on-prem gestionado | Empresa que necesita soporte y despliegue central | Gobierno rápido y responsabilidad del proveedor | Licencia y menor libertad |
| Híbrido local más API aprobada | Carga variable, fallback avanzado, modalidades distintas | Privacidad local con capacidad bajo demanda | Reglas y dos límites de datos |
| Cloud-first con controles enterprise | Poco uso, adopción rápida, contrato sólido | Sin flota ni operaciones locales | Transferencia, dependencia y gasto recurrente |
La respuesta depende de la clasificación de datos y el coste del error. La Comisión Europea destaca minimización, integridad y confidencialidad. Procesar en local puede ayudar, pero no sustituye finalidad, acceso, retención ni gestión de incidentes.
Ayuda para IA en producción
Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.
Ruta de servicio:
Plan de 30 días para un asistente privado
- Días 1 a 5: elige un repositorio, un flujo, datos prohibidos, herramientas permitidas y objetivo offline o híbrido.
- Días 6 a 10: prueba al menos 50 audios y 50 capturas representativas. Registra precisión, incertidumbre y latencia.
- Días 11 a 15: integra en modo de solo lectura para explicar código, errores y parches sin escribir ni ejecutar.
- Días 16 a 20: habilita cambios en worktrees y una lista pequeña de comandos de prueba con revisión y rollback.
- Días 21 a 25: bloquea salida, captura tráfico, revisa logs y prueba prompt injection por audio, imágenes, archivos y herramientas.
- Días 26 a 30: compara aceptación, ciclo, revisión, incidentes y coste con el flujo actual.
El contexto importa más que la modalidad llamativa. Instrucciones del repositorio, mapas de arquitectura y pruebas fiables determinan si el modelo actúa con seguridad. Nuestro análisis los agentes de programación necesitan contexto, no solo inteligencia explica cómo preparar ese entorno.
Cuadro de mando del piloto
- Aceptación de tareas: cambios aceptados sin segundo intento.
- Precisión de intención hablada: intención correcta, no solo tasa de palabras.
- Evidencia OCR: error, archivo, línea y diseño correctos.
- Latencia completa: desde voz o captura hasta propuesta revisable.
- Acciones inseguras: solicitudes denegadas, fuera de alcance o con aprobación.
- Límite de red: conexiones DNS o salientes inesperadas.
- Minutos de revisión: tiempo humano por cambio aceptado.
- Coste por tarea aceptada: hardware, energía, mantenimiento, reintentos y personas.
Los recursos del AI Risk Management Framework de NIST enfatizan prueba, evaluación, verificación y validación durante todo el ciclo. También se aplica a agentes locales. Una demo demuestra posibilidad, no preparación para producción.
Qué puede implementar Wavect
Wavect convierte una demo local en una plataforma medible: selección de carga y hardware, serving, integración con VS Code, controles de captura, autorización, worktrees, evaluaciones, pruebas de privacidad, observabilidad y fallback híbrido. Empieza con nuestro servicio de consultoría e implementación de IA para diseñar el sistema, o con AI Enablement para un piloto acotado y despliegue interno.
El primer proyecto debe responder una pregunta comercial: ¿cumple el flujo los objetivos de calidad, privacidad y latencia con un coste ajustado al riesgo menor que la alternativa aprobada? No debería empezar comprando una flota ni prometiendo “poseer la IA”.
Fuentes y vigencia
Verificamos tamaño, licencia y despliegue el 5 de agosto de 2026 con NVIDIA NeMo, el repositorio GLM-OCR de Z.ai y la ficha oficial de DeepSeek. Las especificaciones ZGX proceden de HP QuickSpecs. Red y telemetría proceden de VS Code. Los controles de seguridad son de OWASP, los principios de privacidad de la Comisión Europea y la evaluación de NIST. Wavect no realizó un benchmark independiente del stack exacto. Los informes de la comunidad aportaron la pregunta, no la evidencia de rendimiento.
Preguntas frecuentes
¿Qué es un asistente de programación con IA local multimodal?
Acepta entradas como voz y capturas elegidas, las procesa en infraestructura controlada y dirige el resultado a un modelo de razonamiento y herramientas limitadas. Captura, permisos, registros y verificación completan la arquitectura.
¿Nemotron 3.5 ASR y GLM-OCR pueden ejecutarse en local?
Sí. NVIDIA publica Nemotron 3.5 ASR como checkpoint de streaming de 0.6B y Z.ai documenta el autoalojamiento de GLM-OCR con 0.9B. Mide tus idiomas, micrófonos, temas, fuentes y latencia.
¿DeepSeek V4 Flash con voz y OCR cabe en un GB10?
Es plausible con cuantización agresiva y contexto controlado porque voz y OCR son pequeños. Demuestra margen de memoria, temperatura y latencia completa en el artefacto exacto.
¿Los modelos locales garantizan retención cero?
No. Eliminan la petición al proveedor del modelo, pero IDE, extensiones, telemetría, logs, errores, copias y conectores aún pueden almacenar o enviar datos.
¿Un asistente local cumple el RGPD?
Puede reducir transferencias y apoyar la minimización, pero la ubicación no establece cumplimiento. Define finalidad, acceso, retención, seguridad, responsabilidades e incidentes.
¿Cómo se protege el OCR de un agente de programación?
Trata el texto extraído como datos no confiables, sepáralo de instrucciones del sistema, limita la captura a zonas elegidas y revisa cada acción contra la tarea original.
¿Debe una empresa construir o comprar un asistente privado?
Construye si el flujo te diferencia y puedes operar integración, evaluación y seguridad. Compra si soporte y gobierno importan más. Usa híbrido si lo local cubre trabajo sensible y la nube aprobada aporta capacidades valiosas.
Reflexiones finales
La idea potente del setup viral no es que cuatro componentes modernos quepan en una estación pequeña. Es que percepción, razonamiento y acción pueden separarse, medirse y mantenerse dentro de un límite controlado.
Controla el flujo de datos, las versiones, los permisos, las evaluaciones y la salida. Entonces la IA local se convierte en una propiedad verificable que seguridad puede auditar y finanzas puede calcular.
¿Necesitas un piloto privado de voz y visión con criterios medibles de privacidad, calidad y coste?
Diseñar el piloto de IA local