Volver
Kevin Riedl

14 min de lectura · 19 de julio de 2026

Siguiente

NVIDIA Nemotron 3.5 ASR: ¿Está listo el STT self-hosted para agentes de voz?

NVIDIA Nemotron 3.5 ASR es un candidato serio para usar speech-to-text autoalojado en agentes de voz multilingües, pero el resumen viral exagera tres puntos. Cubre 40 locales de idioma, no 40 idiomas con la misma madurez. Los 80 ms son el tamaño mínimo de chunk de audio, no una latencia end-to-end garantizada. El checkpoint no cobra por minuto, pero GPU, redundancia, integración, monitorización y evaluación siguen costando dinero.

Esta review fue verificada el 19 de julio de 2026. Responde una decisión de compra concreta: ¿debe un equipo pilotar Nemotron 3.5 ASR como capa de transcripción para un producto multilingüe en tiempo real? No sustituye una comparación general de self-hosting de LLM ni un ranking completo del mercado ASR.

Afirmaciones sobre Nemotron 3.5 ASR, corregidas para una decisión de producción
AfirmaciónQué dice la fuente primariaInterpretación para el comprador
40 idiomas40 locales: 19 transcription-ready, 13 broad-coverage y 8 adaptation-ready32 transcriben out of the box; valida cada locale objetivo
80 ms de latencia80 ms es el chunk configurable mínimo sin lookahead de contexto derechoMide texto parcial, estable, token final y fin de turno en la pipeline completa
17 veces más streams240 frente a 14 streams concurrentes a 80 ms en una H100, comparado con Parakeet RNNT 1.1B en buffered streamingBenchmark potente del fabricante, no una ventaja 17x contra cualquier ASR
Cuesta 0 dólaresCheckpoint OpenMDW-1.1 sin facturación por llamadaNo hay factura de API del modelo; infraestructura y operaciones permanecen
Texto listo para producciónPuntuación y mayúsculas integradasÚtil, pero no sustituye diarización, turn detection, timestamps, redacción de PII ni evaluación de dominio

¿Necesita una decisión medida sobre arquitectura de voz con IA?

 Diseñar el piloto ASR

¿Qué es NVIDIA Nemotron 3.5 ASR?

Nemotron 3.5 ASR es un modelo multilingüe de reconocimiento automático del habla en streaming con 600 millones de parámetros. Usa un encoder FastConformer cache-aware de 24 capas, un decoder RNN-T y condicionamiento mediante prompt de idioma. Un solo checkpoint puede recibir el locale conocido o detectar automáticamente la lengua hablada.

La arquitectura es la parte comercialmente interesante. El buffered streaming suele recalcular contexto de audio solapado en cada paso. Nemotron guarda activaciones de self-attention y convolución, y procesa únicamente frames nuevos sin solapamiento. El paper sobre el Conformer con caché reporta menor latencia y tiempo de inferencia que su baseline con buffers, además de varios puntos de operación desde un único modelo multi-latency.

La model card oficial de NVIDIA ofrece chunks de 80, 160, 320, 560 y 1.120 ms. Indicar el idioma suele dar más precisión. En modo automático, el modelo puede añadir una etiqueta como <es-ES> a cada enunciado, útil cuando un mismo despliegue recibe tráfico en varios idiomas.

¿Transcribe realmente 40 idiomas?

Fue entrenado con 40 locales de idioma, pero solo 32 transcriben out of the box. NVIDIA los divide en tres niveles:

  • 19 locales transcription-ready: inglés, español, francés, italiano, portugués, neerlandés, alemán, turco, ruso, árabe, hindi, japonés, coreano, vietnamita y ucraniano, con las variantes regionales listadas.
  • 13 locales broad-coverage: polaco, sueco, checo, noruego bokmål, danés, búlgaro, finés, croata, eslovaco, mandarín, húngaro, rumano y estonio.
  • 8 locales adaptation-ready: griego, lituano, letón, maltés, esloveno, hebreo, tailandés y noruego nynorsk. El tokenizer los reconoce, pero NVIDIA exige fine-tuning para habilitar una transcripción completa.

Broad coverage tampoco significa calidad uniforme. En el benchmark FLEURS reportado por NVIDIA, a 80 ms y con idioma indicado, el WER medio fue 10,38% para el grupo transcription-ready y 25,86% para broad-coverage. Mandarín usa CER. Son resultados en datos públicos normalizados, no una prueba para llamadas a 8 kHz con acentos, ruido, voces solapadas, nombres de producto o direcciones.

Resultados FLEURS seleccionados y reportados por NVIDIA, menor es mejor
Locale80 ms, idioma conocido80 ms, autodetección1,12 s, idioma conocidoMétrica
Español4,875,044,11WER
Hindi8,1311,476,81WER
Inglés9,439,727,91WER
Alemán9,819,908,31WER
Árabe13,1713,4712,03WER
Mandarín20,5622,4519,28CER

¿80 ms significa que el transcript llega en 80 ms?

No. Ochenta milisegundos es el chunk mínimo de audio, no el tiempo total percibido por la persona. Con att_context_size=[56,0], el modelo consume un frame de 80 ms sin lookahead derecho. Después se suman captura, paquetes, red, cola, extracción de features, inferencia, reglas de estabilidad, voice activity detection, fin de turno, LLM y text-to-speech.

Un agente de voz debe medir cuatro relojes por separado:

  1. Primer transcript parcial: cuándo aparece texto utilizable.
  2. Transcript estable: cuándo el texto deja de cambiar lo suficiente para activar trabajo downstream.
  3. Latencia del token final: desde la última muestra de audio hasta el último token ASR.
  4. Latencia de fin de turno: hasta que el sistema decide con confianza que la persona terminó.

Un chunk de 320 ms puede ganar comercialmente si reduce errores, correcciones y tool calls falsos sin volver lenta la conversación. Compara la curva latencia-calidad, no solo el número menor.

¿Qué demuestra el rendimiento 17x en H100?

Demuestra que el streaming con caché puede hacer este checkpoint mucho más eficiente que el baseline buffered elegido por NVIDIA. A 80 ms, NVIDIA reporta 240 streams sostenibles en tiempo real en una H100 frente a 14 de Parakeet RNNT 1.1B, unas 17,1 veces más. A 1,12 segundos son 2.400 frente a 400, o 6x. Ambos datos proceden de una sola H100.

No demuestra 240 llamadas productivas por GPU en su sistema. Conversión de codec, VAD, diarización, logs, orquestación, multi-tenancy, tail latency, margen y failover consumen capacidad. Además, compara un modelo de 0,6B con otro de 1,1B y no prueba superioridad frente a Whisper, Deepgram, Speechmatics, Google o cualquier otro ASR de streaming.

¿Nemotron 3.5 ASR es realmente gratis?

El checkpoint no tiene coste variable por llamada. El servicio productivo sí tiene coste. La licencia OpenMDW-1.1 concede derechos amplios y gratuitos para usar, modificar y distribuir los materiales, con obligaciones sobre avisos y una cláusula de litigio de patentes y copyright. La model card lo declara apto para uso comercial y despliegue global.

"100% open source" sigue siendo impreciso. NVIDIA publica pesos y rutas de inferencia, pero lista datos propietarios de NVIDIA Riva junto a datasets públicos. La Open Source AI Definition requiere información suficiente sobre todos los datos y el código completo de entrenamiento e inferencia en la forma preferida para modificar el sistema. La descripción defendible es open-weight con una licencia comercial permisiva.

Calcule un suelo de coste antes de celebrar la desaparición de la API. Suponga una H100 hipotética a 3 dólares por hora de reloj y use el benchmark de 240 streams solo como techo:

Coste ilustrativo solo de GPU por hora de audio transcrita
Streams vivos mediosUso del techo de 240GPU por hora de audioQué falta
240100%0,0125 $Todo el overhead productivo y el margen
6025%0,05 $Redundancia, operaciones, almacenamiento y red
125%0,25 $Las mismas exclusiones
10,42%3,00 $Las mismas exclusiones

Es aritmética, no una oferta ni una previsión. Como referencia managed actual, Deepgram listaba Nova-3 Multilingual streaming a 0,0058 dólares por minuto, o 0,348 dólares por hora de audio, el 19 de julio de 2026. Con la GPU hipotética de 3 dólares, el suelo de break-even son unos nueve streams ocupados de forma continua. Dos GPUs para failover lo elevan a unos 18 antes de engineering y soporte. Una API managed también incluye capacidades y responsabilidad operativa ausentes en el checkpoint.

¿Cómo puede desplegarlo un equipo?

Hay tres rutas prácticas, con licencias y carga operativa diferentes:

  1. Hugging Face más NVIDIA NeMo. Cargue el checkpoint OpenMDW directamente, use el código cache-aware de NVIDIA y opere su propia capa de serving.
  2. Hugging Face Transformers. Transformers 5.13 añadió evaluación offline y streaming con locale conocido o autodetección. Es cómodo para pruebas e integración a medida.
  3. NVIDIA ASR NIM. NVIDIA empaqueta el modelo multilingüe en un contenedor acelerado por GPU con APIs gRPC y HTTP. La guía oficial de NIM usa type=multi. NIM tiene términos separados para contenedor y modelo. No traslade sin revisión la conclusión de licencia del checkpoint.

La matriz actual de ASR NIM exige una GPU NVIDIA con compute capability 8.0 o superior y al menos 16 GB de VRAM. El perfil multilingüe de Nemotron lista unos 6 GB con batch size 32 y 14,6 GB con batch size 64. El hardware NIM compatible incluye A30, A100, H100, varias GPU A-Series, L4, L40 y tarjetas GeForce RTX recientes. La model card del checkpoint menciona también arquitecturas anteriores y Jetson, pero la capacidad productiva debe medirse sobre el runtime y dispositivo exactos.

Nemotron 3.5 ASR vs Whisper vs una API de streaming

Qué ruta de transcripción debe entrar en el piloto
OpciónMejor motivo para probarTrade-off principalEmpiece aquí cuando
Nemotron 3.5 ASRStreaming nativo, un checkpoint multilingüe, alta concurrencia reportada y datos localesCalidad desigual por locale y menos features turnkeyLatencia de voz, control de datos y carga sostenida son centrales
OpenAI Whisper e implementaciones rápidasEcosistema maduro, baseline multilingüe amplio, licencia MIT y variantes de transcripción y traducciónWhisper oficial procesa ventanas deslizantes de 30 segundos y no es una arquitectura nativa de streaming low-latencyBatch, amplitud de idiomas o madurez importan más que la latencia de turno
API managed de streamingIntegración rápida, SLA, escalado, observabilidad y funciones como diarización o redacciónCoste por minuto, dependencia y ruta externa de datosEl volumen es bajo o variable y la velocidad operativa manda

El repositorio oficial de Whisper describe una transcripción estándar con ventanas deslizantes de 30 segundos. Los wrappers pueden presentarlo como streaming, pero el patrón de cómputo difiere de un RNN-T cache-aware entrenado para streaming. Un ASR managed para agentes también puede integrar detección de turno. Por ejemplo, Deepgram documenta end-of-turn nativo en Flux, algo que el checkpoint base de Nemotron no afirma ofrecer.

¿Qué falta en la historia de coste cero?

El checkpoint devuelve texto con mayúsculas, puntuación y una etiqueta opcional de idioma. Un sistema de voz productivo puede necesitar además:

  • voice activity detection y fin de turno fiable;
  • diarización o canales de telefonía separados;
  • timestamps por palabra, política de confianza y reglas de estabilidad;
  • resampling de telefonía a 8 kHz, codecs, jitter buffer y reconexión;
  • evaluación de vocabulario para nombres, SKU, direcciones y términos regulados;
  • redacción de PII, consentimiento, retención, borrado, acceso y audit logs;
  • autoscaling, backpressure, failover, monitorización y degradación segura;
  • una capa de traducción si el texto debe salir en otro idioma.

El self-hosting puede mantener el audio en infraestructura controlada, pero no hace legal la grabación ni vuelve el sistema conforme al RGPD por sí solo. Defina personas, propósito, aviso, consentimiento u otra base jurídica, almacenamiento, acceso de soporte, borrado y revisión humana antes de procesar llamadas reales.

¿Quién debería pilotar Nemotron 3.5 ASR?

Pruébelo cuando necesite transcripción multilingüe de baja latencia, espere concurrencia sostenida suficiente para ocupar una GPU, deba controlar la ruta del audio, pueda operar infraestructura NVIDIA y tenga capacidad para evaluar cada locale con audio real.

Empiece con una API managed cuando el tráfico sea bajo o impredecible, necesite SLA y soporte de inmediato, requiera turn detection, diarización, timestamps, redacción o vocabulario turnkey, o no quiera asumir Speech MLOps. Para un caso solo en inglés, NVIDIA recomienda el checkpoint separado Nemotron 3 ASR English.

¿Cómo se mide un piloto de producción?

  1. Congele la decisión. Un caso de uso, dos locales, un proveedor actual y de 200 a 500 enunciados representativos por locale.
  2. Reproduzca el audio productivo. Codecs reales, 8 kHz si aplica, ruido, acentos, interrupciones, silencio, nombres, números y términos de dominio.
  3. Pruebe tres chunks. Empiece con 80, 320 y 1.120 ms. Mida WER o CER, primer parcial, texto estable, token final y fin de turno.
  4. Compare idioma conocido y automático. La autodetección simplifica routing, pero puede perder precisión. Incluya frases cortas y cambios de idioma.
  5. Cargue la pipeline real. Aumente streams hasta que P95, memoria, cola o precisión incumplan el SLO.
  6. Fuerce fallos. Mate un worker, pierda paquetes, reconecte, envíe audio inválido y verifique backpressure, retries y aislamiento entre tenants.
  7. Calcule el minuto aceptado. Incluya GPU idle, segunda réplica, ingeniería, observabilidad, almacenamiento, revisión y coste de errores.
  8. Aplique un gate. Pase a producción solo si el camino self-hosted gana al managed en la restricción que paga la migración sin abrir un hueco de calidad o fiabilidad.

El servicio de AI Enablement de Wavect cubre selección de workload, evaluación de voz y modelos, arquitectura, observabilidad, production hardening y traspaso. El caso Twinsoft AI muestra la misma lección: el sistema que rodea al modelo decide si el piloto crea valor. Nuestra guía para elegir stack tecnológico ayuda a encuadrar la decisión build versus buy.

Preguntas frecuentes sobre Nemotron 3.5 ASR

¿NVIDIA Nemotron 3.5 ASR es open source?

La descripción precisa es open-weight bajo OpenMDW-1.1. La licencia permite ampliamente uso comercial, modificación y distribución, pero NVIDIA no publica todos los datos propietarios ni la pipeline completa de entrenamiento que exige la Open Source AI Definition.

¿Nemotron 3.5 ASR soporta 40 idiomas out of the box?

No. NVIDIA lista 40 locales: 19 transcription-ready, 13 broad-coverage y 8 adaptation-ready que necesitan fine-tuning para transcripción completa. Valide cada idioma, acento, dominio y canal.

¿La latencia de Nemotron 3.5 ASR es realmente 80 ms?

El chunk mínimo de audio es 80 ms sin lookahead derecho. No es la latencia total del transcript ni del agente. Mida primer parcial, texto estable, token final, fin de turno, red, LLM y TTS por separado.

¿Cuántos streams ejecuta Nemotron 3.5 ASR en una H100?

NVIDIA reporta unos 240 streams sostenibles a 80 ms en una H100, frente a 14 de su baseline Parakeet RNNT 1.1B con buffers. Trate 240 como un techo del benchmark y pruebe la pipeline completa con margen productivo.

¿Nemotron 3.5 ASR es gratis para uso comercial?

El checkpoint OpenMDW-1.1 no cobra por llamada y NVIDIA lo declara listo para uso comercial. Sigue pagando GPU, redundancia, ingeniería, monitorización, almacenamiento, evaluación y soporte. NVIDIA NIM tiene términos separados.

¿Nemotron 3.5 ASR es mejor que Whisper para agentes de voz?

Su arquitectura es mejor punto de partida para streaming nativo de baja latencia. Whisper tiene un ecosistema más amplio y maduro, y sigue siendo un buen baseline batch y multilingüe. Compárelos con su audio, objetivo de latencia, idiomas, features y coste total.

Reflexiones finales

Nemotron 3.5 ASR merece un piloto de producción. Un modelo cache-aware de 600 millones de parámetros, un checkpoint para tráfico multilingüe, detección automática, puntuación nativa y 240 streams H100 reportados crean un caso creíble de coste y latencia para agentes de voz, subtítulos y llamadas.

El business case no dice que speech-to-text cueste cero. Dice que el coste marginal del modelo puede desaparecer cuando volumen sostenido, control de datos y baja latencia justifican operar el stack. Mantenga las afirmaciones exactas: 40 locales, 32 out of the box, chunks de 80 ms en lugar de latencia end-to-end garantizada y 17x frente a un baseline buffered de NVIDIA. Mida una pipeline multilingüe completa con audio productivo antes de comprar hardware o sustituir una API managed.

Volver
Kevin Riedl

14 min de lectura · 19 de julio de 2026

Siguiente

Construye el producto, no solo el backlog

Si este artículo conecta con una decisión real de producto, Wavect puede ayudarte a definir, construir, endurecer o liderar el trabajo de software con criterio senior de founder.

Rutas de servicio útiles: