NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?
NVIDIA Nemotron 3.5 ASR 值得进入多语言语音智能体的自托管语音转文字候选名单,但社交媒体上的说法夸大了三点。它覆盖的是 40 个 language-locale,并非 40 种质量相同、开箱即用的语言。80 ms 指最小音频 chunk,不是完整端到端延迟保证。Checkpoint 不按分钟收 API 费,但 GPU、冗余、集成、监控与评估仍然需要成本。
本文信息核验于 2026 年 7 月 19 日,只回答一个明确的采购问题:团队是否应把 Nemotron 3.5 ASR 作为实时多语言产品的转录层来试点?本文不替代通用 LLM 自托管成本比较,也不是整个 ASR 市场排行榜。
| 说法 | 一手资料的准确表述 | 采购方应如何理解 |
|---|---|---|
| 支持 40 种语言 | 40 个 locale:19 个 transcription-ready、13 个 broad-coverage、8 个 adaptation-ready | 32 个可开箱转录;每个目标 locale 都要单独验证 |
| 延迟 80 ms | 80 ms 是无右侧上下文 lookahead 的最小可配置音频 chunk | 在完整 pipeline 中分别测 partial、stable、final token 与 end of turn |
| 并发高 17 倍 | 一张 H100 在 80 ms 下为 240 路,对比 Parakeet RNNT 1.1B buffered streaming 的 14 路 | 这是有价值的厂商 benchmark,不代表比所有 ASR 都快 17 倍 |
| 成本为 0 | OpenMDW-1.1 checkpoint 不按调用收费 | 没有模型 API 账单,仍有基础设施与运营成本 |
| 输出可直接生产使用 | 内置标点与大小写 | 不等于具备说话人分离、轮次检测、时间戳、PII 脱敏与领域评测 |
需要用实测数据决定语音 AI 架构?
设计 ASR 试点NVIDIA Nemotron 3.5 ASR 是什么?
Nemotron 3.5 ASR 是一个拥有 6 亿参数的多语言流式自动语音识别模型。它由 24 层 cache-aware FastConformer encoder、RNN-T decoder 和语言 ID prompt conditioning 组成。同一 checkpoint 可以接收已知 locale,也可以自动识别输入语言。
真正有商业价值的是架构。Buffered streaming 通常会在每一步重复计算重叠的音频上下文。Nemotron 缓存 self-attention 与 convolution activation,只处理新的非重叠 frame。底层的 cache-aware Conformer 论文显示,相比其 buffered baseline,这种设计能降低延迟与推理时间,而且一个 multi-latency 模型可提供多个运行点。
NVIDIA 官方 model card提供 80、160、320、560 和 1,120 ms 五种 chunk。已知语言通常更准确。Auto 模式可以在每个 utterance 后附加 <zh-CN> 等 locale tag,适合一套部署接收多语言流量。
它真的支持 40 种语言吗?
模型在 40 个语言 locale 上训练,但只有 32 个可开箱转录。NVIDIA 把它们分为三层:
- 19 个 transcription-ready locale:英语、西班牙语、法语、意大利语、葡萄牙语、荷兰语、德语、土耳其语、俄语、阿拉伯语、印地语、日语、韩语、越南语和乌克兰语,其中部分包含区域变体。
- 13 个 broad-coverage locale:波兰语、瑞典语、捷克语、挪威博克马尔语、丹麦语、保加利亚语、芬兰语、克罗地亚语、斯洛伐克语、普通话、匈牙利语、罗马尼亚语和爱沙尼亚语。
- 8 个 adaptation-ready locale:希腊语、立陶宛语、拉脱维亚语、马耳他语、斯洛文尼亚语、希伯来语、泰语和新挪威语。Tokenizer 能识别它们,但 NVIDIA 表示需要 fine-tuning 才能完整转录。
Broad coverage 也不代表质量相同。在 NVIDIA 自报的 FLEURS 测试中,给定语言 ID、80 ms 设置下,transcription-ready 组平均 WER 为 10.38%,broad-coverage 组为 25.86%。普通话使用 CER。该测试基于规范化公开数据,不足以证明模型能处理带口音的 8 kHz 电话、多人重叠说话、产品名、地址或你的真实声学环境。
| Locale | 80 ms,已知语言 | 80 ms,自动识别 | 1.12 s,已知语言 | 指标 |
|---|---|---|---|---|
| 西班牙语 | 4.87 | 5.04 | 4.11 | WER |
| 印地语 | 8.13 | 11.47 | 6.81 | WER |
| 英语 | 9.43 | 9.72 | 7.91 | WER |
| 德语 | 9.81 | 9.90 | 8.31 | WER |
| 阿拉伯语 | 13.17 | 13.47 | 12.03 | WER |
| 普通话 | 20.56 | 22.45 | 19.28 | CER |
80 ms 是否表示转录会在 80 ms 内返回?
不是。80 ms 是最小音频 chunk,并非用户感受到的完整响应时间。使用 att_context_size=[56,0] 时,模型处理一个 80 ms frame,不查看右侧未来上下文。完整系统还要计算音频采集、分包、网络、排队、feature extraction、推理、稳定性策略、VAD、end-of-turn、LLM 与 TTS。
语音智能体至少要分开记录四个时间:
- 首个 partial transcript:第一段可用文本何时出现。
- Stable transcript:文本何时稳定到可以安全触发下游任务。
- Final-token latency:从最后一个音频 sample 到最终 ASR token。
- End-of-turn latency:系统何时能确认用户已经说完。
如果 320 ms 能减少错误、人工修正和误触发工具,同时保持对话流畅,它可能比 80 ms 更有商业价值。应测试延迟与质量曲线,而不是只追求最小数字。
H100 并发高 17 倍能证明什么?
它证明 cache-aware streaming 可以让该 checkpoint 比 NVIDIA 选择的 buffered baseline 更节省算力。在 80 ms 设置下,NVIDIA 报告一张 H100 可持续处理 240 路实时流,Parakeet RNNT 1.1B 为 14 路,约 17.1 倍。在 1.12 秒设置下,两者为 2,400 对 400,约 6 倍。
这并不等于你的完整系统每张 GPU 可以稳定承载 240 通生产电话。Codec 转换、VAD、说话人分离、日志、编排、多租户、尾延迟、容量余量与故障切换都会消耗资源。比较对象还是 0.6B 与 1.1B 两种不同规模模型,不能推导出它优于 Whisper、Deepgram、Speechmatics、Google 或所有其他流式 ASR。
Nemotron 3.5 ASR 真的免费吗?
Checkpoint 没有按调用计费,但生产服务不可能零成本。OpenMDW-1.1 许可证免费授予使用、修改与分发 Model Materials 的广泛权利,但需保留许可证与来源声明,并包含专利和版权诉讼条款。Model card 表示该模型可用于商业用途并支持全球部署。
称其为“100% 开源”仍不准确。NVIDIA 公开了权重和推理路径,但训练数据包含专有的 NVIDIA Riva 数据集。Open Source AI Definition要求足够详细的训练数据说明,以及用于训练和运行系统的完整代码。更稳妥的描述是:采用宽松商业模型许可证的 open-weight 模型。
在庆祝没有 API 账单前,先计算基础成本。假设一张 H100 每个 wall-clock 小时 3 美元,并把 NVIDIA 的 240 路 benchmark 仅视为上限:
| 平均实时流 | 240 路上限利用率 | 每音频小时 GPU 成本 | 未计入 |
|---|---|---|---|
| 240 | 100% | 0.0125 美元 | 全部生产开销与容量余量 |
| 60 | 25% | 0.05 美元 | 冗余、运维、存储与网络 |
| 12 | 5% | 0.25 美元 | 同上 |
| 1 | 0.42% | 3.00 美元 | 同上 |
这只是算术示例,不是报价或预测。作为当前托管方案参考,Deepgram 在 2026 年 7 月 19 日把 Nova-3 Multilingual streaming 标为每分钟 0.0058 美元,即每音频小时 0.348 美元。在假设的 3 美元 GPU 成本下,未计其他费用的 break-even 约为持续占用 9 路。若用两张 GPU 做 failover,则约为 18 路,且还没有计入工程和支持。托管 API 同时包含基础 checkpoint 没有的能力与运营责任。
团队可以怎样部署?
有三条实用路径,各自许可证和运维负担不同:
- Hugging Face 加 NVIDIA NeMo。直接加载 OpenMDW checkpoint,使用 NVIDIA cache-aware streaming 代码,自行构建 serving layer。
- Hugging Face Transformers。Transformers 5.13 起支持该模型的离线与流式生成,可给定 locale 或自动检测,适合评估和自定义集成。
- NVIDIA ASR NIM。NVIDIA 已把多语言版本装入 GPU 加速容器,并提供 gRPC 与 HTTP API。官方 NIM 部署指南使用
type=multi。NIM 容器与模型有单独条款,不应把 checkpoint 的许可证结论直接套到整个容器。
当前 ASR NIM 支持矩阵要求 NVIDIA GPU 的 compute capability 至少为 8.0,物理显存至少 16 GB。Nemotron 多语言 profile 自身在 batch size 32 时列出约 6 GB,batch size 64 时约 14.6 GB。NIM 支持 A30、A100、H100、部分 A 系列推理卡、L4、L40 与近期 GeForce RTX。原始 model card 还列出更早的 NVIDIA 架构和 Jetson,但生产容量必须在目标 runtime 与设备上实测。
Nemotron 3.5 ASR、Whisper 与托管流式 API 怎么选?
| 方案 | 最值得测试的理由 | 主要取舍 | 优先选择条件 |
|---|---|---|---|
| Nemotron 3.5 ASR | 原生流式、单一多语言 checkpoint、高并发厂商数据、本地数据路径 | 各 locale 质量差异大,现成功能层较薄 | 语音延迟、数据控制与持续并发最重要 |
| OpenAI Whisper 及其加速实现 | 生态成熟、语言覆盖广、MIT 许可证、转录与翻译变体 | 官方 Whisper 使用滑动 30 秒窗口,不是原生低延迟流式架构 | 批量文件、广泛语言覆盖或生态成熟度比轮次延迟更重要 |
| 托管流式 API | 集成快、SLA、扩缩容、可观测性,以及说话人分离或脱敏等功能 | 按分钟收费、供应商依赖与外部数据路径 | 流量低或波动大,且上线速度最重要 |
Whisper 官方仓库说明标准转录会使用滑动 30 秒窗口。第三方 wrapper 可以让它表现为增量输出,但算力模式不同于为流式训练的 cache-aware RNN-T。面向语音智能体的托管 ASR 还可能内置轮次检测。例如,Deepgram 文档说明 Flux 具有模型原生 end-of-turn,而 Nemotron 基础 checkpoint 没有这项声明。
“0 美元模型”故事遗漏了什么?
Checkpoint 输出带标点、大小写与可选语言 tag 的文本。生产语音系统还可能需要:
- VAD 与可靠的 end-of-turn 检测;
- 说话人分离或独立电话通道;
- 词级时间戳、置信度策略与 transcript 稳定性规则;
- 8 kHz 电话重采样、codec、jitter buffer 与断线重连;
- 姓名、SKU、地址和受监管术语的领域词汇评估;
- PII 脱敏、告知与同意、保留、删除、权限和审计日志;
- 自动扩缩容、backpressure、failover、监控与安全降级;
- 当输出语言需要改变时使用独立翻译层。
自托管可以把音频留在受控基础设施中,但不会自动让录音合法,也不会自动满足 GDPR 或其他隐私要求。处理真实客户通话前,应明确数据主体、目的、告知、同意或其他合法基础、存储、支持访问、删除与人工复核。
哪些团队现在适合试点 Nemotron 3.5 ASR?
当你需要低延迟多语言转录,有足够稳定并发来利用 GPU,需要控制音频数据路径,可以运营 NVIDIA 基础设施,并能用真实音频分别评估每个目标 locale 时,值得试点。
如果流量很低或波动大,需要立即获得 SLA 与支持,需要开箱即用的轮次检测、说话人分离、时间戳、脱敏或词汇控制,或者团队不想承担 Speech MLOps,应先用托管 API。对于纯英语场景,NVIDIA 自己建议使用单独的 Nemotron 3 ASR 英语 checkpoint。
生产试点应怎样衡量?
- 固定决策范围。选择一个用例、两个目标 locale、一个现有方案,每个 locale 准备 200 到 500 条代表性 utterance。
- 复现生产音频。包括真实 codec、需要时使用 8 kHz、噪声、口音、打断、静音、姓名、数字和领域词。
- 测试三种 chunk。从 80、320 和 1,120 ms 开始,记录 WER 或 CER、首个 partial、stable text、final token 与 end of turn。
- 比较已知语言与自动识别。Auto 模式可简化 routing,也可能降低准确率。加入短句与语言切换。
- 压测真实 pipeline。提高并发,直到 P95 延迟、显存、队列深度或准确率不再满足 SLO。
- 主动制造故障。杀死 worker、丢包、重连、发送损坏音频,验证 backpressure、retry 与租户之间不会串 transcript。
- 计算每个验收分钟。计入 GPU 空闲、第二副本、工程、可观测性、存储、复核与错误带来的业务成本。
- 设置生产门槛。只有当自托管路径在能支付迁移成本的核心指标上胜过托管 baseline,且没有新增质量或可靠性缺口时才上线。
Wavect 的 AI Enablement 服务覆盖 workload 选择、语音和模型评估、架构、可观测性、生产加固与交接。Twinsoft AI 案例体现了同一条生产经验:模型周围的系统决定试点能否创造价值。我们的技术栈选择指南可帮助团队处理更广泛的自建与采购决策。
Nemotron 3.5 ASR 常见问题
NVIDIA Nemotron 3.5 ASR 是开源模型吗?
更准确的说法是采用 OpenMDW-1.1 的 open-weight 模型。许可证广泛允许商业使用、修改与分发,但 NVIDIA 没有公开 Open Source AI Definition 所要求的全部专有训练数据与完整训练流程。
Nemotron 3.5 ASR 是否开箱支持 40 种语言?
不是。NVIDIA 列出 40 个语言 locale:19 个 transcription-ready、13 个 broad-coverage,以及 8 个需要 fine-tuning 才能完整转录的 adaptation-ready locale。每种语言、口音、领域和音频通道都应单独验证。
Nemotron 3.5 ASR 的延迟真的是 80 ms 吗?
最小音频 chunk 为 80 ms,不查看右侧未来上下文。这不等于完整转录或语音智能体延迟。应分开测量首个 partial、stable text、final token、end of turn、网络、LLM 与 TTS。
一张 H100 能运行多少路 Nemotron 3.5 ASR?
NVIDIA 报告在 80 ms 设置下一张 H100 可持续处理约 240 路实时流,对比 Parakeet RNNT 1.1B buffered baseline 的 14 路。把 240 视为 benchmark 上限,并为完整生产 pipeline 留出余量。
Nemotron 3.5 ASR 可免费商用吗?
OpenMDW-1.1 checkpoint 不按调用收费,NVIDIA 表示可用于商业用途。GPU、冗余、工程、监控、存储、评估与支持仍需付费。NVIDIA NIM 还有单独的软件与模型条款。
Nemotron 3.5 ASR 比 Whisper 更适合语音智能体吗?
它的架构更适合原生低延迟流式处理。Whisper 生态更广、更成熟,仍是强大的批处理与多语言 baseline。请用自己的音频、延迟目标、语言组合、功能需求与总成本进行对比。
最终思考
Nemotron 3.5 ASR 值得进行生产试点。6 亿参数的 cache-aware 流式模型、一个 checkpoint 处理多语言流量、自动语言检测、原生标点,以及厂商报告的一张 H100 处理 240 路实时流,为语音智能体、实时字幕和通话转录提供了可信的成本与延迟依据。
商业逻辑不是语音转文字已经零成本,而是在持续流量、数据控制和低延迟足以支持自有运营时,边际模型费用可以消失。请保持表述准确:40 个语言 locale,32 个开箱可转录;80 ms 是 chunk,不是端到端延迟保证;17 倍只针对 NVIDIA 的一个 buffered baseline。购买硬件或替换托管 API 前,应在生产音频上完成多语言、完整 pipeline 的基准测试。
