返回
Kevin Riedl

12 分钟 阅读 · 2026年7月19日

下一篇

NVIDIA Nemotron 3.5 ASR:免费自托管 STT 能否用于语音智能体?

NVIDIA Nemotron 3.5 ASR 值得进入多语言语音智能体的自托管语音转文字候选名单,但社交媒体上的说法夸大了三点。它覆盖的是 40 个 language-locale,并非 40 种质量相同、开箱即用的语言。80 ms 指最小音频 chunk,不是完整端到端延迟保证。Checkpoint 不按分钟收 API 费,但 GPU、冗余、集成、监控与评估仍然需要成本。

本文信息核验于 2026 年 7 月 19 日,只回答一个明确的采购问题:团队是否应把 Nemotron 3.5 ASR 作为实时多语言产品的转录层来试点?本文不替代通用 LLM 自托管成本比较,也不是整个 ASR 市场排行榜。

把 Nemotron 3.5 ASR 热门说法改写成生产决策
说法一手资料的准确表述采购方应如何理解
支持 40 种语言40 个 locale:19 个 transcription-ready、13 个 broad-coverage、8 个 adaptation-ready32 个可开箱转录;每个目标 locale 都要单独验证
延迟 80 ms80 ms 是无右侧上下文 lookahead 的最小可配置音频 chunk在完整 pipeline 中分别测 partial、stable、final token 与 end of turn
并发高 17 倍一张 H100 在 80 ms 下为 240 路,对比 Parakeet RNNT 1.1B buffered streaming 的 14 路这是有价值的厂商 benchmark,不代表比所有 ASR 都快 17 倍
成本为 0OpenMDW-1.1 checkpoint 不按调用收费没有模型 API 账单,仍有基础设施与运营成本
输出可直接生产使用内置标点与大小写不等于具备说话人分离、轮次检测、时间戳、PII 脱敏与领域评测

需要用实测数据决定语音 AI 架构?

 设计 ASR 试点

NVIDIA Nemotron 3.5 ASR 是什么?

Nemotron 3.5 ASR 是一个拥有 6 亿参数的多语言流式自动语音识别模型。它由 24 层 cache-aware FastConformer encoder、RNN-T decoder 和语言 ID prompt conditioning 组成。同一 checkpoint 可以接收已知 locale,也可以自动识别输入语言。

真正有商业价值的是架构。Buffered streaming 通常会在每一步重复计算重叠的音频上下文。Nemotron 缓存 self-attention 与 convolution activation,只处理新的非重叠 frame。底层的 cache-aware Conformer 论文显示,相比其 buffered baseline,这种设计能降低延迟与推理时间,而且一个 multi-latency 模型可提供多个运行点。

NVIDIA 官方 model card提供 80、160、320、560 和 1,120 ms 五种 chunk。已知语言通常更准确。Auto 模式可以在每个 utterance 后附加 <zh-CN> 等 locale tag,适合一套部署接收多语言流量。

它真的支持 40 种语言吗?

模型在 40 个语言 locale 上训练,但只有 32 个可开箱转录。NVIDIA 把它们分为三层:

  • 19 个 transcription-ready locale:英语、西班牙语、法语、意大利语、葡萄牙语、荷兰语、德语、土耳其语、俄语、阿拉伯语、印地语、日语、韩语、越南语和乌克兰语,其中部分包含区域变体。
  • 13 个 broad-coverage locale:波兰语、瑞典语、捷克语、挪威博克马尔语、丹麦语、保加利亚语、芬兰语、克罗地亚语、斯洛伐克语、普通话、匈牙利语、罗马尼亚语和爱沙尼亚语。
  • 8 个 adaptation-ready locale:希腊语、立陶宛语、拉脱维亚语、马耳他语、斯洛文尼亚语、希伯来语、泰语和新挪威语。Tokenizer 能识别它们,但 NVIDIA 表示需要 fine-tuning 才能完整转录。

Broad coverage 也不代表质量相同。在 NVIDIA 自报的 FLEURS 测试中,给定语言 ID、80 ms 设置下,transcription-ready 组平均 WER 为 10.38%,broad-coverage 组为 25.86%。普通话使用 CER。该测试基于规范化公开数据,不足以证明模型能处理带口音的 8 kHz 电话、多人重叠说话、产品名、地址或你的真实声学环境。

NVIDIA 报告的部分 FLEURS 结果,越低越好
Locale80 ms,已知语言80 ms,自动识别1.12 s,已知语言指标
西班牙语4.875.044.11WER
印地语8.1311.476.81WER
英语9.439.727.91WER
德语9.819.908.31WER
阿拉伯语13.1713.4712.03WER
普通话20.5622.4519.28CER

80 ms 是否表示转录会在 80 ms 内返回?

不是。80 ms 是最小音频 chunk,并非用户感受到的完整响应时间。使用 att_context_size=[56,0] 时,模型处理一个 80 ms frame,不查看右侧未来上下文。完整系统还要计算音频采集、分包、网络、排队、feature extraction、推理、稳定性策略、VAD、end-of-turn、LLM 与 TTS。

语音智能体至少要分开记录四个时间:

  1. 首个 partial transcript:第一段可用文本何时出现。
  2. Stable transcript:文本何时稳定到可以安全触发下游任务。
  3. Final-token latency:从最后一个音频 sample 到最终 ASR token。
  4. End-of-turn latency:系统何时能确认用户已经说完。

如果 320 ms 能减少错误、人工修正和误触发工具,同时保持对话流畅,它可能比 80 ms 更有商业价值。应测试延迟与质量曲线,而不是只追求最小数字。

H100 并发高 17 倍能证明什么?

它证明 cache-aware streaming 可以让该 checkpoint 比 NVIDIA 选择的 buffered baseline 更节省算力。在 80 ms 设置下,NVIDIA 报告一张 H100 可持续处理 240 路实时流,Parakeet RNNT 1.1B 为 14 路,约 17.1 倍。在 1.12 秒设置下,两者为 2,400 对 400,约 6 倍。

这并不等于你的完整系统每张 GPU 可以稳定承载 240 通生产电话。Codec 转换、VAD、说话人分离、日志、编排、多租户、尾延迟、容量余量与故障切换都会消耗资源。比较对象还是 0.6B 与 1.1B 两种不同规模模型,不能推导出它优于 Whisper、Deepgram、Speechmatics、Google 或所有其他流式 ASR。

Nemotron 3.5 ASR 真的免费吗?

Checkpoint 没有按调用计费,但生产服务不可能零成本。OpenMDW-1.1 许可证免费授予使用、修改与分发 Model Materials 的广泛权利,但需保留许可证与来源声明,并包含专利和版权诉讼条款。Model card 表示该模型可用于商业用途并支持全球部署。

称其为“100% 开源”仍不准确。NVIDIA 公开了权重和推理路径,但训练数据包含专有的 NVIDIA Riva 数据集。Open Source AI Definition要求足够详细的训练数据说明,以及用于训练和运行系统的完整代码。更稳妥的描述是:采用宽松商业模型许可证的 open-weight 模型

在庆祝没有 API 账单前,先计算基础成本。假设一张 H100 每个 wall-clock 小时 3 美元,并把 NVIDIA 的 240 路 benchmark 仅视为上限:

仅计算 GPU 的每转录音频小时示例成本
平均实时流240 路上限利用率每音频小时 GPU 成本未计入
240100%0.0125 美元全部生产开销与容量余量
6025%0.05 美元冗余、运维、存储与网络
125%0.25 美元同上
10.42%3.00 美元同上

这只是算术示例,不是报价或预测。作为当前托管方案参考,Deepgram 在 2026 年 7 月 19 日把 Nova-3 Multilingual streaming 标为每分钟 0.0058 美元,即每音频小时 0.348 美元。在假设的 3 美元 GPU 成本下,未计其他费用的 break-even 约为持续占用 9 路。若用两张 GPU 做 failover,则约为 18 路,且还没有计入工程和支持。托管 API 同时包含基础 checkpoint 没有的能力与运营责任。

团队可以怎样部署?

有三条实用路径,各自许可证和运维负担不同:

  1. Hugging Face 加 NVIDIA NeMo。直接加载 OpenMDW checkpoint,使用 NVIDIA cache-aware streaming 代码,自行构建 serving layer。
  2. Hugging Face Transformers。Transformers 5.13 起支持该模型的离线与流式生成,可给定 locale 或自动检测,适合评估和自定义集成。
  3. NVIDIA ASR NIM。NVIDIA 已把多语言版本装入 GPU 加速容器,并提供 gRPC 与 HTTP API。官方 NIM 部署指南使用 type=multi。NIM 容器与模型有单独条款,不应把 checkpoint 的许可证结论直接套到整个容器。

当前 ASR NIM 支持矩阵要求 NVIDIA GPU 的 compute capability 至少为 8.0,物理显存至少 16 GB。Nemotron 多语言 profile 自身在 batch size 32 时列出约 6 GB,batch size 64 时约 14.6 GB。NIM 支持 A30、A100、H100、部分 A 系列推理卡、L4、L40 与近期 GeForce RTX。原始 model card 还列出更早的 NVIDIA 架构和 Jetson,但生产容量必须在目标 runtime 与设备上实测。

Nemotron 3.5 ASR、Whisper 与托管流式 API 怎么选?

哪些转录方案应进入试点
方案最值得测试的理由主要取舍优先选择条件
Nemotron 3.5 ASR原生流式、单一多语言 checkpoint、高并发厂商数据、本地数据路径各 locale 质量差异大,现成功能层较薄语音延迟、数据控制与持续并发最重要
OpenAI Whisper 及其加速实现生态成熟、语言覆盖广、MIT 许可证、转录与翻译变体官方 Whisper 使用滑动 30 秒窗口,不是原生低延迟流式架构批量文件、广泛语言覆盖或生态成熟度比轮次延迟更重要
托管流式 API集成快、SLA、扩缩容、可观测性,以及说话人分离或脱敏等功能按分钟收费、供应商依赖与外部数据路径流量低或波动大,且上线速度最重要

Whisper 官方仓库说明标准转录会使用滑动 30 秒窗口。第三方 wrapper 可以让它表现为增量输出,但算力模式不同于为流式训练的 cache-aware RNN-T。面向语音智能体的托管 ASR 还可能内置轮次检测。例如,Deepgram 文档说明 Flux 具有模型原生 end-of-turn,而 Nemotron 基础 checkpoint 没有这项声明。

“0 美元模型”故事遗漏了什么?

Checkpoint 输出带标点、大小写与可选语言 tag 的文本。生产语音系统还可能需要:

  • VAD 与可靠的 end-of-turn 检测;
  • 说话人分离或独立电话通道;
  • 词级时间戳、置信度策略与 transcript 稳定性规则;
  • 8 kHz 电话重采样、codec、jitter buffer 与断线重连;
  • 姓名、SKU、地址和受监管术语的领域词汇评估;
  • PII 脱敏、告知与同意、保留、删除、权限和审计日志;
  • 自动扩缩容、backpressure、failover、监控与安全降级;
  • 当输出语言需要改变时使用独立翻译层。

自托管可以把音频留在受控基础设施中,但不会自动让录音合法,也不会自动满足 GDPR 或其他隐私要求。处理真实客户通话前,应明确数据主体、目的、告知、同意或其他合法基础、存储、支持访问、删除与人工复核。

哪些团队现在适合试点 Nemotron 3.5 ASR?

当你需要低延迟多语言转录,有足够稳定并发来利用 GPU,需要控制音频数据路径,可以运营 NVIDIA 基础设施,并能用真实音频分别评估每个目标 locale 时,值得试点。

如果流量很低或波动大,需要立即获得 SLA 与支持,需要开箱即用的轮次检测、说话人分离、时间戳、脱敏或词汇控制,或者团队不想承担 Speech MLOps,应先用托管 API。对于纯英语场景,NVIDIA 自己建议使用单独的 Nemotron 3 ASR 英语 checkpoint。

生产试点应怎样衡量?

  1. 固定决策范围。选择一个用例、两个目标 locale、一个现有方案,每个 locale 准备 200 到 500 条代表性 utterance。
  2. 复现生产音频。包括真实 codec、需要时使用 8 kHz、噪声、口音、打断、静音、姓名、数字和领域词。
  3. 测试三种 chunk。从 80、320 和 1,120 ms 开始,记录 WER 或 CER、首个 partial、stable text、final token 与 end of turn。
  4. 比较已知语言与自动识别。Auto 模式可简化 routing,也可能降低准确率。加入短句与语言切换。
  5. 压测真实 pipeline。提高并发,直到 P95 延迟、显存、队列深度或准确率不再满足 SLO。
  6. 主动制造故障。杀死 worker、丢包、重连、发送损坏音频,验证 backpressure、retry 与租户之间不会串 transcript。
  7. 计算每个验收分钟。计入 GPU 空闲、第二副本、工程、可观测性、存储、复核与错误带来的业务成本。
  8. 设置生产门槛。只有当自托管路径在能支付迁移成本的核心指标上胜过托管 baseline,且没有新增质量或可靠性缺口时才上线。

Wavect 的 AI Enablement 服务覆盖 workload 选择、语音和模型评估、架构、可观测性、生产加固与交接。Twinsoft AI 案例体现了同一条生产经验:模型周围的系统决定试点能否创造价值。我们的技术栈选择指南可帮助团队处理更广泛的自建与采购决策。

Nemotron 3.5 ASR 常见问题

NVIDIA Nemotron 3.5 ASR 是开源模型吗?

更准确的说法是采用 OpenMDW-1.1 的 open-weight 模型。许可证广泛允许商业使用、修改与分发,但 NVIDIA 没有公开 Open Source AI Definition 所要求的全部专有训练数据与完整训练流程。

Nemotron 3.5 ASR 是否开箱支持 40 种语言?

不是。NVIDIA 列出 40 个语言 locale:19 个 transcription-ready、13 个 broad-coverage,以及 8 个需要 fine-tuning 才能完整转录的 adaptation-ready locale。每种语言、口音、领域和音频通道都应单独验证。

Nemotron 3.5 ASR 的延迟真的是 80 ms 吗?

最小音频 chunk 为 80 ms,不查看右侧未来上下文。这不等于完整转录或语音智能体延迟。应分开测量首个 partial、stable text、final token、end of turn、网络、LLM 与 TTS。

一张 H100 能运行多少路 Nemotron 3.5 ASR?

NVIDIA 报告在 80 ms 设置下一张 H100 可持续处理约 240 路实时流,对比 Parakeet RNNT 1.1B buffered baseline 的 14 路。把 240 视为 benchmark 上限,并为完整生产 pipeline 留出余量。

Nemotron 3.5 ASR 可免费商用吗?

OpenMDW-1.1 checkpoint 不按调用收费,NVIDIA 表示可用于商业用途。GPU、冗余、工程、监控、存储、评估与支持仍需付费。NVIDIA NIM 还有单独的软件与模型条款。

Nemotron 3.5 ASR 比 Whisper 更适合语音智能体吗?

它的架构更适合原生低延迟流式处理。Whisper 生态更广、更成熟,仍是强大的批处理与多语言 baseline。请用自己的音频、延迟目标、语言组合、功能需求与总成本进行对比。

最终思考

Nemotron 3.5 ASR 值得进行生产试点。6 亿参数的 cache-aware 流式模型、一个 checkpoint 处理多语言流量、自动语言检测、原生标点,以及厂商报告的一张 H100 处理 240 路实时流,为语音智能体、实时字幕和通话转录提供了可信的成本与延迟依据。

商业逻辑不是语音转文字已经零成本,而是在持续流量、数据控制和低延迟足以支持自有运营时,边际模型费用可以消失。请保持表述准确:40 个语言 locale,32 个开箱可转录;80 ms 是 chunk,不是端到端延迟保证;17 倍只针对 NVIDIA 的一个 buffered baseline。购买硬件或替换托管 API 前,应在生产音频上完成多语言、完整 pipeline 的基准测试。

返回
Kevin Riedl

12 分钟 阅读 · 2026年7月19日

下一篇

构建产品,而不只是 backlog

如果这篇文章对应的是一个真实产品决策,Wavect 可以用高级创始人级判断帮你界定范围、构建、加固或领导软件工作。

可选服务路径: