---
title: "Nemotron 3.5 ASR 评测：成本、延迟与语音智能体"
canonical: https://wavect.io/zh/blog/nvidia-nemotron-3-5-asr-production-review/
language: zh
description: "NVIDIA Nemotron 3.5 ASR 评测：80 ms 实际含义、40 个 locale 的限制、H100 成本、许可证、Whisper 对比与生产试点清单。"
image: "https://wavect.io/img/general/bak/open_graph_preview.jpg"
---

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年7月19日

[**下一篇**](/zh/blog/claude-code-vs-opencode-team-cost-2026/)

# NVIDIA Nemotron 3.5 ASR：免费自托管 STT 能否用于语音智能体？

要点速览

NVIDIA Nemotron 3.5 ASR 值得用于多语言语音智能体的自托管转录试点，但它不是 零成本 turnkey 语音栈。这个 6 亿参数的 cache-aware FastConformer-RNNT checkpoint 覆盖 40 个语言 locale，其中只有 19 个 transcription-ready 与 13 个 broad-coverage locale 可开箱转录；另 8 个 adaptation-ready locale 需要 fine-tuning。80 ms 指无右侧上下文 lookahead 的最小音频 chunk，不是 端到端延迟保证。NVIDIA 报告一张 H100 可持续处理 240 路 80 ms 实时流， Parakeet RNNT 1.1B buffered baseline 为 14 路；17.1 倍只适用于这项特定比较。 OpenMDW-1.1 允许商业使用且不按调用收费，但 GPU 空闲、冗余、集成、监控、 评估与支持仍有成本。替换托管 API 前，应在生产音频上比较已知与自动语言模式， 测试 80、320 与 1,120 ms，记录 WER 或 CER、stable transcript、end of turn、 负载下 P95，以及每个验收音频分钟的总成本。

**NVIDIA Nemotron 3.5 ASR 值得进入多语言语音智能体的自托管语音转文字候选名单，但社交媒体上的说法夸大了三点。**它覆盖的是 40 个 language-locale，并非 40 种质量相同、开箱即用的语言。80 ms 指最小音频 chunk，不是完整端到端延迟保证。Checkpoint 不按分钟收 API 费，但 GPU、冗余、集成、监控与评估仍然需要成本。

本文信息核验于 **2026 年 7 月 19 日**，只回答一个明确的采购问题：团队是否应把 Nemotron 3.5 ASR 作为实时多语言产品的转录层来试点？本文不替代通用 LLM 自托管成本比较，也不是整个 ASR 市场排行榜。

如需评估完整集成，请参考我们的 [本地多模态 AI 编程助手参考架构](/zh/blog/local-multimodal-ai-coding-assistant/) 。它说明 Nemotron 如何连接本地 OCR、推理和权限受限的 IDE 工具，并明确区分 ASR benchmark 与完整隐私证明。

| 说法 | 一手资料的准确表述 | 采购方应如何理解 |
| --- | --- | --- |
| 支持 40 种语言 | 40 个 locale：19 个 transcription-ready、13 个 broad-coverage、8 个 adaptation-ready | 32 个可开箱转录；每个目标 locale 都要单独验证 |
| 延迟 80 ms | 80 ms 是无右侧上下文 lookahead 的最小可配置音频 chunk | 在完整 pipeline 中分别测 partial、stable、final token 与 end of turn |
| 并发高 17 倍 | 一张 H100 在 80 ms 下为 240 路，对比 Parakeet RNNT 1.1B buffered streaming 的 14 路 | 这是有价值的厂商 benchmark，不代表比所有 ASR 都快 17 倍 |
| 成本为 0 | OpenMDW-1.1 checkpoint 不按调用收费 | 没有模型 API 账单，仍有基础设施与运营成本 |
| 输出可直接生产使用 | 内置标点与大小写 | 不等于具备说话人分离、轮次检测、时间戳、PII 脱敏与领域评测 |

## NVIDIA Nemotron 3.5 ASR 是什么？

**Nemotron 3.5 ASR 是一个拥有 6 亿参数的多语言流式自动语音识别模型。**它由 24 层 cache-aware FastConformer encoder、RNN-T decoder 和语言 ID prompt conditioning 组成。同一 checkpoint 可以接收已知 locale，也可以自动识别输入语言。

真正有商业价值的是架构。Buffered streaming 通常会在每一步重复计算重叠的音频上下文。Nemotron 缓存 self-attention 与 convolution activation，只处理新的非重叠 frame。底层的 [cache-aware Conformer 论文](https://arxiv.org/abs/2312.17279) 显示，相比其 buffered baseline，这种设计能降低延迟与推理时间，而且一个 multi-latency 模型可提供多个运行点。

[NVIDIA 官方 model card](https://huggingface.co/nvidia/nemotron-3.5-asr-streaming-0.6b) 提供 80、160、320、560 和 1,120 ms 五种 chunk。已知语言通常更准确。Auto 模式可以在每个 utterance 后附加 `<zh-CN>` 等 locale tag，适合一套部署接收多语言流量。

## 它真的支持 40 种语言吗？

**模型在 40 个语言 locale 上训练，但只有 32 个可开箱转录。**NVIDIA 把它们分为三层：

- **19 个 transcription-ready locale：** 英语、西班牙语、法语、意大利语、葡萄牙语、荷兰语、德语、土耳其语、俄语、阿拉伯语、印地语、日语、韩语、越南语和乌克兰语，其中部分包含区域变体。
- **13 个 broad-coverage locale：** 波兰语、瑞典语、捷克语、挪威博克马尔语、丹麦语、保加利亚语、芬兰语、克罗地亚语、斯洛伐克语、普通话、匈牙利语、罗马尼亚语和爱沙尼亚语。
- **8 个 adaptation-ready locale：** 希腊语、立陶宛语、拉脱维亚语、马耳他语、斯洛文尼亚语、希伯来语、泰语和新挪威语。Tokenizer 能识别它们，但 NVIDIA 表示需要 fine-tuning 才能完整转录。

Broad coverage 也不代表质量相同。在 NVIDIA 自报的 FLEURS 测试中，给定语言 ID、80 ms 设置下，transcription-ready 组平均 WER 为 10.38%，broad-coverage 组为 25.86%。普通话使用 CER。该测试基于规范化公开数据，不足以证明模型能处理带口音的 8 kHz 电话、多人重叠说话、产品名、地址或你的真实声学环境。

| Locale | 80 ms，已知语言 | 80 ms，自动识别 | 1.12 s，已知语言 | 指标 |
| --- | --- | --- | --- | --- |
| 西班牙语 | 4.87 | 5.04 | 4.11 | WER |
| 印地语 | 8.13 | 11.47 | 6.81 | WER |
| 英语 | 9.43 | 9.72 | 7.91 | WER |
| 德语 | 9.81 | 9.90 | 8.31 | WER |
| 阿拉伯语 | 13.17 | 13.47 | 12.03 | WER |
| 普通话 | 20.56 | 22.45 | 19.28 | CER |

## 80 ms 是否表示转录会在 80 ms 内返回？

**不是。80 ms 是最小音频 chunk，并非用户感受到的完整响应时间。**使用 `att_context_size=[56,0]` 时，模型处理一个 80 ms frame，不查看右侧未来上下文。完整系统还要计算音频采集、分包、网络、排队、feature extraction、推理、稳定性策略、VAD、end-of-turn、LLM 与 TTS。

输出侧也需要同样严格的判断。我们的 [Miso TTS 本地部署对比 API 分析](/zh/blog/miso-tts-self-hosted-vs-api/) 把托管服务公开的 110 ms time-to-first-byte，与本地 GPU 延迟及完整语音链路延迟分开评估。

语音智能体至少要分开记录四个时间：

1. **首个 partial transcript：** 第一段可用文本何时出现。
2. **Stable transcript：** 文本何时稳定到可以安全触发下游任务。
3. **Final-token latency：** 从最后一个音频 sample 到最终 ASR token。
4. **End-of-turn latency：** 系统何时能确认用户已经说完。

如果 320 ms 能减少错误、人工修正和误触发工具，同时保持对话流畅，它可能比 80 ms 更有商业价值。应测试延迟与质量曲线，而不是只追求最小数字。

## H100 并发高 17 倍能证明什么？

**它证明 cache-aware streaming 可以让该 checkpoint 比 NVIDIA 选择的 buffered baseline 更节省算力。**在 80 ms 设置下，NVIDIA 报告一张 H100 可持续处理 240 路实时流，Parakeet RNNT 1.1B 为 14 路，约 17.1 倍。在 1.12 秒设置下，两者为 2,400 对 400，约 6 倍。

这并不等于你的完整系统每张 GPU 可以稳定承载 240 通生产电话。Codec 转换、VAD、说话人分离、日志、编排、多租户、尾延迟、容量余量与故障切换都会消耗资源。比较对象还是 0.6B 与 1.1B 两种不同规模模型，不能推导出它优于 Whisper、Deepgram、Speechmatics、Google 或所有其他流式 ASR。

## Nemotron 3.5 ASR 真的免费吗？

**Checkpoint 没有按调用计费，但生产服务不可能零成本。** [OpenMDW-1.1 许可证](https://openmdw.ai/license/1-1/) 免费授予使用、修改与分发 Model Materials 的广泛权利，但需保留许可证与来源声明，并包含专利和版权诉讼条款。Model card 表示该模型可用于商业用途并支持全球部署。

称其为“100% 开源”仍不准确。NVIDIA 公开了权重和推理路径，但训练数据包含专有的 NVIDIA Riva 数据集。 [Open Source AI Definition](https://opensource.org/ai/open-source-ai-definition) 要求足够详细的训练数据说明，以及用于训练和运行系统的完整代码。更稳妥的描述是：**采用宽松商业模型许可证的 open-weight 模型**。

在庆祝没有 API 账单前，先计算基础成本。假设一张 H100 每个 wall-clock 小时 3 美元，并把 NVIDIA 的 240 路 benchmark 仅视为上限：

| 平均实时流 | 240 路上限利用率 | 每音频小时 GPU 成本 | 未计入 |
| --- | --- | --- | --- |
| 240 | 100% | 0.0125 美元 | 全部生产开销与容量余量 |
| 60 | 25% | 0.05 美元 | 冗余、运维、存储与网络 |
| 12 | 5% | 0.25 美元 | 同上 |
| 1 | 0.42% | 3.00 美元 | 同上 |

这只是算术示例，不是报价或预测。作为当前托管方案参考， [Deepgram 在 2026 年 7 月 19 日把 Nova-3 Multilingual streaming 标为每分钟 0.0058 美元](https://deepgram.com/pricing) ，即每音频小时 0.348 美元。在假设的 3 美元 GPU 成本下，未计其他费用的 break-even 约为持续占用 9 路。若用两张 GPU 做 failover，则约为 18 路，且还没有计入工程和支持。托管 API 同时包含基础 checkpoint 没有的能力与运营责任。

## 团队可以怎样部署？

有三条实用路径，各自许可证和运维负担不同：

1. **Hugging Face 加 NVIDIA NeMo。** 直接加载 OpenMDW checkpoint，使用 NVIDIA cache-aware streaming 代码，自行构建 serving layer。
2. **Hugging Face Transformers。** Transformers 5.13 起支持该模型的离线与流式生成，可给定 locale 或自动检测，适合评估和自定义集成。
3. **NVIDIA ASR NIM。** NVIDIA 已把多语言版本装入 GPU 加速容器，并提供 gRPC 与 HTTP API。 [官方 NIM 部署指南](https://docs.nvidia.com/nim/speech/latest/asr/deploy-asr-models/nemotron-asr-streaming.html) 使用 `type=multi` 。NIM 容器与模型有单独条款，不应把 checkpoint 的许可证结论直接套到整个容器。

当前 ASR NIM 支持矩阵要求 NVIDIA GPU 的 compute capability 至少为 8.0，物理显存至少 16 GB。Nemotron 多语言 profile 自身在 batch size 32 时列出约 6 GB，batch size 64 时约 14.6 GB。NIM 支持 A30、A100、H100、部分 A 系列推理卡、L4、L40 与近期 GeForce RTX。原始 model card 还列出更早的 NVIDIA 架构和 Jetson，但生产容量必须在目标 runtime 与设备上实测。

## Nemotron 3.5 ASR、Whisper 与托管流式 API 怎么选？

| 方案 | 最值得测试的理由 | 主要取舍 | 优先选择条件 |
| --- | --- | --- | --- |
| Nemotron 3.5 ASR | 原生流式、单一多语言 checkpoint、高并发厂商数据、本地数据路径 | 各 locale 质量差异大，现成功能层较薄 | 语音延迟、数据控制与持续并发最重要 |
| OpenAI Whisper 及其加速实现 | 生态成熟、语言覆盖广、MIT 许可证、转录与翻译变体 | 官方 Whisper 使用滑动 30 秒窗口，不是原生低延迟流式架构 | 批量文件、广泛语言覆盖或生态成熟度比轮次延迟更重要 |
| 托管流式 API | 集成快、SLA、扩缩容、可观测性，以及说话人分离或脱敏等功能 | 按分钟收费、供应商依赖与外部数据路径 | 流量低或波动大，且上线速度最重要 |

[Whisper 官方仓库](https://github.com/openai/whisper) 说明标准转录会使用滑动 30 秒窗口。第三方 wrapper 可以让它表现为增量输出，但算力模式不同于为流式训练的 cache-aware RNN-T。面向语音智能体的托管 ASR 还可能内置轮次检测。例如， [Deepgram 文档说明 Flux 具有模型原生 end-of-turn](https://developers.deepgram.com/docs/models-languages-overview) ，而 Nemotron 基础 checkpoint 没有这项声明。

## “0 美元模型”故事遗漏了什么？

Checkpoint 输出带标点、大小写与可选语言 tag 的文本。生产语音系统还可能需要：

- VAD 与可靠的 end-of-turn 检测；
- 说话人分离或独立电话通道；
- 词级时间戳、置信度策略与 transcript 稳定性规则；
- 8 kHz 电话重采样、codec、jitter buffer 与断线重连；
- 姓名、SKU、地址和受监管术语的领域词汇评估；
- PII 脱敏、告知与同意、保留、删除、权限和审计日志；
- 自动扩缩容、backpressure、failover、监控与安全降级；
- 当输出语言需要改变时使用独立翻译层。

自托管可以把音频留在受控基础设施中，但不会自动让录音合法，也不会自动满足 GDPR 或其他隐私要求。处理真实客户通话前，应明确数据主体、目的、告知、同意或其他合法基础、存储、支持访问、删除与人工复核。

## 哪些团队现在适合试点 Nemotron 3.5 ASR？

当你需要低延迟多语言转录，有足够稳定并发来利用 GPU，需要控制音频数据路径，可以运营 NVIDIA 基础设施，并能用真实音频分别评估每个目标 locale 时，值得试点。

如果流量很低或波动大，需要立即获得 SLA 与支持，需要开箱即用的轮次检测、说话人分离、时间戳、脱敏或词汇控制，或者团队不想承担 Speech MLOps，应先用托管 API。对于纯英语场景，NVIDIA 自己建议使用单独的 Nemotron 3 ASR 英语 checkpoint。

## 生产试点应怎样衡量？

1. **固定决策范围。** 选择一个用例、两个目标 locale、一个现有方案，每个 locale 准备 200 到 500 条代表性 utterance。
2. **复现生产音频。** 包括真实 codec、需要时使用 8 kHz、噪声、口音、打断、静音、姓名、数字和领域词。
3. **测试三种 chunk。** 从 80、320 和 1,120 ms 开始，记录 WER 或 CER、首个 partial、stable text、final token 与 end of turn。
4. **比较已知语言与自动识别。** Auto 模式可简化 routing，也可能降低准确率。加入短句与语言切换。
5. **压测真实 pipeline。** 提高并发，直到 P95 延迟、显存、队列深度或准确率不再满足 SLO。
6. **主动制造故障。** 杀死 worker、丢包、重连、发送损坏音频，验证 backpressure、retry 与租户之间不会串 transcript。
7. **计算每个验收分钟。** 计入 GPU 空闲、第二副本、工程、可观测性、存储、复核与错误带来的业务成本。
8. **设置生产门槛。** 只有当自托管路径在能支付迁移成本的核心指标上胜过托管 baseline，且没有新增质量或可靠性缺口时才上线。

Wavect 的 [AI Enablement 服务](/zh/services/ai-enablement/) 覆盖 workload 选择、语音和模型评估、架构、可观测性、生产加固与交接。 [Twinsoft AI 案例](/zh/case-studies/twinsoft-ai/) 体现了同一条生产经验：模型周围的系统决定试点能否创造价值。我们的 [技术栈选择指南](/zh/software-development-guide/how-to-choose-a-tech-stack-for-mvp/) 可帮助团队处理更广泛的自建与采购决策。

## Nemotron 3.5 ASR 常见问题

### NVIDIA Nemotron 3.5 ASR 是开源模型吗？

更准确的说法是采用 OpenMDW-1.1 的 open-weight 模型。许可证广泛允许商业使用、修改与分发，但 NVIDIA 没有公开 Open Source AI Definition 所要求的全部专有训练数据与完整训练流程。

### Nemotron 3.5 ASR 是否开箱支持 40 种语言？

不是。NVIDIA 列出 40 个语言 locale：19 个 transcription-ready、13 个 broad-coverage，以及 8 个需要 fine-tuning 才能完整转录的 adaptation-ready locale。每种语言、口音、领域和音频通道都应单独验证。

### Nemotron 3.5 ASR 的延迟真的是 80 ms 吗？

最小音频 chunk 为 80 ms，不查看右侧未来上下文。这不等于完整转录或语音智能体延迟。应分开测量首个 partial、stable text、final token、end of turn、网络、LLM 与 TTS。

### 一张 H100 能运行多少路 Nemotron 3.5 ASR？

NVIDIA 报告在 80 ms 设置下一张 H100 可持续处理约 240 路实时流，对比 Parakeet RNNT 1.1B buffered baseline 的 14 路。把 240 视为 benchmark 上限，并为完整生产 pipeline 留出余量。

### Nemotron 3.5 ASR 可免费商用吗？

OpenMDW-1.1 checkpoint 不按调用收费，NVIDIA 表示可用于商业用途。GPU、冗余、工程、监控、存储、评估与支持仍需付费。NVIDIA NIM 还有单独的软件与模型条款。

### Nemotron 3.5 ASR 比 Whisper 更适合语音智能体吗？

它的架构更适合原生低延迟流式处理。Whisper 生态更广、更成熟，仍是强大的批处理与多语言 baseline。请用自己的音频、延迟目标、语言组合、功能需求与总成本进行对比。

## 最终思考

Nemotron 3.5 ASR 值得进行生产试点。6 亿参数的 cache-aware 流式模型、一个 checkpoint 处理多语言流量、自动语言检测、原生标点，以及厂商报告的一张 H100 处理 240 路实时流，为语音智能体、实时字幕和通话转录提供了可信的成本与延迟依据。

商业逻辑不是语音转文字已经零成本，而是在持续流量、数据控制和低延迟足以支持自有运营时，边际模型费用可以消失。请保持表述准确：40 个语言 locale，32 个开箱可转录；80 ms 是 chunk，不是端到端延迟保证；17 倍只针对 NVIDIA 的一个 buffered baseline。购买硬件或替换托管 API 前，应在生产音频上完成多语言、完整 pipeline 的基准测试。

## 你可能也喜欢..

[**本地模型 vs API：欧盟企业盈亏平衡计算器** 用更广泛的自托管框架评估利用率、冗余、工程、数据驻留与每个成功结果的成本。](/zh/blog/local-models-vs-apis-break-even-eu-2026/) [**AI Enablement vs 通用 AI 咨询** 比较可量化的生产落地与只停留在模型推荐和幻灯片的咨询。](/zh/compare/ai-enablement-vs-generic-ai-consultancy/)

模型与基础设施

## 继续浏览此集群

[从核心文章开始**在欧盟自托管 LLM：开放权重模型何时才真正划算**](/zh/blog/self-hosting-llms-eu-cost/)

- [Gemini Robotics 2：全身控制与试点决策](/zh/blog/gemini-robotics-2-whole-body-control/)
- [pdf-inspector 评测：先本地解析 PDF，再调用 OCR](/zh/blog/pdf-inspector-ocr-routing/)
- [本地多模态 AI 编程助手：语音、OCR 与隐私架构](/zh/blog/local-multimodal-ai-coding-assistant/)
- [一台 AI PC 本地运行 DeepSeek V4 Flash 0731，现实效果如何？](/zh/blog/deepseek-v4-flash-0731-local-ai-pc/)
- [用 Unsloth 和 Colab 免费微调 Gemma 4](/zh/blog/fine-tune-gemma-4-free-unsloth-colab/)

只收重要内容

## 关注与你相关的内容

每当我们发布新文章，你会收到一封简短邮件。你可以关注整个博客，也可以只选感兴趣的主题。

[**返回**](/zh/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/zh/team/kevin-riedl/)

[Kevin Riedl](/zh/team/kevin-riedl/) https://linkedin.com/in/wsdt

12 分钟 阅读 · 2026年7月19日

[**下一篇**](/zh/blog/claude-code-vs-opencode-team-cost-2026/)

邮件订阅新文章 ×

×

通过邮件获取新文章

我们发布时给你一封简短邮件。免费，不做跟踪。

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "creator": {
          "@id": "https://wavect.io/#organization",
          "@type": [
            "Organization",
            "ProfessionalService",
            "LocalBusiness"
          ]
        },
        "description": "A machine-readable registry of quantitative and qualitative claims published by Wavect, with review dates, localized page appearances and public third-party citations where available.",
        "inLanguage": "en",
        "isAccessibleForFree": true,
        "license": "https://creativecommons.org/licenses/by/4.0/",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/zh/blog/nvidia-nemotron-3-5-asr-production-review/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-07-19",
      "inLanguage": "zh",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-07-19",
      "url": "https://wavect.io/zh/blog/nvidia-nemotron-3-5-asr-production-review/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "NVIDIA Nemotron 3.5 ASR 值得用于多语言语音智能体的自托管转录试点，但它不是 零成本 turnkey 语音栈。这个 6 亿参数的 cache-aware FastConformer-RNNT checkpoint 覆盖 40 个语言 locale，其中只有 19 个 transcription-ready 与 13 个 broad-coverage locale 可开箱转录；另 8 个 adaptation-ready locale 需要 fine-tuning。80 ms 指无右侧上下文 lookahead 的最小音频 chunk，不是 端到端延迟保证。NVIDIA 报告一张 H100 可持续处理 240 路 80 ms 实时流， Parakeet RNNT 1.1B buffered baseline 为 14 路；17.1 倍只适用于这项特定比较。 OpenMDW-1.1 允许商业使用且不按调用收费，但 GPU 空闲、冗余、集成、监控、 评估与支持仍有成本。替换托管 API 前，应在生产音频上比较已知与自动语言模式， 测试 80、320 与 1,120 ms，记录 WER 或 CER、stable transcript、end of turn、 负载下 P95，以及每个验收音频分钟的总成本。",
  "articleBody": " 博客概览/AI 与智能体/模型与基础设施 NVIDIA Nemotron 3.5 ASR：免费自托管 STT 能否用于语音智能体？ 要点速览 NVIDIA Nemotron 3.5 ASR 值得用于多语言语音智能体的自托管转录试点，但它不是 零成本 turnkey 语音栈。这个 6 亿参数的 cache-aware FastConformer-RNNT checkpoint 覆盖 40 个语言 locale，其中只有 19 个 transcription-ready 与 13 个 broad-coverage locale 可开箱转录；另 8 个 adaptation-ready locale 需要 fine-tuning。80 ms 指无右侧上下文 lookahead 的最小音频 chunk，不是 端到端延迟保证。NVIDIA 报告一张 H100 可持续处理 240 路 80 ms 实时流， Parakeet RNNT 1.1B buffered baseline 为 14 路；17.1 倍只适用于这项特定比较。 OpenMDW-1.1 允许商业使用且不按调用收费，但 GPU 空闲、冗余、集成、监控、 评估与支持仍有成本。替换托管 API 前，应在生产音频上比较已知与自动语言模式， 测试 80、320 与 1,120 ms，记录 WER 或 CER、stable transcript、end of turn、 负载下 P95，以及每个验收音频分钟的总成本。 NVIDIA Nemotron 3.5 ASR 值得进入多语言语音智能体的自托管语音转文字候选名单，但社交媒体上的说法夸大了三点。它覆盖的是 40 个 language-locale，并非 40 种质量相同、开箱即用的语言。80 ms 指最小音频 chunk，不是完整端到端延迟保证。Checkpoint 不按分钟收 API 费，但 GPU、冗余、集成、监控与评估仍然需要成本。 本文信息核验于 2026 年 7 月 19 日，只回答一个明确的采购问题：团队是否应把 Nemotron 3.5 ASR 作为实时多语言产品的转录层来试点？本文不替代通用 LLM 自托管成本比较，也不是整个 ASR 市场排行榜。 如需评估完整集成，请参考我们的本地多模态 AI 编程助手参考架构。它说明 Nemotron 如何连接本地 OCR、推理和权限受限的 IDE 工具，并明确区分 ASR benchmark 与完整隐私证明。 把 Nemotron 3.5 ASR 热门说法改写成生产决策 说法一手资料的准确表述采购方应如何理解 支持 40 种语言40 个 locale：19 个 transcription-ready、13 个 broad-coverage、8 个 adaptation-ready32 个可开箱转录；每个目标 locale 都要单独验证 延迟 80 ms80 ms 是无右侧上下文 lookahead 的最小可配置音频 chunk在完整 pipeline 中分别测 partial、stable、final token 与 end of turn 并发高 17 倍一张 H100 在 80 ms 下为 240 路，对比 Parakeet RNNT 1.1B buffered streaming 的 14 路这是有价值的厂商 benchmark，不代表比所有 ASR 都快 17 倍 成本为 0OpenMDW-1.1 checkpoint 不按调用收费没有模型 API 账单，仍有基础设施与运营成本 输出可直接生产使用内置标点与大小写不等于具备说话人分离、轮次检测、时间戳、PII 脱敏与领域评测 NVIDIA Nemotron 3.5 ASR 是什么？ Nemotron 3.5 ASR 是一个拥有 6 亿参数的多语言流式自动语音识别模型。它由 24 层 cache-aware FastConformer encoder、RNN-T decoder 和语言 ID prompt conditioning 组成。同一 checkpoint 可以接收已知 locale，也可以自动识别输入语言。 真正有商业价值的是架构。Buffered streaming 通常会在每一步重复计算重叠的音频上下文。Nemotron 缓存 self-attention 与 convolution activation，只处理新的非重叠 frame。底层的 cache-aware Conformer 论文显示，相比其 buffered baseline，这种设计能降低延迟与推理时间，而且一个 multi-latency 模型可提供多个运行点。 NVIDIA 官方 model card提供 80、160、320、560 和 1,120 ms 五种 chunk。已知语言通常更准确。Auto 模式可以在每个 utterance 后附加 <zh-CN> 等 locale tag，适合一套部署接收多语言流量。 它真的支持 40 种语言吗？ 模型在 40 个语言 locale 上训练，但只有 32 个可开箱转录。NVIDIA 把它们分为三层： 19 个 transcription-ready locale：英语、西班牙语、法语、意大利语、葡萄牙语、荷兰语、德语、土耳其语、俄语、阿拉伯语、印地语、日语、韩语、越南语和乌克兰语，其中部分包含区域变体。 13 个 broad-coverage locale：波兰语、瑞典语、捷克语、挪威博克马尔语、丹麦语、保加利亚语、芬兰语、克罗地亚语、斯洛伐克语、普通话、匈牙利语、罗马尼亚语和爱沙尼亚语。 8 个 adaptation-ready locale：希腊语、立陶宛语、拉脱维亚语、马耳他语、斯洛文尼亚语、希伯来语、泰语和新挪威语。Tokenizer 能识别它们，但 NVIDIA 表示需要 fine-tuning 才能完整转录。 Broad coverage 也不代表质量相同。在 NVIDIA 自报的 FLEURS 测试中，给定语言 ID、80 ms 设置下，transcription-ready 组平均 WER 为 10.38%，broad-coverage 组为 25.86%。普通话使用 CER。该测试基于规范化公开数据，不足以证明模型能处理带口音的 8 kHz 电话、多人重叠说话、产品名、地址或你的真实声学环境。 NVIDIA 报告的部分 FLEURS 结果，越低越好 Locale80 ms，已知语言80 ms，自动识别1.12 s，已知语言指标 西班牙语4.875.044.11WER 印地语8.1311.476.81WER 英语9.439.727.91WER 德语9.819.908.31WER 阿拉伯语13.1713.4712.03WER 普通话20.5622.4519.28CER 80 ms 是否表示转录会在 80 ms 内返回？ 不是。80 ms 是最小音频 chunk，并非用户感受到的完整响应时间。使用 att_context_size=[56,0] 时，模型处理一个 80 ms frame，不查看右侧未来上下文。完整系统还要计算音频采集、分包、网络、排队、feature extraction、推理、稳定性策略、VAD、end-of-turn、LLM 与 TTS。 输出侧也需要同样严格的判断。我们的 Miso TTS 本地部署对比 API 分析把托管服务公开的 110 ms time-to-first-byte，与本地 GPU 延迟及完整语音链路延迟分开评估。 语音智能体至少要分开记录四个时间： 首个 partial transcript：第一段可用文本何时出现。 Stable transcript：文本何时稳定到可以安全触发下游任务。 Final-token latency：从最后一个音频 sample 到最终 ASR token。 End-of-turn latency：系统何时能确认用户已经说完。 如果 320 ms 能减少错误、人工修正和误触发工具，同时保持对话流畅，它可能比 80 ms 更有商业价值。应测试延迟与质量曲线，而不是只追求最小数字。 H100 并发高 17 倍能证明什么？ 它证明 cache-aware streaming 可以让该 checkpoint 比 NVIDIA 选择的 buffered baseline 更节省算力。在 80 ms 设置下，NVIDIA 报告一张 H100 可持续处理 240 路实时流，Parakeet RNNT 1.1B 为 14 路，约 17.1 倍。在 1.12 秒设置下，两者为 2,400 对 400，约 6 倍。 这并不等于你的完整系统每张 GPU 可以稳定承载 240 通生产电话。Codec 转换、VAD、说话人分离、日志、编排、多租户、尾延迟、容量余量与故障切换都会消耗资源。比较对象还是 0.6B 与 1.1B 两种不同规模模型，不能推导出它优于 Whisper、Deepgram、Speechmatics、Google 或所有其他流式 ASR。 Nemotron 3.5 ASR 真的免费吗？ Checkpoint 没有按调用计费，但生产服务不可能零成本。OpenMDW-1.1 许可证免费授予使用、修改与分发 Model Materials 的广泛权利，但需保留许可证与来源声明，并包含专利和版权诉讼条款。Model card 表示该模型可用于商业用途并支持全球部署。 称其为“100% 开源”仍不准确。NVIDIA 公开了权重和推理路径，但训练数据包含专有的 NVIDIA Riva 数据集。Open Source AI Definition要求足够详细的训练数据说明，以及用于训练和运行系统的完整代码。更稳妥的描述是：采用宽松商业模型许可证的 open-weight 模型。 在庆祝没有 API 账单前，先计算基础成本。假设一张 H100 每个 wall-clock 小时 3 美元，并把 NVIDIA 的 240 路 benchmark 仅视为上限： 仅计算 GPU 的每转录音频小时示例成本 平均实时流240 路上限利用率每音频小时 GPU 成本未计入 240100%0.0125 美元全部生产开销与容量余量 6025%0.05 美元冗余、运维、存储与网络 125%0.25 美元同上 10.42%3.00 美元同上 这只是算术示例，不是报价或预测。作为当前托管方案参考，Deepgram 在 2026 年 7 月 19 日把 Nova-3 Multilingual streaming 标为每分钟 0.0058 美元，即每音频小时 0.348 美元。在假设的 3 美元 GPU 成本下，未计其他费用的 break-even 约为持续占用 9 路。若用两张 GPU 做 failover，则约为 18 路，且还没有计入工程和支持。托管 API 同时包含基础 checkpoint 没有的能力与运营责任。 团队可以怎样部署？ 有三条实用路径，各自许可证和运维负担不同： Hugging Face 加 NVIDIA NeMo。直接加载 OpenMDW checkpoint，使用 NVIDIA cache-aware streaming 代码，自行构建 serving layer。 Hugging Face Transformers。Transformers 5.13 起支持该模型的离线与流式生成，可给定 locale 或自动检测，适合评估和自定义集成。 NVIDIA ASR NIM。NVIDIA 已把多语言版本装入 GPU 加速容器，并提供 gRPC 与 HTTP API。官方 NIM 部署指南使用 type=multi。NIM 容器与模型有单独条款，不应把 checkpoint 的许可证结论直接套到整个容器。 当前 ASR NIM 支持矩阵要求 NVIDIA GPU 的 compute capability 至少为 8.0，物理显",
  "articleSection": "工程",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-07-19",
  "datePublished": "2026-07-19",
  "description": "NVIDIA Nemotron 3.5 ASR 值得用于多语言语音智能体的自托管转录试点，但它不是 零成本 turnkey 语音栈。这个 6 亿参数的 cache-aware FastConformer-RNNT checkpoint 覆盖 40 个语言 locale，其中只有 19 个 transcription-ready 与 13 个 broad-coverage locale 可开箱转录；另 8 个 adaptation-ready locale 需要 fine-tuning。80 ms 指无右侧上下文 lookahead 的最小音频 chunk，不是 端到端延迟保证。NVIDIA 报告一张 H100 可持续处理 240 路 80 ms 实时流， Parakeet RNNT 1.1B buffered baseline 为 14 路；17.1 倍只适用于这项特定比较。 OpenMDW-1.1 允许商业使用且不按调用收费，但 GPU 空闲、冗余、集成、监控、 评估与支持仍有成本。替换托管 API 前，应在生产音频上比较已知与自动语言模式， 测试 80、320 与 1,120 ms，记录 WER 或 CER、stable transcript、end of turn、 负载下 P95，以及每个验收音频分钟的总成本。",
  "headline": "NVIDIA Nemotron 3.5 ASR：免费自托管 STT 能否用于语音智能体？",
  "image": "https://wavect.io/img/blog/headers/header_nvidia-nemotron-3-5-asr-production-review.svg",
  "inLanguage": "zh",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/zh/blog/nvidia-nemotron-3-5-asr-production-review/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/zh/blog/nvidia-nemotron-3-5-asr-production-review/",
  "wordCount": 961
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/",
      "name": "首页",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/overview/",
      "name": "博客概览",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/topics/ai-agents/",
      "name": "AI 与智能体",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/clusters/models-infrastructure/",
      "name": "模型与基础设施",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/zh/blog/nvidia-nemotron-3-5-asr-production-review/",
      "name": "Nemotron 3.5 ASR 评测：成本、延迟与语音智能体 | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "更准确的说法是采用 OpenMDW-1.1 的 open-weight 模型。许可证广泛允许商业使用、修改与分发，但 NVIDIA 没有公开 Open Source AI Definition 所要求的全部专有训练数据与完整训练流程。"
      },
      "name": "NVIDIA Nemotron 3.5 ASR 是开源模型吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "不是。NVIDIA 列出 40 个语言 locale：19 个 transcription-ready、13 个 broad-coverage，以及 8 个需要 fine-tuning 才能完整转录的 adaptation-ready locale。每种语言、口音、领域和音频通道都应单独验证。"
      },
      "name": "Nemotron 3.5 ASR 是否开箱支持 40 种语言？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "最小音频 chunk 为 80 ms，不查看右侧未来上下文。这不等于完整转录或语音智能体延迟。应分开测量首个 partial、stable text、final token、end of turn、网络、LLM 与 TTS。"
      },
      "name": "Nemotron 3.5 ASR 的延迟真的是 80 ms 吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "NVIDIA 报告在 80 ms 设置下一张 H100 可持续处理约 240 路实时流，对比 Parakeet RNNT 1.1B buffered baseline 的 14 路。把 240 视为 benchmark 上限，并为完整生产 pipeline 留出余量。"
      },
      "name": "一张 H100 能运行多少路 Nemotron 3.5 ASR？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "OpenMDW-1.1 checkpoint 不按调用收费，NVIDIA 表示可用于商业用途。GPU、冗余、工程、监控、存储、评估与支持仍需付费。NVIDIA NIM 还有单独的软件与模型条款。"
      },
      "name": "Nemotron 3.5 ASR 可免费商用吗？"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "它的架构更适合原生低延迟流式处理。Whisper 生态更广、更成熟，仍是强大的批处理与多语言 baseline。请用自己的音频、延迟目标、语言组合、功能需求与总成本进行对比。"
      },
      "name": "Nemotron 3.5 ASR 比 Whisper 更适合语音智能体吗？"
    }
  ]
}
```
