返回
Kevin Riedl

8 分钟 阅读 · 2026年7月28日

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

Taalas HC1 评测:每秒 17,000 token,以及专用化的代价

Taalas HC1 是一款 AI 推理 ASIC,把量化后的 Llama 3.1 8B 模型固化在芯片中。Taalas 宣称它能为每位用户提供每秒约 17,000 个输出 token。这个结果确实惊人,但它来自厂商针对一个模型、一种序列长度和一套技术演示平台的测试。它既不是通用 GPU 的终结者,也不是已经算清楚的商业方案。

真正值得问的,不是专用芯片能否在唯一目标上超过通用加速器。答案显然是可以。关键在于:你的产品能否长期使用同一个基础模型,能否持续喂满这套硬件,以及能否接受它的质量上限。本文把发布会数字转换成 CTO 和 AI 产品团队可以执行的采购框架。

正在为实际产品选择推理 API、GPU 或专用 AI 硬件?

 规划 AI 架构评审

60 秒看懂 Taalas HC1

Taalas HC1 公开信息及采购含义,核验于 2026 年 7 月 28 日
问题公开答案采购含义
HC1 是什么?面向单一模型的 AI 推理 ASIC 和技术演示平台应把它视为早期专用基础设施,而不是普通 GPU 扩展卡。
运行什么模型?固化在芯片中的量化版 Llama 3.1 8B同一块芯片不能换装另一个基础模型。
有多快?Taalas 宣称每位用户每秒约 17,000 个输出 token引用这个数字时必须同时写明测试条件和质量限制。
测试条件是什么?1K 输入和 1K 输出不能直接外推到长上下文、高并发或你的真实 prompt 分布。
芯片规格是什么?台积电 6 nm、815 mm²、530 亿个晶体管这是一颗尺寸很大、专用程度很高的芯片。
公开系统功耗是多少?Taalas 产品页列出 2.5 kW 服务器完整系统应与完整系统比较,不能把芯片宣传值与 GPU 服务器直接比较。
能否微调?Taalas 称支持 LoRA 和可配置上下文适配器能调整任务表现,但不能替换固化的基础模型。
可以买到吗?没有公开零售价,也没有通用硬件销售页面目前主要是演示;官方 API 申请页面显示已经关闭。

把 LLM 硬编码进芯片,究竟是什么意思?

GPU 推理时,模型权重存放在 HBM 或其他内存中,再被搬运到可编程计算单元。HC1 则把模型存储和计算放到同一块芯片上。固定权重和模型结构成为芯片实现的一部分,因此生成每个 token 时,不必反复跨越片外内存边界搬运数十亿个参数。

这种做法直接攻击 AI 推理的内存墙。自回归解码通常批量较小,每生成一个 token 都要再次读取整套权重。针对单一模型设计的数据路径,可以移除通用调度、软件抽象和大量内存搬运。Taalas 表示,从收到一个新模型到做成硬件大约需要两个月。

专用化并不会消除所有动态部分。prompt、生成 token、激活值、KV cache、采样、网络和业务逻辑仍然存在。完整服务仍需要主机系统和动态内存。准确说法是,固化模型的执行路径不需要 GPU 和 HBM,而不是整套产品不需要计算机、CPU 或内存。

每秒 17,000 token 到底证明了什么?

HC1 官方产品页给出的条件是 Llama 3.1 8B、1K 输入、1K 输出,每位用户每秒 17K token。Taalas 在发布文章中称,这接近当时先进水平的 10 倍。其对比图使用 NVIDIA H200 基准、由 Taalas 测得的 B200,以及多家推理服务商的第三方数据。HC1 本身由 Taalas 实验室测试。

每位用户 tokens/s 衡量的是交互速度,不是整套集群的总吞吐。它说明一条活跃输出流有多快,却不能单独回答并发用户数、首 token 延迟、prompt 处理速度、尾延迟、可用性或每个成功任务的成本。NVIDIA 也把每位用户 token、每瓦 token 和每百万 token 成本列为不同的生产指标。

HC1 上的模型也不等同于常规高精度 Llama 部署。Taalas 说明第一代芯片使用自定义 3-bit 和 6-bit 参数组合,并承认相对 GPU 基准存在质量下降。只有在候选方案通过同一套任务评测之后,速度对比才有商业意义。极速生成错误答案,不会带来好的单位经济性。

把宣传数字放回边界内

说法已经得到支持的部分采购方仍需验证的部分
每秒 17,000 tokenTaalas 在 1K 输入、1K 输出下测得的每用户输出速度你的上下文、并发、P95 延迟和端到端任务时间
制造成本低 20 倍Taalas 对自身架构的厂商说法采购价、API 价格、利用率、冗余和五年 TCO
功耗低 10 倍Taalas 的对比说法;芯片架构不依赖 HBM 或液冷同口径服务器功耗、每个合格 token 的能耗和机房成本
两个月做出新模型芯片Taalas 公布的模型到硬件周期排期、产量、认证、软件集成和升级条款
支持微调Taalas 称支持 LoRA 适配器适配器容量、质量上限和你的运维流程

哪些场景可能适合模型专用 ASIC?

合适的客户不只是 AI 账单很高,而是同时拥有稳定模型、高利用率、严格延迟目标和清晰验收标准。

  • 高流量、重复性强的 Agent 步骤。路由、抽取、分类和受约束生成适合极低延迟,前提是 8B 级模型能稳定通过任务评测。
  • 实时语音和交互系统。降低生成延迟后,语音识别、检索、工具调用和语音合成可以获得更多延迟预算。
  • 多候选生成。快速固定模型可以批量生成草稿或工具计划,再由更强模型验证和排序。
  • 封闭且可预测的部署。已知负载和较长硬件生命周期,更容易摊销专用化成本。
  • 混合推理。固定模型处理常见路径,灵活 GPU 或 API 处理困难请求、新能力和故障回退。

混合架构通常比一次性全面迁移更有商业韧性。专用芯片可以在已知流量上持续创造价值,而未来所有功能不必被锁进一款逐渐老化的 8B 基础模型。

哪些情况下 GPU 或 API 更稳妥?

  • 最佳模型每季度都在变化。LoRA 可以改变行为,却不能把固化的 Llama 3.1 8B 变成新基础架构。
  • 质量比延迟更影响收入。如果更大的推理或多模态模型显著提高完成率,小模型即使更快,每次成功任务也可能更贵。
  • 需要运行多类模型。GPU 可以在 embedding、reranker、视觉、语音和多个 LLM 之间共享。
  • 需求不确定或波动大。专用设备闲置时优势会消失,API 则把利用率风险交给供应商。
  • 需要成熟运维。采购、监控、驱动、支持、故障切换和供应能力都是产品的一部分。HC1 目前仍被称为技术演示平台。
  • 长上下文是核心。KV cache 和动态状态仍会随上下文和并发增长。

采购更快硬件之前,还应检查现有架构是否在浪费算力。我们的共享 KV cache 分析展示了一个公开测试:仅消除重复 prefill,就在不增加 GPU 的情况下把平均首 token 延迟缩短了约 14 倍。

不要把模型锁定藏在 TCO 里

HC1 没有公开零售价,因此可信的 ROI 不能从传闻中的扩展卡价格开始。先向供应商索取报价或 API 费率,再比较每个合格任务的完整成本:

每个合格任务成本 =(硬件或 API + 电力 + 托管 + 集成 + 运维 + 冗余 + 升级减值)/ 已完成且验收通过的任务数

分母应是合格任务,而不是原始 token。量化造成的质量差异、重试和回退调用,都可能吃掉 token 单价优势。除非合同或二手市场能证明,否则残值按零计算。一块绑定老旧基础模型的芯片,通常很难改作他用。

因素应该测量什么常见误区
质量按语言和难度划分的任务验收率认为模型名称相同,量化后的质量就相同
需求忙时负载和全年合格输出按全年满负载估算峰值速度价值
延迟TTFT、token 间延迟和端到端 P95把解码速度当作完整响应时间
能源服务器功耗和每个合格任务的焦耳数拿芯片宣传值与完整 GPU 服务器比较
变化预计更换基础模型的日期忽略模型不再够用时的资产减值
韧性备用容量、故障切换和支持 SLA用一套演示平台对比冗余生产服务

如需更完整的自建成本计算,可使用我们的本地模型与 API 盈亏平衡框架。如果产品层面仍在决定购买还是自建,定制软件与现成方案决策指南提供了同样的差异化和全生命周期成本方法。

投入前必须通过的六道门

  1. 冻结任务,不要先冻结模型。测试基础设施前,明确业务结果、语言、安全规则和验收阈值。
  2. 建立代表性评测集。覆盖普通 prompt、长上下文、工具失败、攻击输入和用户真实语言。
  3. 比较相同结果。HC1 应与能通过同一质量门槛的最便宜 GPU 或 API 方案比较。
  4. 压测完整链路。记录 prompt 处理、TTFT、输出速度、并发、P95/P99、错误、功耗和回退率。
  5. 给模型变化定价。写清更好基础模型出现、新需求无法满足或供应商延期时的处理方式。
  6. 分阶段承诺。先使用 API 或托管访问,路由一小部分流量,只有实测利用率和任务成本支持时才投入资本。

这也是我们建设生产级 AI 内容平台 Prompt.ID时采用的方法:产品架构必须同时覆盖工作流、质量和运维,而不能只看模型输出。任何一道门缺少数据,都应记录为采购风险,而不是用厂商说法填空。

来源与结论边界

HC1 规格、17K tokens/s 和 1K/1K 条件来自 Taalas 官方产品页。架构、两个月模型转芯片周期、LoRA、3-bit 与 6-bit 量化、厂商承认的质量下降和路线图来自创始人 Ljubisa Bajic 的发布文章官方 API 页面目前显示申请关闭。Llama 3.1 8B 的能力和许可背景来自 Meta 官方公告。市场与商业风险判断也参考了 TrendForce 2026 年 6 月的行业分析。事实核验日期为 2026 年 7 月 28 日。Wavect 没有独立复现 HC1 测试。在可比第三方测试出现前,成本和功耗倍数仍属于厂商说法。

常见问题

Taalas HC1 是什么?

Taalas HC1 是采用 6 nm 工艺、面向单一模型的 AI 推理 ASIC,也是技术演示平台。它把量化后的 Llama 3.1 8B 固化在芯片中,让模型存储和计算位于同一块硅片。

Taalas HC1 真的能达到每秒 17,000 token 吗?

Taalas 宣称,在 1K 输入和 1K 输出条件下,Llama 3.1 8B 每位用户每秒可生成约 17,000 个输出 token。HC1 数据来自 Taalas 实验室。应把它视为这些条件下的厂商测试结果,而不是对不同上下文、并发或端到端任务的保证。

HC1 真的不需要 GPU、CPU 或内存吗?

固化模型的执行路径不需要 GPU 和 HBM,但完整服务仍需要动态状态、KV cache、prompt、采样、应用逻辑、网络和主机系统。Taalas 产品页列出的是一套 2.5 kW 服务器,因此完全不需要 CPU、内存或计算机是误导性概括。

Taalas HC1 能运行其他 LLM 吗?

同一套固化基础模型芯片不能换装其他 LLM。LoRA 和可配置上下文提供一定灵活性,但更换基础模型需要不同的专用芯片。Taalas 宣称其模型到硬件流程约需两个月。

现在可以买到 Taalas HC1 PCIe 卡吗?

Taalas 公开把 HC1 定位为技术演示平台,没有公布零售扩展卡价格或通用硬件销售计划。官方推理 API 申请页目前也显示关闭。商业访问应直接向 Taalas 核实,不能用传闻价格建立 ROI 模型。

什么时候专用 LLM ASIC 比 GPU 更合适?

当一个经过验证的模型能长期服务稳定、高流量、低延迟负载时,专用 ASIC 可能更合适。如果基础模型频繁变化、多类模型共享设备、需求不确定,或最佳模型质量比解码速度更重要,GPU 通常更安全。

企业采用 HC1 前应该测试什么?

测试任务验收率、prompt 处理、首 token 时间、输出速度、P95/P99、并发、服务器级功耗、错误、回退调用和每个合格任务成本。评测必须覆盖产品真实的语言、上下文长度和工具调用分布。

最终思考

Taalas HC1 证明了一个方向:当模型成为硬件的一部分,针对单一 LLM 的解码延迟可以大幅下降。每秒 17,000 token 值得重视,但它没有消除量化、模型老化、动态内存、服务器功耗、采购和供应商风险。

HC1 是推理设计曲线上的新选项,不是 GPU 的终点。若负载稳定,8B 级模型也能通过质量门槛,专用芯片可以成为强大的快速路径。若产品优势依赖不断更换模型、模态或能力,灵活性本身仍然有基础设施价值。采购决策应建立在实测合格结果上,而不是图表中最大的 token 数字上。

在投入推理基础设施前,需要一套基准计划和 TCO 模型?

 规划推理架构决策

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

8 分钟 阅读 · 2026年7月28日

下一篇

通过邮件获取新文章

我们发布时给你一封简短邮件。免费,不做跟踪。

免费、双重确认、不使用跟踪像素。