返回
Kevin Riedl

9 min 阅读 · 25 Jun 2026
最近审核

下一篇
图片在你的设备上生成,不连接 Instagram。文章链接会复制到剪贴板,供链接贴纸使用。

2026 最佳开放权重 LLM:DeepSeek vs Qwen vs Kimi vs GLM vs Llama

最佳开放权重 LLM 取决于你的运维能力和许可证边界。DeepSeek V4 主打效率,Qwen 覆盖最广模型规模,Kimi K3 面向超长多模态智能体任务,GLM-5.2 面向长程推理与编码,Llama 4 生态成熟,但欧盟许可限制最值得先核查。

难点在于,“开源权重”不是一个单一决定。DeepSeek、Qwen、Kimi、GLM 和 Llama 在许可证、上下文窗口、编码与推理的强弱、以及你能否在数据所在地合法运行它们这几点上各不相同。凭一个基准标题来选,你可能落到一个做不了你任务的模型上,或者一个你根本不被允许部署的模型上。这就是我们在把一个模型投入生产之前所做的正面对比,以及我们权衡取舍的顺序。

这是工程视角,不是供应商推销。官方模型卡、代码仓库与许可证于 2026 年 8 月 7 日重新核查。选择应从权重、活跃参数、上下文、许可证和硬件开始,公开 benchmark 只有通过你的评估后才有决策价值。

需要按任务、欧盟边界和 GPU 预算筛选模型吗?

 为我的负载筛选模型

2026 年开源权重家族之间到底差在哪?

它们不是同一个模型的五个版本。每个家族下了不同的赌注,而这个赌注决定了它在你技术栈里的位置。

  • DeepSeek。价格颠覆者。MIT 许可的权重,强大的通用推理和编码,以及锚定市场底部的单位 token 价格。flash 档是高用量工作里最便宜的可信选项,pro 档能拿到接近 frontier 的编码分数。
  • Qwen(阿里巴巴)。最宽的家族。从极小到旗舰的众多尺寸,多数较小的开放档位采用 Apache 2.0,这是这里最宽松的许可证。托管的 Max 档最强,但不是开源权重,所以别以为整个家族都能自托管。
  • Kimi K3(Moonshot)。它主打规模与智能体记忆。Kimi K3 有 2.8 万亿总参数、1040 亿活跃参数、1M 上下文、原生视觉和自有许可证。约 1.6 TB 权重让自托管成为集群项目。
  • GLM(智谱 / Z.ai)。编码优先的旗舰。MIT 许可的开源权重,一个长上下文窗口,以及在长程软件任务上能与西方 frontier 互有胜负的编码基准成绩,成本只是其一个零头。
  • Llama(Meta)。西方开源权重的老牌。巨大的上下文窗口和深厚的工具生态,但用的是自家社区许可,不是真正的开源许可,而且许可条款限制了在欧盟的使用。对一个欧盟团队来说,这条限制是最重要的一项。

规律是:中国的家族在价格上竞争,并且越来越多地在编码质量上竞争。Llama 在生态和上下文长度上竞争,却背着许可包袱,而这个包袱对欧盟团队打击最重。

德国新推出的 Soofi S 属于另一个类别:一个面向德语和英语的主权模型,最终计划开放的内容远不止权重。我们的Soofi S 采购评估核查其评测、慕尼黑训练来源、尚未完成的 preview 许可证,以及欧洲企业启动试点前必须满足的条件。

Kimi K3 现在需要一项独立于旧 K2 家族的采购判断。我们的Kimi K3 企业 API 评测核查实时价格、独立表现、新加坡数据位置、公开合同缺口、迁移限制和两周可测量试点。本文继续负责更广泛的模型家族对比。

它们在规模、上下文、许可证和硬件上怎么比?

下表使用当前代表性开放 checkpoint,而不是仅共享家族名称的托管产品。

家族代表模型总参数 / 活跃参数上下文许可证自托管影响
DeepSeekV4 Flash / Pro284B / 13B;1.6T / 49B1MMITFlash 约从四张、Pro 约从八张 B200/B300 GPU 起步
QwenQwen3.5 / 3.6 开放模型因模型而异因模型而异,部分到 1M常见 Apache 2.0;需核查具体 checkpoint从工作站模型到集群均有选择
KimiKimi K32.8T / 104B1M自有 Kimi K3 许可证约 1.6 TB 权重,需要集群级硬件
GLMGLM-5.2总计约 753B1MMIT多 GPU 或实验性存储卸载
LlamaLlama 4 Scout / Maverick109B / 17B;400B / 17B10M / 1M自有社区许可证技术工作前先解决欧盟多模态权利限制

有两点跳出来。第一,中国的家族在单位 token 上大致比最高的西方 frontier 档位低 10 到 30 倍,这正是它们为高用量产品重排成本账的原因。第二,许可证不是脚注。MIT 和 Apache 2.0 让你能自托管、能放进专有产品里交付,而不必谈版税。带使用例外的自家社区许可做不到,而对一个欧盟团队,Llama 的欧盟限制可能在价格都还没进入讨论之前就把它从桌上拿掉。

编码还是推理:哪个家族赢哪份活?

没有单一赢家,因为编码和推理奖励的是不同的东西。对 2026 年基准的诚实解读,照例提醒一句,基准落后现实好几个月:

  • 长程编码智能体。GLM-5.2 与 Kimi K3 面向长工具流程,DeepSeek V4 Pro 是更高效的对照候选。应比较完成任务率与恢复表现,而不是单个编码分数。
  • 通用推理和广度。DeepSeek 的 pro 档和 Qwen 的旗舰把最宽的任务范围覆盖得很好。DeepSeek 尤其能以一个让它成为对成本敏感的通用工作默认选择的价格,拿到接近 frontier 的推理分数。
  • 孤立任务上的纯编码准确率。开源权重在 SWE-bench 类套件上的最高分,现在已落在领先的西方 frontier 模型后面个位数百分点之内。两年前还要紧的差距,对日常工程工作已基本闭合。
  • 最难的推理仍偏西方。在最难的推理和最深的 agent 循环上,最高的 Claude 和 GPT 档位仍然领先。当一个错误答案代价高昂时,一旦把修正糟糕输出的开发时间算进去,frontier 模型在总成本上仍可能胜出。我们在 如何在 2026 年降低 LLM token 成本 中谈过这个取舍。
Kevin Riedl

"基准标题告诉你先测哪个模型。你自己的评估告诉你该上线哪个。这俩不是同一个模型的频率高到,你不得不去跑那个评估。"

你能在欧盟自托管它们而不头疼合规吗?

对一个欧洲团队来说,这里是各家族分化最狠的地方,而且这里许可证比基准更要紧。

  • DeepSeek、GLM、Kimi。MIT 和修改版 MIT 权重意味着你可以把它们下载下来,在欧盟基础设施上跑推理。数据从不离开你的辖区,而你保住了价格优势。难点不是许可证,是运维分量:GPU 容量、一套推理栈,以及知道模型仍在发挥的评估纪律。
  • Qwen 开放档位。Apache 2.0 是表里最宽松的选项,自托管干净利落。但旗舰 Max 档仅托管,且跑在欧盟之外,所以一个只写“Qwen”而不点名档位的自托管方案,可能悄悄把数据路由出境。
  • Llama。自家社区许可限制了欧盟使用,这是个法律问题,不是技术问题。在你基于它构建之前先把许可立场理清,无论那个上下文窗口看起来有多诱人。

更深一层:把一个中国开源权重模型自托管在欧盟基础设施上,是同时拿到价格和数据驻留说法的那一步。通过一个欧盟之外的托管 API 跑同一个模型,给你价格,却先给你挂上一个合规问题。哪条路合适,取决于你的数据分级,以及你把推理放在自家跑的意愿。如果你的团队是头一次搭起这套内部 AI 能力,那正是我们 AI 赋能工作覆盖的领域。无论哪种,推理在哪里跑、数据落在哪里,是一个要刻意去做的决定,而不是默认。

那你到底该选哪个?

按最难改变的约束来选,而不是按标题。我们走过的顺序:

  1. 先看许可证和辖区。如果你是个需要自托管的欧盟团队,Llama 的欧盟限制大概会把它排除,于是你在 DeepSeek、GLM、Kimi 和 Qwen 开放档位之间选。在你基准测试任何东西之前先把这件事定下来。
  2. 把家族和任务配对。长程智能体应测试 GLM-5.2、Kimi K3 与 DeepSeek V4 Pro;成本敏感的通用任务先测 DeepSeek V4 Flash;需要宽硬件梯度时筛选 Qwen 开放 checkpoint;Llama 4 应先解决许可证问题。
  3. 把档位选对大小。大多数流量用不上旗舰。一个便宜默认、按需升级到更强档位的做法,也就是路由模式,通常胜过在一切上都跑最大的模型。
  4. 换之前先跑你自己的评估。基准是一个起点假设,不是部署决定。在你真实的任务上搭一个小评估框架,在它碰生产之前证明模型守住质量。一个每 10 个你的任务失败 1 个的便宜模型,并不便宜。
  5. 每隔几个月重新核对。这些家族以月为节奏出新版本和新价格。今天的正确选择是一张快照,不是永久答案。

我们在生产中的 AI 工作里跑的正是这套序列,包括像 Twinsoft AI 这样的项目,让一次模型替换变安全的纪律,是评估框架,不是基准表。

那个人人都跳过的评估框架呢?

上面每条建议都建立在一件团队习惯性跳过的事上:一个建立在你自己任务上的评估框架。公开基准被污染、被刷分、落后好几个月,而且它们衡量的是不属于你的任务。在某个排行榜上居首的模型,对你的数据、你的 prompt 和你的边缘情况,仍可能是错误的选择。

这个框架不必精巧。几十个有清晰通过条件的代表性任务,对每个候选模型跑一遍,告诉你的东西比任何排行榜都多。它也是日后安全换模型的唯一办法,因为它能在几分钟内告诉你一个更便宜或更新的模型是否守住了质量线。没有它,每次换模型都是一场赌博,而一场悄悄掉质量的赌博,是整个格局里最贵的错误。

最终思考

2026 年没有通用冠军。DeepSeek V4 提供最强效率梯度,Qwen 覆盖最广模型规模,Kimi K3 提供超大规模和 1M 上下文,GLM-5.2 面向长程编码与推理,Llama 4 生态成熟但有重要欧盟许可限制。

先按许可证、辖区和硬件筛选,再用自己的任务测量质量、长上下文表现和总成本。最佳模型,是通过评估和运维要求的最小、且可合法部署的 checkpoint。

想要对你的模型选择来个第二意见?

 预约免费咨询

生产级 AI 支持

正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。

查看相关服务:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

9 min 阅读 · 25 Jun 2026
最近审核

下一篇

通过邮件获取新文章

我们发布时给你一封简短邮件。免费,不做跟踪。

免费、双重确认、不使用跟踪像素。