本文内容
2026 最佳开放权重 LLM:DeepSeek、Qwen、Kimi、GLM 与 Llama
不存在适用于所有场景的最佳开放权重模型。截至 2026 年 9 月 2 日,DeepSeek V4 提供两个采用 MIT 许可证的大型档位;Qwen3.8 提供采用 Apache 2.0 的 27B 多模态检查点和采用自有 Max 许可证的 2.4T 稀疏模型;Kimi K3 在自有许可证下提供原生多模态与 100 万 token 窗口;GLM-5.3 在新的宽松自有许可证下侧重长流程编程;Llama 4 的工具生态广泛,但其多模态授权不授予位于欧盟的开发者。
“开放权重”只表示权重可下载。它不保证许可证获得开放源代码促进会认可,也不保证硬件成本低、托管版与自部署版行为一致,或模型在宣传的最大上下文长度上仍有可用质量。应按具体检查点和许可证筛选,再用自己的任务测试。
这是工程视角,不是厂商宣传。我们于 2026 年 9 月 2 日复核了官方模型卡、仓库和许可证文本。厂商基准表可作为发布证据,但其测试框架和设置不同,不能据此得出中立的跨厂商冠军。
需要符合任务、欧盟边界和 GPU 预算的模型候选清单?
为我的负载筛选模型当前各模型家族有何区别?
- DeepSeek V4。当前官方仓库包括 V4 Flash-0731 和 V4 Pro-0813,两者均采用 MIT。最初的 V4 模型卡记录了 100 万 token 上下文和稀疏架构,而带日期的检查点已经取代预览版。
- Qwen3.8。阿里巴巴的官方 Qwen3.8 集合包括 27B 多模态模型,以及总参数 2.4T、激活参数 95B 的稀疏模型。27B 模型卡标明原生 262,144 token,可通过 YaRN 扩展到 100 万,并采用 Apache 2.0。2.4T 检查点采用 Qwen3.8-Max 许可证,对超大型产品以及大型 MaaS 或 AI 工作助手企业设置条件。扩展只是一种服务配置,不证明所有任务在 100 万长度上仍可靠。
- Kimi K3。Moonshot 的模型卡标明总参数 2.8T、激活参数 104B,原生支持文本、图像和视频输入,以及 100 万 token 上下文。Kimi K3 许可证为大型模型即服务企业和超大型商业产品增加条件,同时将内部使用排除在这些附加条件之外。
- GLM-5.3。Z.ai 在 GLM-5.2 之后发布了 GLM-5.3。它使用同一个 753B 基础模型,以最高 100 万 token 进行评测,并针对编程与长流程任务调整后训练。其 GLM-5.3 许可证较宽松,但没有标为 MIT,因此此前的 MIT 说法不再适用于当前检查点。
- Llama 4。Meta 的模型卡列出 Scout 总参数 109B、激活 17B、上下文 1000 万;Maverick 总参数 400B、激活 17B、上下文 100 万。其使用政策不向居住在欧盟的个人或主要营业地在欧盟的公司授予多模态权利,但明确排除了集成这些模型之产品的最终用户。
Soofi S 属于不同类别。我们的 Soofi S 采购评测区分公开证据和发布计划。我们的 Kimi K3 API 欧盟评测将 Moonshot 托管服务视为与运行可下载权重不同的采购决策。
规模、上下文、许可证与部署
| 家族 | 当前代表检查点 | 公布规模 | 公布上下文 | 权重许可证 | 部署含义 |
|---|---|---|---|---|---|
| DeepSeek | V4 Flash-0731 / Pro-0813 | 总参数 304B / 1.7T | V4 家族:100 万 | MIT | 大型多 GPU 部署;按具体权重格式计算 |
| Qwen | Qwen3.8-27B / 2.4T-A95B | 27B 稠密 / 总参数 2.4T、激活 95B | 27B:原生 262,144,可扩展至 100 万 | Apache 2.0 / Qwen3.8-Max 许可证 | 27B 更易部署;2.4T 属于集群级 |
| Kimi | Kimi K3 | 总参数 2.8T / 激活 104B | 100 万 | Kimi K3 许可证 | 集群级检查点并需专项许可证审查 |
| GLM | GLM-5.3 | 总参数 753B | 100 万 | GLM-5.3 许可证 | 大型多 GPU 或实验性卸载服务 |
| Llama | Llama 4 Scout / Maverick | 109B / 激活 17B;400B / 激活 17B | 1000 万 / 100 万 | Llama 4 社区许可证 | 先解决欧盟多模态开发者限制 |
这些是最大上下文声明,而非质量保证。长序列会增加 KV 缓存需求,并可能降低并发。量化会改变内存需求,有时也会改变输出质量。若未明确精度、运行时、上下文、批量和冗余,就不要把参数量换算成固定 GPU 数量。
编程和智能体该测试哪个家族?
一手资料支持候选清单,而非通用排名。DeepSeek Flash-0731、Qwen3.8、Kimi K3 和 GLM-5.3 的模型卡都公布编程及智能体基准,但使用不同框架、推理设置、任务版本,有时还有内部测试集。只有任务、数据划分、框架、工具权限和评分方法一致时才应比较数值。
- 较易管理的多模态自部署:若 Apache 2.0、27B 规模和原生 262K 窗口适合任务,可先测 Qwen3.8-27B。
- 大型编程或工具评测:用任务完成率、恢复行为、延迟和总服务成本测试 DeepSeek V4 Flash-0731、GLM-5.3 与 Kimi K3。
- 超长上下文:在实际长度测试检索准确度和任务完成率。100 万或 1000 万上限只说明输入可以被接受。
- 在欧盟使用 Llama 4:开发者下载或部署多模态权重前应进行法律审查。最终用户例外不等于开发者许可证。

"模型卡告诉你在什么许可证下测试什么。你自己的评测告诉你部署什么。不要混淆这两个决定。"
能否在欧盟自部署?
DeepSeek V4 和 Qwen3.8-27B 采用标准宽松许可证。Qwen3.8-2.4T-A95B、GLM-5.3 与 Kimi K3 在各自许可证文本下授予广泛权利,但附带需要单独审查的条件。Llama 4 是例外:其政策不给欧盟开发者多模态权利,但保留了集成产品最终用户的例外。
自部署可以把推理留在欧盟控制的环境中,但不会自动证明符合 GDPR。仍需处理合法依据、数据最小化、保留期限、访问控制、处理者与跨境传输分析、日志政策及事故流程。托管端点的数据位置和合同取决于服务,必须与可下载检查点分开评估。
可辩护的选型流程
- 明确具体检查点。家族名称会掩盖权重、模态、上下文配置和许可证差异。
- 先解决许可证和司法辖区。记录许可证版本,对后果重大的部署寻求法律意见。
- 预算实际服务配置。计入精度、上下文、并发、运行时开销、冗余和网络拓扑。
- 运行同一套私有评测。至少比较两个候选,使用代表性任务、稳定提示、相同工具权限和明确通过条件。
- 固定并监控版本。记录权重版本、分词器、运行时、量化和安全配置。
为什么评测框架很重要?
公开基准可能受数据污染、过拟合和测试框架影响,更重要的是它们不是你的工作负载。几十个带明确通过条件的代表性任务,可以暴露总分掩盖的问题。应测量任务完成质量、延迟、成本、工具错误、长上下文检索,以及失败后的恢复。
最终思考
截至 2026 年 9 月 2 日,当前对比对象是 DeepSeek V4 的 0731 与 0813 检查点、Qwen3.8、Kimi K3、GLM-5.3 和 Llama 4。Qwen3.8-27B 是其中最易部署的明确检查点,而最大的 Qwen、DeepSeek、Kimi 和 GLM 档位需要集群级规划。Qwen3.8-Max、Kimi 与 GLM 使用模型专属许可证,Llama 4 对欧盟多模态开发者的限制仍是关键因素。
选择能通过自身评测的最小合法检查点。把上下文长度视为待验证上限,把厂商基准视为发布证据而非中立排名,并把托管 API 与可下载权重视为不同的合规产品。