本文内容
2026 开放权重 LLM:DeepSeek、Qwen、Kimi、GLM、Llama 与 Muse
没有普遍最好的开放权重模型。本候选清单复核于 2026 年 10 月 5 日,涵盖 DeepSeek V4、规模与许可差异显著的 Qwen3.8 各档、Kimi K3、GLM-5.3、Llama 4 及 Meta 的 Muse Glimmer-30B。评估工作站级 Agent 时,应对比 Qwen3.8-27B 与 Muse Glimmer-30B。不要将 Llama 4 针对欧盟多模态开发者的限制套用于 Muse 独立的 Apache 2.0 版本。
“开放权重”只表示权重可下载。它不保证许可证获得开放源代码促进会认可,也不保证硬件成本低、托管版与自部署版行为一致,或模型在宣传的最大上下文长度上仍有可用质量。应按具体检查点和许可证筛选,再用自己的任务测试。
这是一份经过复核的采购候选清单,并非声称完整列出所有最新模型。我们于 2026 年 10 月 5 日核对所列检查点及许可来源,并补入此前遗漏的 Muse Glimmer。供应商基准表反映其自身配置,不是中立跨厂商排名,也不是 Wavect 实测。
需要符合任务、欧盟边界和 GPU 预算的模型候选清单?
为我的负载筛选模型当前各模型家族有何区别?
- DeepSeek V4。当前官方仓库包括 V4 Flash-0731 和 V4 Pro-0813,两者均采用 MIT。最初的 V4 模型卡记录了 100 万 token 上下文和稀疏架构,而带日期的检查点已经取代预览版。
- Qwen3.8。阿里巴巴的官方 Qwen3.8 集合包括 27B 多模态模型,以及总参数 2.4T、激活参数 95B 的稀疏模型。27B 模型卡标明原生 262,144 token,可通过 YaRN 扩展到 100 万,并采用 Apache 2.0。2.4T 检查点采用 Qwen3.8-Max 许可证,对超大型产品以及大型 MaaS 或 AI 工作助手企业设置条件。扩展只是一种服务配置,不证明所有任务在 100 万长度上仍可靠。
- Kimi K3。Moonshot 的模型卡标明总参数 2.8T、激活参数 104B,原生支持文本、图像和视频输入,以及 100 万 token 上下文。Kimi K3 许可证为大型模型即服务企业和超大型商业产品增加条件,同时将内部使用排除在这些附加条件之外。
- GLM-5.3。Z.ai 在 GLM-5.2 之后发布了 GLM-5.3。它使用同一个 753B 基础模型,以最高 100 万 token 进行评测,并针对编程与长流程任务调整后训练。其 GLM-5.3 许可证较宽松,但没有标为 MIT,因此此前的 MIT 说法不再适用于当前检查点。
- Llama 4。Meta 的模型卡列出 Scout 总参数 109B、激活 17B、上下文 1000 万;Maverick 总参数 400B、激活 17B、上下文 100 万。其使用政策不向居住在欧盟的个人或主要营业地在欧盟的公司授予多模态权利,但明确排除了集成这些模型之产品的最终用户。
- Muse Glimmer-30B。Meta 的官方模型卡注明该模型于 2026 年 8 月发布,采用 Apache 2.0,含视觉感知编码器共约 296 亿参数,支持文本与图像输入、文本输出,公布上下文为 131,072+。它面向本地 Agent 工作流。其模型与许可独立于 Llama 4,并非取消了 Llama 自身的限制。
Soofi S 属于不同类别。我们的 Soofi S 采购评测区分公开证据和发布计划。我们的 Kimi K3 API 欧盟评测将 Moonshot 托管服务视为与运行可下载权重不同的采购决策。
规模、上下文、许可证与部署
| 家族 | 当前代表检查点 | 公布规模 | 公布上下文 | 权重许可证 | 部署含义 |
|---|---|---|---|---|---|
| DeepSeek | V4 Flash-0731 / Pro-0813 | 总参数 304B / 1.7T | V4 家族:100 万 | MIT | 大型多 GPU 部署;按具体权重格式计算 |
| Qwen | Qwen3.8-27B / 2.4T-A95B | 27B 稠密 / 总参数 2.4T、激活 95B | 27B:原生 262,144,可扩展至 100 万 | Apache 2.0 / Qwen3.8-Max 许可证 | 27B 更易部署;2.4T 属于集群级 |
| Kimi | Kimi K3 | 总参数 2.8T / 激活 104B | 100 万 | Kimi K3 许可证 | 集群级检查点并需专项许可证审查 |
| GLM | GLM-5.3 | 总参数 753B | 100 万 | GLM-5.3 许可证 | 大型多 GPU 或实验性卸载服务 |
| Llama | Llama 4 Scout / Maverick | 109B / 激活 17B;400B / 激活 17B | 1000 万 / 100 万 | Llama 4 社区许可证 | 先解决欧盟多模态开发者限制 |
| Muse | Muse Glimmer-30B | 总计约 296 亿参数,稠密 | 131,072+ | Apache 2.0 | 本地 Agent 候选;同时计算量化、编码器与 KV 缓存 |
这些是最大上下文声明,而非质量保证。长序列会增加 KV 缓存需求,并可能降低并发。量化会改变内存需求,有时也会改变输出质量。若未明确精度、运行时、上下文、批量和冗余,就不要把参数量换算成固定 GPU 数量。
把工作站候选与集群部署分开评估
Qwen3.8-27B 与 Muse Glimmer-30B 的部署问题不同于万亿参数检查点。Meta 为其量化 Muse 软件包给出 24 GB、32 GB 目标配置,全精度为 64 GB。这些是指定配置下的供应商目标,不保证任意运行时、上下文长度或并发负载都能装下。须为 KV 缓存、图像、可能使用的草稿模型和应用保留余量。Muse Glimmer 本地 Agent 指南进一步说明具体软件包和测试,本页不重复展开该专题。
编程和智能体该测试哪个家族?
一手资料支持候选清单,而非通用排名。DeepSeek Flash-0731、Qwen3.8、Kimi K3 和 GLM-5.3 的模型卡都公布编程及智能体基准,但使用不同框架、推理设置、任务版本,有时还有内部测试集。只有任务、数据划分、框架、工具权限和评分方法一致时才应比较数值。
- 工作站级多模态 Agent:并列测试 Qwen3.8-27B 与 Muse Glimmer-30B。这两个具体检查点均采用 Apache 2.0,但上下文、工具行为、量化及运行时支持存在差异。
- 大型编程或工具评测:用任务完成率、恢复行为、延迟和总服务成本测试 DeepSeek V4 Flash-0731、GLM-5.3 与 Kimi K3。
- 超长上下文:在实际长度测试检索准确度和任务完成率。100 万或 1000 万上限只说明输入可以被接受。
- 在欧盟使用 Llama 4:开发者下载或部署多模态权重前应进行法律审查。最终用户例外不等于开发者许可证。

"模型卡告诉你在什么许可证下测试什么。你自己的评测告诉你部署什么。不要混淆这两个决定。"
能否在欧盟自部署?
所列 DeepSeek V4、Qwen3.8-27B 与 Muse Glimmer-30B 权重采用标准宽松许可。Qwen3.8-2.4T-A95B、GLM-5.3 和 Kimi K3 使用须单独审核的模型专属条款。Llama 4 多模态政策对指定欧盟开发者不授予相应权利,同时为集成产品的最终用户保留例外。这一 Llama 规则不是 Muse 的许可。任何权重许可证都不能单独证明 GDPR 合规。
自部署可以把推理留在欧盟控制的环境中,但不会自动证明符合 GDPR。仍需处理合法依据、数据最小化、保留期限、访问控制、处理者与跨境传输分析、日志政策及事故流程。托管端点的数据位置和合同取决于服务,必须与可下载检查点分开评估。
可辩护的选型流程
- 明确具体检查点。家族名称会掩盖权重、模态、上下文配置和许可证差异。
- 先解决许可证和司法辖区。记录许可证版本,对后果重大的部署寻求法律意见。
- 预算实际服务配置。计入精度、上下文、并发、运行时开销、冗余和网络拓扑。
- 运行同一套私有评测。至少比较两个候选,使用代表性任务、稳定提示、相同工具权限和明确通过条件。
- 固定并监控版本。记录权重版本、分词器、运行时、量化和安全配置。
为什么评测框架很重要?
公开基准可能受数据污染、过拟合和测试框架影响,更重要的是它们不是你的工作负载。几十个带明确通过条件的代表性任务,可以暴露总分掩盖的问题。应测量任务完成质量、延迟、成本、工具错误、长上下文检索,以及失败后的恢复。
常见问题
Meta 对 Llama 4 的欧盟限制是否适用于 Muse Glimmer?
小团队应先在本地测试哪些模型?
广告中的最长上下文是否代表最佳模型?
这些是 Wavect 的基准结果吗?
最终思考
2026 年 10 月的清单已区分工作站级候选 Qwen3.8-27B、Muse Glimmer-30B 与更大规模检查点。许可必须按具体检查点判断,尤其要区分 Muse 与 Llama 4。选择依法可用且通过自身验收测试的最小配置,并把托管 API 与可下载权重分开审核。