Qwen3.8-27B:自托管电脑操作智能体,截图不出内网
Qwen3.8-27B 是第一个在自家对比表中桌面操作成绩超过托管前沿模型的开放权重模型。这在商业上之所以重要,只有一个原因:屏幕自动化正是最难为“把数据发给别人的 API”找理由的场景。一张截图会把当时屏幕上的一切都带走,包括你只想读取的那张发票旁边的客户记录。
本文只回答一个很窄的采购问题:自托管的屏幕智能体今天能不能做有价值的后台工作,以及它接触生产系统之前必须满足什么条件?这不是硬件选型指南。关于显存预算、量化取舍和单机试点,请看我们的本地智能体模型硬件与基准指南。如果你更想购买托管的电脑操作产品而不是自己运维,请读我们对一款研究预览阶段电脑操作智能体的评测。把这三种搜索意图分开放在不同页面是有意为之。
Qwen3.8-27B 到底是什么
阿里巴巴 Qwen 团队于 2026 年 8 月 14 日发布了权重。Qwen3.8-27B 官方模型卡是本节以及下面基准表格的第一手来源。
| 决策因素 | 官方数据 | 对屏幕智能体的含义 |
|---|---|---|
| 规模与类型 | 270 亿参数稠密模型,64 层,隐藏维度 5120 | 每个 token 都会用到全部参数,上限由显存带宽决定,而不仅是参数量 |
| 层结构 | 16 次重复的 3 × (Gated DeltaNet → FFN) 加 1 × (Gated Attention → FFN) | 48 层线性注意力对 16 层完整注意力,长上下文占用显存的方式因此改变 |
| 输入 | 输入文本、图像和视频,输出文本 | 截图与录屏是原生输入,不需要额外接一个 OCR 步骤 |
| 上下文 | 原生 262,144 个 token,可用 YaRN 缩放扩展 | 含大量截图的长界面轨迹可以放进去,不必激进压缩 |
| 解码 | 检查点内已训练多 token 预测 | 无需单独的草稿模型即可做投机解码 |
| 许可 | Apache 2.0 | 允许商业使用,再分发时须遵守声明与署名义务 |
改变自建与外购判断的那个数字
OSWorld-Verified 衡量智能体能否在真实桌面环境中完成真实任务:打开文件、修改设置、填完表单。它是公开基准中最接近企业真正想自动化的后台工作的代理指标。Qwen 公布的表格把一个你可以自己运行的模型排在了它列出的托管模型之前。
| 基准 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|
| OSWorld-Verified(桌面操作) | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
| AndroidWorld(移动端操作) | 81.9 | 70.3 | 81.0 | 未公布 | 62.0 |
| WebArena-Verified(浏览器任务) | 64.8 | 48.8 | 55.3 | 未公布 | 未公布 |
| Vision2Web | 62.9 | 45.0 | 42.1 | 未公布 | 未公布 |
| SWE-bench Pro(仓库级开发) | 61.7 | 未公布 | 未公布 | 未公布 | 未公布 |
先看 WebArena 那一行,再看 OSWorld。浏览器任务 64.8 分意味着,在多数商业自动化真正发生的地方,大约每三次尝试就有一次失败。桌面成绩确实很强,但这不等于可以把智能体指向你的 ERP 然后离开房间。
为什么单一厂商的表格无法决定选型
两家厂商在几天之内,为同一个第三方模型在同一个基准上公布了不同的分数。Qwen 给自家上一代 Qwen3.6-27B 在 OSWorld-Verified 上的成绩是 63.9。Meta 为自家 30B 本地模型发布的表格里,同一代 Qwen 是 75.6,这在我们的Muse Glimmer 指南中有记录。
两个数字都不一定是错的。电脑操作的结果取决于脚手架:智能体最多可以走多少步、它看到的截图分辨率、是否有无障碍树、工具错误如何重试、由什么系统提示驱动。这也正是厂商表格无法预测你的结果的原因。harness 本身就是测量的一部分,而在你的部署里,harness 是你的。
我们的规则:公开表格只用来决定什么值得测试,绝不用来决定什么可以上线。冻结你自己的脚手架,重新测量。同样的纪律适用于成本,我们在每 token 成本与每个被接受任务的成本中做了建模。
截图是你最不愿意外传的负载
文本提示可以过滤,屏幕智能体的输入无法做到完全过滤。它看到的是被要求操作的窗口,以及周围的一切:相邻的记录、打开的工单、内部看板、通知里同事的姓名。调用前脱敏,也就是我们在在数据进入 LLM 之前移除个人信息中描述的做法,对结构化文本有效,但在任意像素面前无法成立。
这就是为什么一个桌面成绩可信的开放权重模型,与一个稍好一点的托管模型是完全不同的命题。把推理放在自己网络内,可以消除数据出境、供应商保留期问题,以及又一条子处理者记录。它不会消除你作为运营方的义务,还会增加自行运维这套栈的工作量。如果风险评估卡在数据出境上,这次发布就移除了这个障碍;如果真正的障碍是团队里没人愿意运维 GPU,自托管并不能帮你。
混合注意力对服务部署规划的影响
稠密 Transformer 的容量规划无法照搬。这里四分之三的层是 Gated DeltaNet 层,它们保存固定大小的循环状态,而不是随 token 不断增长的键值缓存。长上下文因此不再是一条线性显存曲线,你为 27B Transformer 记下的经验值会在两个方向上误导你。
SGLang 针对该模型的部署手册直接呈现了后果:混合状态缓存有自己的容量参数,包括 --mamba-full-memory-ratio 和 --max-mamba-cache-size;手册还列出了 BF16、FP8 和 NVFP4 W4A4 检查点,检查点内含多 token 预测,目标是在 H200、RTX PRO 6000、RTX 5090 和 DGX Spark 级别的硬件上单卡部署。
由此得到四条规划要点,每一条都是测量,而不是公式:
- 预分配是预算决策。状态缓存会提前占用。空闲时的可用显存几乎说明不了真实并发下的表现。
- 截图是昂贵的 token。界面轨迹里图像 token 占主导。请用智能体真实使用的分辨率和步数去测,而不是用纯文本提示。
- 投机解码要验证,不能假设。多 token 预测对单流延迟帮助最大,在高强度批处理下可能接近中性。
- 量化是质量实验。W4A4 改变了单卡能装什么,但它是否改变你屏幕上的任务成功率,只有你自己的固定测试环境能回答。
如果你正在决定它与现有模型如何共存部署,基于 vLLM 与 Triton 的推理栈中的平台模式,以及在欧盟自托管 LLM中的总成本模型,依然适用。
自托管屏幕智能体仍然会输的地方
真实的失败模式与能力无关,而与屏幕充满敌意、或者动作无法撤销时会发生什么有关。
屏幕智能体读取渲染后的像素,因此无法可靠区分真正的界面元素与只是看起来像界面的用户生成内容。关于视觉提示注入的 VPI-Bench 研究报告称,在五个常用平台上的 306 个测试用例中,电脑操作智能体被欺骗的比例最高达 51%,浏览器智能体在部分平台上最高达 100%,而依靠系统提示的防御只带来有限改善。评论框、日历邀请标题或 PDF 页脚都是指令通道。
| 场景 | 当前适配度 | 原因 |
|---|---|---|
| 从没有可用 API 的内部系统只读取数据 | 值得试点 | 可撤销、重复性高,且数据从不离开内网 |
| 永远不会有 API 的遗留桌面软件 | 值得试点 | 界面是唯一可用的集成面 |
| 填写表单,提交前由人确认 | 可以试点 | 模型起草、人工接受,审计链保持完整 |
| 跨多个公开站点的浏览器工作流 | 只能带护栏 | 浏览器 64.8 分加上不可信页面内容是糟糕的组合 |
| 支付、给客户发消息、不可逆的状态变更 | 暂不适合 | 注入成功率高于零,无人监督的自主执行无法辩护 |
| 已经有 API 的稳定高量流程 | 用错工具 | 确定性集成更便宜、更快,也更容易测试 |
在给任何智能体发凭据之前,先让它通过我们AI 智能体评估与沙箱清单中的控制项。结构性规则很短:同时具备访问私有数据、接触不可信内容和对外发送数据能力的智能体是可被利用的。打破其中任意一项。
一次两周就能得出结论的评估
- 选一个流程和 20 到 30 个真实任务。使用上个月真实的工作队列,包括脏数据案例和被人工升级的案例。
- 搭建固定测试环境,而不是用线上系统。对应用状态做快照,让每次运行可重复、每次失败可诊断。
- 冻结脚手架。记录检查点与量化、运行时版本、步数上限、截图分辨率、无障碍输入、系统提示、工具集和重试策略。
- 衡量被接受的结果,而不是演示。跟踪完成率、无声的错误操作、人工纠正分钟数和每个任务的步数。
- 衡量服务预算。记录目标并发下的峰值显存、图像密集提示的首 token 延迟、输出速度以及并发会话下的衰减。
- 主动攻击它。在用户可编辑的字段中植入注入指令,然后验证智能体是否拒绝并记录该尝试。
- 与朴素基线对比。让确定性脚本或现有 API 跑同一批任务。有时智能体会输,这也是有用的结论。
- 为被接受的任务定价。把 GPU 容量、工程、监控、评审时间和失败运行都算进去,再与今天的人工成本比较。
通过不等于“模型跑起来了”。通过意味着:完成率高于你的流程门槛、对抗集合中没有无声的破坏性操作、服务预算在真实并发下站得住,以及每个被接受任务的成本优于现状。
自托管无法免除的合规工作
把推理留在内部会缩短数据保护方面的讨论,但不会结束《人工智能法案》方面的讨论。根据欧盟委员会关于第 50 条透明度义务的指引,这些义务自 2026 年 8 月 2 日起适用,对该日期之前已投放市场的系统,其标记与可检测义务有到 2026 年 12 月 2 日的有限过渡期。部署方的义务是真实但具体的:告知接触情绪识别或生物特征归类系统的自然人,并对未经人工编辑审查即发布的深度伪造内容和涉及公共利益议题的 AI 生成文本进行标注。
对屏幕智能体有两点实务提示。第一,内部后台自动化往往根本不属于第 50 条所指的系统,因此请把判断理由写下来,而不是直接假定任一答案。第二,对开放权重模型做实质性修改,可能让你在价值链上向提供方义务一侧移动,这要在微调之前而不是之后与法律顾问确认。我们的第 50 条工程清单覆盖实现层面,我们的信任中心也明确说明了我们认证与不认证的内容。以上是运营指引,不构成法律意见。
生产级 AI 支持
正在构建 AI 产品,却担心推理成本、架构或生产可用性?Wavect 帮助创始人把 AI 原型变成可靠的生产系统。
查看相关服务:
常见问题
Qwen3.8-27B 是什么?
Qwen3.8-27B 能操作电脑或浏览器吗?
自托管电脑操作智能体在 GDPR 上更有优势吗?
Qwen3.8-27B 需要什么硬件?
屏幕智能体试点最大的风险是什么?
企业可以商业使用 Qwen3.8-27B 吗?
最终思考
屏幕自动化一直是能力答案与合规答案彼此背离的场景:足以操作桌面的模型,恰恰是你不能把桌面发过去的那些。
Qwen3.8-27B 把这道缝隙收窄到足以在真实流程上做一次真实试点。把公布的分数当作值得测试的理由,用固定测试环境而不是在线上系统里做实验,在别人动手之前先攻击自己的智能体,并在每个不可逆操作前保留人工确认。如果它通过了,自动化就留在你的网络内;如果没通过,你在两周内就知道了,而不是在全面上线之后。
