Cisco Antares 评测:不把代码发上云的本地漏洞定位
Cisco Antares 不是自主漏洞扫描器,不会生成补丁,也不能廉价取代渗透测试。它是一个小型开放权重安全模型,专门回答一个更窄、却有商业价值的问题:给它一段 CWE 弱点描述和代码库的只读权限,安全工程师应该先检查哪些源文件?
这个窄范围正是 Antares 的价值。已发布的 Antares-1B 只有 10 亿参数,使用 Apache 2.0 许可证,不需要向量数据库或外部检索,并可连接本地 OpenAI 兼容 endpoint。一份社区 Q8_0 GGUF 转换约为 1.96 GB,可由 llama.cpp 运行。这让专有代码的私有化、on-device 漏洞初筛变得现实。
限制也必须写在标题旁边:Cisco 自己的 benchmark 中,最佳模型的 File F1 只有 0.229;500 个任务中有 190 个难倒了全部参测模型。Antares 缩小搜索范围,却不能证明代码库安全。
需要一套不外传代码、且能产出可审查证据的安全流程?
规划安全与 QA 试点| 问题 | 短答案 | 商业含义 |
|---|---|---|
| 代码是否必须离开自有环境? | 不必,前提是权重、推理 endpoint、CLI、日志和代码库 sandbox 都在本地。 | 适合未获云端审查许可的专有或受监管代码。 |
| Antares 能确认漏洞吗? | 不能。它从 CWE 描述对候选文件排序。 | 保留人工审查与现有 AppSec 工具链。 |
| 能否使用 llama.cpp? | 有社区 Q8_0 GGUF,llama.cpp 可提供兼容的本地服务。 | 容易试点,但尚无公开质量等价测试。 |
| 能否进入 CI/CD? | 可以。官方 CLI 支持 JSON 和 SARIF。 | 先做非阻塞 triage,不要直接卡 merge。 |
| 能否取代 SAST 或渗透测试? | 不能。 | 把它放在 advisory 接收与专家调查之间。 |
Cisco Antares 是什么?
Cisco Foundation AI 于 2026 年 7 月 21 日发布 Antares,将其定位为安全专用 SLM 家族。Antares-350M 与 Antares-1B 已公开。Antares-3B 出现在技术报告和 benchmark 中,但发布时仍标为即将推出。
这些模型以 IBM Granite 4.0 为底座。Cisco 先通过监督微调训练网络安全推理、深度研究、终端使用和代码搜索,再用 Group Relative Policy Optimization 优化完整的代码库探索轨迹。换成直白的话,Antares 学的不只是漏洞术语,还包括搜索、读文件、放弃弱线索,以及在有限工具预算下提交文件路径。
Antares 技术报告描述了一个无网络、只读的代码库环境,每个任务最多 15 条终端命令。模型拿到 CWE ID 与通用描述后,用搜索和文件查看工具探索,最后返回可能存在漏洞的实现文件,或报告没有找到。
什么是漏洞定位?
漏洞检测问的是弱点是否存在。漏洞定位问的是相关实现在哪里。新的 advisory 到来后,团队可能已经知道 CWE 弱点类别,却仍要花数小时把 CVE 或 GHSA 穿过 wrapper、adapter、框架约定和调用路径,映射到真实文件。
- 从有边界的安全假设开始。输入 CWE 与描述,不要要求它“找出所有漏洞”。
- 探索代码库。模型搜索模式、打开候选文件、跟随 import,并修正假设。
- 提交候选文件。结果是一条按优先级排序的审查队列,不是漏洞结论。
- 交给确定性检查和人。工程师确认可达性、可利用性、受影响版本、严重程度与修复。
这个范围不会与我们的AI 生成代码 QA 流程争夺同一搜索意图。后者覆盖授权、输入、密钥、负载、并发、依赖和回归测试。Antares 只拥有其中一步:从安全描述本地定位候选文件。
Benchmark 说明 Antares 有多好?
新的 Vulnerability Localization Benchmark 包含 500 个任务,来自 290 个真实代码库、6 个包生态与 147 个 CWE 类别。每个任务都重建安全修复前的版本,并用真实 patch 修改的实现文件作为 ground truth。模型只看到通用 CWE 描述,并有 15 次终端调用。
| 模型 | 参数 | File F1 | Recall |
|---|---|---|---|
| GPT-5.5,xhigh | Frontier | 0.229 | 0.221 |
| Antares-3B,GRPO | 3B | 0.223 | 0.221 |
| Antares-1B,GRPO | 1B | 0.209 | 0.224 |
| GLM-5.2 | 753B | 0.186 | 0.186 |
| Antares-350M,GRPO | 350M | 0.135 | 0.178 |
核心结论成立:在这套 harness 上,专用训练让 1B 模型超过了大得多的通用模型。但 0.209 File F1 不等于找到了 20.9% 的漏洞。File F1 合并文件级 precision 和 recall,而且 Phase A 的每个代码库都保证含有已知漏洞。它不是普通代码库上的端到端检测率。
商业决策更应看限制。Cisco 表示,代码库超过 10 MB 后性能明显下降;涉及 5 个以上文件的漏洞依然困难;有明显、可 grep 模式的弱点,比权限、锁、内存泄漏等依赖语义的类别容易。训练数据截止于 2025 年 4 月 10 日。模型也不会解释文件为何有漏洞,不生成 exploit,不写补丁。
换成 GGUF 与 llama.cpp 后发生什么?
Cisco 官方发布 Transformers 兼容权重,并提供连接用户自定义 OpenAI 兼容推理 endpoint 的 CLI。llama.cpp 正好能提供这种本地服务。社区转换把 Antares-1B 打包成约 1.96 GB 的 Q8_0 GGUF。从架构上看,链路是完整的。
实际部署可以让 Antares 在小型 GB10 设备上,与更大的通用编程模型共享硬件。一个轻量 agent skill 驱动 Antares CLI 或其协议:输入代码库 snapshot 与 CWE,收集 JSON 或 SARIF,再把候选文件交给主编程 agent 和人工 reviewer。模型很小,因此不必长期占满大模型的推理资源。
- 官方 benchmark 不是 GGUF benchmark。Cisco 报告单张 H100 配合并行 worker 约 13 至 15 分钟完成 500 个任务。这不能推出 GB10 或 llama.cpp 的速度。
- Q8_0 等价性尚未证明。截至 2026 年 7 月 22 日,我们没有找到原始权重与 GGUF 的公开 VLoc A/B。
- 社区文件不是 Cisco 官方 artifact。试点必须固定文件、hash、源模型 revision,并在自己的历史案例上验证。
如何把 Antares 放进 shift-left CI/CD?
- 由明确安全原因触发。使用从 CVE 或 GHSA 映射的 CWE、一次定向排查,或少量弱点类别。不要给“找出所有漏洞”这种无边界任务。
- 创建只读 snapshot。在无网络容器中只挂载代码库和必要元数据,排除密钥、构建凭证、客户导出与无关生成文件。
- 扫描相关 slice。优先检查本次修改的服务或依赖边界,以适应 15 条命令限制。
- 输出 JSON 与 SARIF。官方 CLI 支持二者。GitHub 可把第三方 SARIF 导入 code scanning。
- 要求人工确认。候选文件只有在 reviewer 确认漏洞行为后才成为 finding。
- 衡量被接受的结果。记录已知案例的 precision、recall、找到首个相关文件的时间、每个确认 finding 的审查分钟数和静默漏报。
只有某个具体类别在自有数据上表现足够好时,才把 Antares 升为阻塞 gate。即使如此,也要保留有责任人和审计记录的 bypass。
Antares 如何辅助 CVE 与 GHSA 调查?
Antares 不做外部检索。这既是隐私优势,也是工作流限制。它不会抓取最新 advisory,考虑到训练截止时间,也不该让它凭记忆描述最新漏洞。
- 在独立、受治理的 intake 步骤获取 CVE 或 GHSA。
- 核验受影响组件、版本范围、CWE 映射和 advisory 内容。
- 只把确认过的 CWE 描述与批准上下文传给 Antares。
- 用候选文件安排源码审查、依赖追踪和 patch 验证。
- 记录 advisory revision、模型 hash、prompt、代码 commit、trace 和 reviewer 决策。
本地推理是否等于安全?
本地是一条有价值的数据边界,不是安全证书。Model card 建议使用隔离 sandbox、关闭网络、仅授权安全人员访问、记录完整轨迹,并要求人工监督。Antares 会操作终端,而且没有作为通用对话助手进行独立安全对齐。
GGUF 路径还增加了一层 supply-chain 风险。llama.cpp 发布过恶意模型文件相关 advisory,包括一个由特制 GGUF 词表触发的 buffer overflow。应保持 runtime 更新,固定可信下载位置和 hash,并仅在加固环境加载不可信权重。
还要检查 crash reporting、包安装、远程日志、CI artifact、SARIF 上传,以及接收 Antares 结果的主 agent。本地模型保护不了 harness 从其他路径送出去的代码。
Antares 应该补充什么,而不是取代什么?
| 控制 | 强项 | Antares 为何不能取代 |
|---|---|---|
| SAST 与 CodeQL 类分析 | 规则、类型、source、sink 与 dataflow | 确定性 finding 和成熟 query pack 仍然必要。 |
| 软件成分分析 | 已知漏洞依赖与许可证 | Antares 没有实时 advisory 数据库。 |
| 密钥扫描 | 已提交的凭证与 token | 专用 detector 对这种模式更可靠。 |
| 动态测试与渗透测试 | 运行时、exploit path、配置与漏洞链 | Antares 只返回文件,不能证明可利用性。 |
| 人工安全审查 | 业务逻辑、威胁上下文、严重程度与修复质量 | Model card 明确要求人工监督。 |
如果你评估的是自主红队 harness,请看我们的 T3MP3ST 评测。如果问题是本地模型与 API 的成本,请看本地模型 break-even 指南。Antares 页面只占据“私有本地漏洞定位”这组搜索意图。
一个 14 天商业试点
- 选择 25 次历史调查。包括修复前后 snapshot、单文件和多文件漏洞、小型和大型代码库。
- 冻结整个 stack。记录 Antares revision、GGUF hash、llama.cpp build、CLI、prompt、工具预算和硬件。
- 盲测。不要向模型或首轮 reviewer 暴露 patch 文件与已知位置。
- 对比 baseline。比较 Antares 加分析师与现有 SAST 加分析师流程。
- 设定 go 或 no-go。要求中位 triage 时间明显下降、关键案例无不可接受漏报、trace 可审查、误报负担可持续。
决策指标不是每秒 token 数,而是每次正确定位调查所需的分析师分钟数,旁边必须同时列出 false negative。
拥有你的 AI,也要拥有那些无聊的部分
拥有权重只是起点。运营上的 ownership 还包括推理 endpoint、代码库边界、日志、模型与 runtime 更新、评估集、失败策略和退出路径。放在桌上、却暗中依赖远程服务的模型并不完全本地。没有 benchmark 的本地模型,也还不是受控生产系统。
云端 AI 会围绕云平台公司的目标优化。如果能力、支持和速度比数据边界与可迁移性更重要,它仍可能是正确选择。错误在于把供应商的 alignment 当成自己的。Antares 提供了另一种现实选项:把这项窄安全任务、代码与证据都留在自己控制的边界内。
常见问题
Cisco Antares 是什么?
Antares 能否完全本地分析代码库?
Antares 能否使用 llama.cpp 与 GGUF?
Antares 能找 CVE 或 GHSA 漏洞吗?
Antares 能取代 SAST、CodeQL 或渗透测试吗?
Antares 应该阻塞 CI 吗?
一手来源与核验日期
产品状态、model card、benchmark、许可证与相关安全 advisory 均核验于 2026 年 7 月 22 日。本文独立撰写,未受赞助。我们没有复现 Cisco 的 H100 benchmark,也没有发布 GGUF 等价测试。
最终思考
Antares 让漏洞 triage 不再那么像代码库考古,因为它专门处理第一道昂贵问题:安全工程师应该去哪里看?小体积、开放权重、只读 agent loop 与本地部署路径,使重复、私有的调查在商业上成为可能。
只有当限制始终可见时,模型才真正有用。它定位候选,不认证代码,不取代 AppSec 工具链,也不移除 reviewer。应在本地运行、放进 sandbox、用自己的旧事件测量,并只在证据足够时提升权限。
