返回
Kevin Riedl

9 分钟 阅读 · 2026年7月22日

下一篇

Cisco Antares 评测:不把代码发上云的本地漏洞定位

Cisco Antares 不是自主漏洞扫描器,不会生成补丁,也不能廉价取代渗透测试。它是一个小型开放权重安全模型,专门回答一个更窄、却有商业价值的问题:给它一段 CWE 弱点描述和代码库的只读权限,安全工程师应该先检查哪些源文件?

这个窄范围正是 Antares 的价值。已发布的 Antares-1B 只有 10 亿参数,使用 Apache 2.0 许可证,不需要向量数据库或外部检索,并可连接本地 OpenAI 兼容 endpoint。一份社区 Q8_0 GGUF 转换约为 1.96 GB,可由 llama.cpp 运行。这让专有代码的私有化、on-device 漏洞初筛变得现实。

限制也必须写在标题旁边:Cisco 自己的 benchmark 中,最佳模型的 File F1 只有 0.229;500 个任务中有 190 个难倒了全部参测模型。Antares 缩小搜索范围,却不能证明代码库安全。

需要一套不外传代码、且能产出可审查证据的安全流程?

 规划安全与 QA 试点
Cisco Antares 采购结论,核验于 2026 年 7 月 22 日
问题短答案商业含义
代码是否必须离开自有环境?不必,前提是权重、推理 endpoint、CLI、日志和代码库 sandbox 都在本地。适合未获云端审查许可的专有或受监管代码。
Antares 能确认漏洞吗?不能。它从 CWE 描述对候选文件排序。保留人工审查与现有 AppSec 工具链。
能否使用 llama.cpp?有社区 Q8_0 GGUF,llama.cpp 可提供兼容的本地服务。容易试点,但尚无公开质量等价测试。
能否进入 CI/CD?可以。官方 CLI 支持 JSON 和 SARIF。先做非阻塞 triage,不要直接卡 merge。
能否取代 SAST 或渗透测试?不能。把它放在 advisory 接收与专家调查之间。

Cisco Antares 是什么?

Cisco Foundation AI 于 2026 年 7 月 21 日发布 Antares,将其定位为安全专用 SLM 家族。Antares-350M 与 Antares-1B 已公开。Antares-3B 出现在技术报告和 benchmark 中,但发布时仍标为即将推出。

这些模型以 IBM Granite 4.0 为底座。Cisco 先通过监督微调训练网络安全推理、深度研究、终端使用和代码搜索,再用 Group Relative Policy Optimization 优化完整的代码库探索轨迹。换成直白的话,Antares 学的不只是漏洞术语,还包括搜索、读文件、放弃弱线索,以及在有限工具预算下提交文件路径。

Antares 技术报告描述了一个无网络、只读的代码库环境,每个任务最多 15 条终端命令。模型拿到 CWE ID 与通用描述后,用搜索和文件查看工具探索,最后返回可能存在漏洞的实现文件,或报告没有找到。

什么是漏洞定位?

漏洞检测问的是弱点是否存在。漏洞定位问的是相关实现在哪里。新的 advisory 到来后,团队可能已经知道 CWE 弱点类别,却仍要花数小时把 CVE 或 GHSA 穿过 wrapper、adapter、框架约定和调用路径,映射到真实文件。

  1. 从有边界的安全假设开始。输入 CWE 与描述,不要要求它“找出所有漏洞”。
  2. 探索代码库。模型搜索模式、打开候选文件、跟随 import,并修正假设。
  3. 提交候选文件。结果是一条按优先级排序的审查队列,不是漏洞结论。
  4. 交给确定性检查和人。工程师确认可达性、可利用性、受影响版本、严重程度与修复。

这个范围不会与我们的AI 生成代码 QA 流程争夺同一搜索意图。后者覆盖授权、输入、密钥、负载、并发、依赖和回归测试。Antares 只拥有其中一步:从安全描述本地定位候选文件。

Benchmark 说明 Antares 有多好?

新的 Vulnerability Localization Benchmark 包含 500 个任务,来自 290 个真实代码库、6 个包生态与 147 个 CWE 类别。每个任务都重建安全修复前的版本,并用真实 patch 修改的实现文件作为 ground truth。模型只看到通用 CWE 描述,并有 15 次终端调用。

VLoc Bench Phase A 部分结果
模型参数File F1Recall
GPT-5.5,xhighFrontier0.2290.221
Antares-3B,GRPO3B0.2230.221
Antares-1B,GRPO1B0.2090.224
GLM-5.2753B0.1860.186
Antares-350M,GRPO350M0.1350.178

核心结论成立:在这套 harness 上,专用训练让 1B 模型超过了大得多的通用模型。但 0.209 File F1 不等于找到了 20.9% 的漏洞。File F1 合并文件级 precision 和 recall,而且 Phase A 的每个代码库都保证含有已知漏洞。它不是普通代码库上的端到端检测率。

商业决策更应看限制。Cisco 表示,代码库超过 10 MB 后性能明显下降;涉及 5 个以上文件的漏洞依然困难;有明显、可 grep 模式的弱点,比权限、锁、内存泄漏等依赖语义的类别容易。训练数据截止于 2025 年 4 月 10 日。模型也不会解释文件为何有漏洞,不生成 exploit,不写补丁。

换成 GGUF 与 llama.cpp 后发生什么?

Cisco 官方发布 Transformers 兼容权重,并提供连接用户自定义 OpenAI 兼容推理 endpoint 的 CLI。llama.cpp 正好能提供这种本地服务。社区转换把 Antares-1B 打包成约 1.96 GB 的 Q8_0 GGUF。从架构上看,链路是完整的。

实际部署可以让 Antares 在小型 GB10 设备上,与更大的通用编程模型共享硬件。一个轻量 agent skill 驱动 Antares CLI 或其协议:输入代码库 snapshot 与 CWE,收集 JSON 或 SARIF,再把候选文件交给主编程 agent 和人工 reviewer。模型很小,因此不必长期占满大模型的推理资源。

  • 官方 benchmark 不是 GGUF benchmark。Cisco 报告单张 H100 配合并行 worker 约 13 至 15 分钟完成 500 个任务。这不能推出 GB10 或 llama.cpp 的速度。
  • Q8_0 等价性尚未证明。截至 2026 年 7 月 22 日,我们没有找到原始权重与 GGUF 的公开 VLoc A/B。
  • 社区文件不是 Cisco 官方 artifact。试点必须固定文件、hash、源模型 revision,并在自己的历史案例上验证。

如何把 Antares 放进 shift-left CI/CD?

  1. 由明确安全原因触发。使用从 CVE 或 GHSA 映射的 CWE、一次定向排查,或少量弱点类别。不要给“找出所有漏洞”这种无边界任务。
  2. 创建只读 snapshot。在无网络容器中只挂载代码库和必要元数据,排除密钥、构建凭证、客户导出与无关生成文件。
  3. 扫描相关 slice。优先检查本次修改的服务或依赖边界,以适应 15 条命令限制。
  4. 输出 JSON 与 SARIF。官方 CLI 支持二者。GitHub 可把第三方 SARIF 导入 code scanning
  5. 要求人工确认。候选文件只有在 reviewer 确认漏洞行为后才成为 finding。
  6. 衡量被接受的结果。记录已知案例的 precision、recall、找到首个相关文件的时间、每个确认 finding 的审查分钟数和静默漏报。

只有某个具体类别在自有数据上表现足够好时,才把 Antares 升为阻塞 gate。即使如此,也要保留有责任人和审计记录的 bypass。

Antares 如何辅助 CVE 与 GHSA 调查?

Antares 不做外部检索。这既是隐私优势,也是工作流限制。它不会抓取最新 advisory,考虑到训练截止时间,也不该让它凭记忆描述最新漏洞。

  1. 在独立、受治理的 intake 步骤获取 CVE 或 GHSA。
  2. 核验受影响组件、版本范围、CWE 映射和 advisory 内容。
  3. 只把确认过的 CWE 描述与批准上下文传给 Antares。
  4. 用候选文件安排源码审查、依赖追踪和 patch 验证。
  5. 记录 advisory revision、模型 hash、prompt、代码 commit、trace 和 reviewer 决策。

本地推理是否等于安全?

本地是一条有价值的数据边界,不是安全证书。Model card 建议使用隔离 sandbox、关闭网络、仅授权安全人员访问、记录完整轨迹,并要求人工监督。Antares 会操作终端,而且没有作为通用对话助手进行独立安全对齐。

GGUF 路径还增加了一层 supply-chain 风险。llama.cpp 发布过恶意模型文件相关 advisory,包括一个由特制 GGUF 词表触发的 buffer overflow。应保持 runtime 更新,固定可信下载位置和 hash,并仅在加固环境加载不可信权重。

还要检查 crash reporting、包安装、远程日志、CI artifact、SARIF 上传,以及接收 Antares 结果的主 agent。本地模型保护不了 harness 从其他路径送出去的代码。

Antares 应该补充什么,而不是取代什么?

控制强项Antares 为何不能取代
SAST 与 CodeQL 类分析规则、类型、source、sink 与 dataflow确定性 finding 和成熟 query pack 仍然必要。
软件成分分析已知漏洞依赖与许可证Antares 没有实时 advisory 数据库。
密钥扫描已提交的凭证与 token专用 detector 对这种模式更可靠。
动态测试与渗透测试运行时、exploit path、配置与漏洞链Antares 只返回文件,不能证明可利用性。
人工安全审查业务逻辑、威胁上下文、严重程度与修复质量Model card 明确要求人工监督。

如果你评估的是自主红队 harness,请看我们的 T3MP3ST 评测。如果问题是本地模型与 API 的成本,请看本地模型 break-even 指南。Antares 页面只占据“私有本地漏洞定位”这组搜索意图。

一个 14 天商业试点

  1. 选择 25 次历史调查。包括修复前后 snapshot、单文件和多文件漏洞、小型和大型代码库。
  2. 冻结整个 stack。记录 Antares revision、GGUF hash、llama.cpp build、CLI、prompt、工具预算和硬件。
  3. 盲测。不要向模型或首轮 reviewer 暴露 patch 文件与已知位置。
  4. 对比 baseline。比较 Antares 加分析师与现有 SAST 加分析师流程。
  5. 设定 go 或 no-go。要求中位 triage 时间明显下降、关键案例无不可接受漏报、trace 可审查、误报负担可持续。

决策指标不是每秒 token 数,而是每次正确定位调查所需的分析师分钟数,旁边必须同时列出 false negative。

拥有你的 AI,也要拥有那些无聊的部分

拥有权重只是起点。运营上的 ownership 还包括推理 endpoint、代码库边界、日志、模型与 runtime 更新、评估集、失败策略和退出路径。放在桌上、却暗中依赖远程服务的模型并不完全本地。没有 benchmark 的本地模型,也还不是受控生产系统。

云端 AI 会围绕云平台公司的目标优化。如果能力、支持和速度比数据边界与可迁移性更重要,它仍可能是正确选择。错误在于把供应商的 alignment 当成自己的。Antares 提供了另一种现实选项:把这项窄安全任务、代码与证据都留在自己控制的边界内。

常见问题

Cisco Antares 是什么?
Cisco Antares 是用于 agentic 漏洞定位的开放权重 SLM 家族。它根据 CWE 描述与只读终端权限探索代码库,返回供人工审查的候选实现文件。
Antares 能否完全本地分析代码库?
可以,前提是权重、OpenAI 兼容推理 endpoint、CLI、sandbox 和日志都在自有环境。官方工作流不需要外部检索或向量数据库。
Antares 能否使用 llama.cpp 与 GGUF?
社区已提供 Antares-1B 的 Q8_0 GGUF,llama.cpp 可通过本地 OpenAI 兼容 endpoint 运行。截至 2026 年 7 月 22 日,尚无公开 benchmark 证明它与原始权重质量等价。
Antares 能找 CVE 或 GHSA 漏洞吗?
在可信 intake 把 advisory 映射到 CWE 后,它可帮助定位候选文件。Antares 不自行检索最新 advisory,训练数据截止于 2025 年 4 月 10 日。
Antares 能取代 SAST、CodeQL 或渗透测试吗?
不能。它给出可能相关的文件,而非可利用性证明、修复方案或完整覆盖。
Antares 应该阻塞 CI 吗?
初期不应该。先非阻塞收集 precision、recall、审查时间和漏报数据,只对经过自有数据验证的窄类别启用阻塞。

一手来源与核验日期

产品状态、model card、benchmark、许可证与相关安全 advisory 均核验于 2026 年 7 月 22 日。本文独立撰写,未受赞助。我们没有复现 Cisco 的 H100 benchmark,也没有发布 GGUF 等价测试。

最终思考

Antares 让漏洞 triage 不再那么像代码库考古,因为它专门处理第一道昂贵问题:安全工程师应该去哪里看?小体积、开放权重、只读 agent loop 与本地部署路径,使重复、私有的调查在商业上成为可能。

只有当限制始终可见时,模型才真正有用。它定位候选,不认证代码,不取代 AppSec 工具链,也不移除 reviewer。应在本地运行、放进 sandbox、用自己的旧事件测量,并只在证据足够时提升权限。

独立验证前的安全加固

正在为独立渗透测试或客户安全审查准备应用?Wavect 会加固权限、密钥、故障路径与回归覆盖,并协助团队关闭发现的问题。

相关服务路径:

只收重要内容

关注与你相关的内容

每当我们发布新文章,你会收到一封简短邮件。你可以关注整个博客,也可以只选感兴趣的主题。

你希望接收哪些内容?
选择主题

免费、双重确认、不使用跟踪像素。

返回
Kevin Riedl

9 分钟 阅读 · 2026年7月22日

下一篇