Review de Cisco Antares: triage local de vulnerabilidades sin enviar código a la nube
Cisco Antares no es un escáner autónomo de vulnerabilidades, no genera parches y no sustituye un pentest. Es un modelo de seguridad pequeño y de pesos abiertos entrenado para una pregunta más estrecha y útil: dada una descripción CWE y acceso de solo lectura a un repositorio, ¿qué archivos debería revisar primero un especialista?
Ese alcance explica su valor. El modelo Antares-1B tiene mil millones de parámetros, licencia Apache 2.0 y no necesita una base vectorial ni retrieval externo. Puede vivir detrás de un endpoint local compatible con OpenAI. Una conversión comunitaria Q8_0 a GGUF ocupa unos 1,96 GB y funciona con llama.cpp. Esto abre una vía privada de triage para código propietario en estaciones de trabajo y equipos on-device.
El límite debe viajar con el titular: el mejor modelo del benchmark de Cisco solo alcanza 0,229 de File F1, y 190 de 500 tareas no fueron resueltas por ningún modelo. Antares reduce el área de búsqueda. No demuestra que el repositorio sea seguro.
¿Necesitas un flujo privado de seguridad de código con evidencia revisable?
Planificar el piloto de seguridad y QA| Pregunta | Respuesta corta | Consecuencia comercial |
|---|---|---|
| ¿Debe salir el código de tu entorno? | No, si pesos, endpoint, CLI, logs y sandbox funcionan localmente. | Útil para código propietario o regulado sin aprobación para cloud. |
| ¿Encuentra vulnerabilidades demostradas? | No. Ordena archivos candidatos desde una descripción CWE. | Mantén revisión humana y el stack AppSec. |
| ¿Funciona con llama.cpp? | Existe un GGUF Q8_0 comunitario y llama.cpp ofrece un servidor local compatible. | Piloto sencillo, pero sin paridad de calidad publicada. |
| ¿Puede integrarse en CI/CD? | Sí. La CLI oficial produce JSON y SARIF. | Empieza como triage no bloqueante. |
| ¿Sustituye SAST o un pentest? | No. | Úsalo entre la entrada del advisory y la investigación experta. |
¿Qué es Cisco Antares?
Cisco Foundation AI presentó Antares el 21 de julio de 2026 como una familia de small language models de seguridad. Antares-350M y Antares-1B están disponibles públicamente. Antares-3B aparece en el informe y el benchmark, pero seguía anunciado como próximo al publicar.
Los modelos parten de IBM Granite 4.0. Cisco aplica fine-tuning supervisado para razonamiento de ciberseguridad, investigación, terminal y búsqueda de código. Después usa Group Relative Policy Optimization sobre trayectorias completas dentro de repositorios. En términos prácticos, Antares aprende a buscar, inspeccionar archivos, descartar pistas débiles y entregar rutas con un presupuesto limitado de herramientas.
El informe técnico de Antares describe un repositorio de solo lectura, sin red y con un máximo de 15 comandos de terminal. El modelo recibe un ID CWE y una descripción genérica, explora el código y devuelve archivos de implementación probables o declara que no encontró una vulnerabilidad.
¿Qué significa localizar una vulnerabilidad?
La detección pregunta si existe una debilidad. La localización pregunta dónde vive la implementación relevante. Tras un nuevo advisory, el equipo puede conocer la categoría CWE y aun así dedicar horas a seguir un CVE o GHSA por wrappers, adaptadores, convenciones del framework y rutas de llamadas.
- Empieza con una hipótesis acotada. Entrega el CWE y su descripción, no “encuentra todos los bugs”.
- Explora el repositorio. El modelo busca patrones, abre candidatos, sigue imports y revisa su hipótesis.
- Devuelve archivos candidatos. Es una cola priorizada de revisión, no un hallazgo confirmado.
- Pasa a controles deterministas y personas. El equipo confirma alcance, explotabilidad, versiones, severidad y remediación.
Este alcance evita competir con nuestro proceso general de QA para código generado por IA, que cubre autorización, entradas, secretos, carga, concurrencia, dependencias y regresión. Antares se centra en un paso: localizar archivos probables desde una descripción de seguridad.
¿Qué dice realmente el benchmark?
El Vulnerability Localization Benchmark contiene 500 tareas de 290 repositorios reales, seis ecosistemas y 147 categorías CWE. Cada tarea reconstruye el estado anterior al fix. Los archivos modificados por el parche real forman el ground truth. El modelo solo recibe una descripción CWE y 15 llamadas al terminal.
| Modelo | Parámetros | File F1 | Recall |
|---|---|---|---|
| GPT-5.5, xhigh | Frontier | 0,229 | 0,221 |
| Antares-3B, GRPO | 3B | 0,223 | 0,221 |
| Antares-1B, GRPO | 1B | 0,209 | 0,224 |
| GLM-5.2 | 753B | 0,186 | 0,186 |
| Antares-350M, GRPO | 350M | 0,135 | 0,178 |
La especialización permite que un modelo 1B supere a generalistas enormes en este harness. Eso no significa que Antares detecte el 20,9 por ciento de las vulnerabilidades. File F1 combina precisión y recall por archivo en repositorios que siempre contienen una vulnerabilidad conocida. No mide detección end-to-end en una base de código normal.
Los límites importan para comprar. Cisco observa caídas fuertes por encima de 10 MB, peor rendimiento en vulnerabilidades repartidas por cinco archivos o más y mejores resultados en patrones distintivos y fáciles de buscar. Permisos, locking, memory leaks y debilidades semánticas son más difíciles. El corte de entrenamiento es el 10 de abril de 2025. Antares tampoco explica por qué un archivo es vulnerable, no crea un exploit y no escribe el parche.
¿Qué cambia con GGUF y llama.cpp?
La versión oficial ofrece pesos compatibles con Transformers y una CLI que se conecta a un endpoint configurable compatible con OpenAI. llama.cpp proporciona ese servidor local. La conversión comunitaria empaqueta Antares-1B como GGUF Q8_0 de unos 1,96 GB. Las piezas encajan a nivel de arquitectura.
Un equipo GB10 compacto puede servir Antares junto a un modelo mucho mayor para desarrollo. Un skill fino puede conducir la CLI: repositorio y CWE como entrada, JSON o SARIF como salida, y archivos candidatos para el agente principal y un revisor humano. El tamaño pequeño evita dedicar toda la máquina a esta tarea.
- El benchmark oficial no es un benchmark GGUF. Cisco informa de unos 13 a 15 minutos para 500 tareas en una H100 con workers paralelos. No demuestra latencia en GB10 ni rendimiento con llama.cpp.
- La paridad Q8_0 no está medida públicamente. No encontramos un A/B de VLoc entre pesos originales y GGUF a 22 de julio de 2026.
- El artefacto comunitario no es el release oficial de Cisco. Fija archivo, hash, revisión origen y casos históricos propios.
¿Cómo integrar Antares en CI/CD shift-left?
- Activa por un motivo de seguridad. Usa un CWE mapeado desde CVE o GHSA, una campaña concreta o una lista corta de categorías. Evita “encuentra todo”.
- Crea un snapshot de solo lectura. Monta solo el repositorio y metadatos necesarios en un contenedor sin red. Excluye secretos, credenciales y exportaciones de clientes.
- Analiza un slice relevante. Prioriza el servicio modificado o el límite de la dependencia para respetar los 15 comandos.
- Genera JSON y SARIF. La CLI soporta ambos. GitHub importa SARIF de terceros como alertas de code scanning.
- Exige confirmación humana. Un candidato se convierte en finding solo al confirmar el comportamiento.
- Mide resultados aceptados. Precision, recall en casos conocidos, minutos hasta el primer archivo relevante, tiempo de revisión y misses silenciosos.
Convierte Antares en gate bloqueante solo para categorías validadas con tus datos. Conserva un bypass con propietario y audit trail.
¿Cómo ayuda en investigaciones de CVE y GHSA?
Antares no usa retrieval externo. Es una ventaja de privacidad y una restricción. No recupera advisories actuales y, por su corte de entrenamiento, tampoco debería inventarlos de memoria.
- Recupera CVE o GHSA en un intake separado y gobernado.
- Verifica componente, versiones afectadas, mapeo CWE y texto.
- Pasa a Antares solo la descripción CWE validada y contexto aprobado.
- Usa los candidatos para source review, dependency tracing y verificación del patch.
- Registra revisión del advisory, hash del modelo, prompt, commit, trace y decisión humana.
¿La inferencia local hace seguro el flujo?
Local es un límite de datos, no un certificado de seguridad. La model card recomienda sandbox aislado, red desactivada, acceso para personal autorizado, logs completos y human oversight. Antares opera un terminal y no recibió alineación de seguridad como asistente conversacional general.
GGUF añade otro límite de supply chain. llama.cpp ha publicado advisories sobre archivos maliciosos, incluido un buffer overflow activado por un vocabulario GGUF manipulado. Mantén el runtime actualizado, fija fuentes y hashes, y carga pesos no confiables solo en un entorno endurecido.
Revisa también crash reporting, instalación de paquetes, logs remotos, artefactos CI, carga SARIF y el agente principal que recibe el resultado. Un modelo local no protege código que el harness envía por otra ruta.
Qué complementa Antares y qué no sustituye
| Control | Fortaleza | Por qué sigue siendo necesario |
|---|---|---|
| SAST y análisis tipo CodeQL | Reglas, tipos, sources, sinks y dataflow | Los findings deterministas siguen siendo esenciales. |
| Software composition analysis | Dependencias vulnerables y licencias | Antares no mantiene una base actual de advisories. |
| Secret scanning | Credenciales y tokens commiteados | Los detectores dedicados son más fiables para este patrón. |
| Pruebas dinámicas y pentest | Runtime, exploit paths, configuración y cadenas | Antares devuelve archivos, no prueba explotabilidad. |
| Revisión humana | Lógica de negocio, contexto, severidad y fix | La propia model card exige supervisión. |
Para red teaming autónomo, nuestra review de T3MP3ST responde esa intención. Para decidir la economía de local frente a API, usa la guía de break-even de modelos locales. Antares mantiene su cluster en localización privada de vulnerabilidades.
Un piloto comercial de 14 días
- Selecciona 25 investigaciones históricas. Incluye snapshots antes y después del fix, single-file y multi-file, repos pequeños y grandes.
- Congela el stack. Registra revisión de Antares, hash GGUF, build de llama.cpp, CLI, prompt, presupuesto y hardware.
- Ejecuta a ciegas. Oculta los archivos del patch y la ubicación conocida.
- Compara con la baseline. Antares más analista frente al proceso SAST más analista.
- Define go o no-go. Exige menos tiempo mediano, ningún miss crítico inaceptable, traces revisables y falsos positivos sostenibles.
La métrica no es tokens por segundo. Es minutos de analista por investigación correctamente localizada, con falsos negativos al lado.
Haz que tu IA sea tuya, incluida la parte aburrida
Poseer los pesos es el principio. Ownership operativo significa controlar endpoint, límite del repo, logs, actualizaciones, evals, política de fallos y salida. Un modelo en tu mesa con una dependencia remota silenciosa no es completamente local. Un modelo local sin benchmark aún no es un sistema de producción controlado.
La IA cloud se optimiza para la empresa que opera la nube. Puede ser la decisión correcta si capacidad, soporte y velocidad compensan privacidad y portabilidad. El error es confundir sus incentivos con los tuyos. Antares permite conservar la tarea estrecha, el código y la evidencia dentro de un límite propio.
Preguntas frecuentes
¿Qué es Cisco Antares?
¿Puede Antares analizar un repositorio completamente en local?
¿Antares funciona con llama.cpp y GGUF?
¿Puede encontrar vulnerabilidades CVE o GHSA?
¿Sustituye SAST, CodeQL o un pentest?
¿Debe bloquear CI?
Fuentes primarias y fecha de verificación
- Anuncio de Cisco Foundation AI
- Informe técnico de Antares
- Model card oficial de Antares-1B
- Metodología y resultados de VLoc Bench
- Repositorio de llama.cpp
Estado, model cards, benchmark, licencias y advisories fueron verificados el 22 de julio de 2026. Esta review es independiente y no patrocinada. No reproducimos el benchmark H100 ni publicamos una prueba de paridad GGUF.
Reflexiones finales
Antares hace que el triage se parezca menos a arqueología porque se especializa en la primera pregunta cara: dónde debe mirar el especialista. Su tamaño, pesos abiertos, agent loop de solo lectura y despliegue local hacen viable una investigación privada y repetible.
El modelo solo es útil si sus límites siguen visibles. Localiza candidatos. No certifica código, no sustituye AppSec y no elimina al revisor. Ejecútalo localmente, aíslalo, mídelo con incidentes propios y promuévelo solo donde la evidencia gane confianza.
