Volver
Kevin Riedl

16 min de lectura · 2 oct 2026
Última revisión

Siguiente
Se crea en tu dispositivo, sin conectar con Instagram. Copiamos el enlace para su sticker de enlace.

Caveman 3.0 para Claude Code: compresión local, recuperación y benchmarks

Revisado el . Baseline de producto: Caveman 3.0.0, runtime bin-v2.0.0, SDK 1.2.0 y middleware 1.0.0. Esta es una revisión de fuentes y metodología de benchmark, no un benchmark de producción de Wavect. release Caveman 3.0.0

Caveman 3.0 es interesante por una razón distinta al meme que lo hizo conocido. La idea original era sencilla: hacer que un agente de programación respondiera con menos palabras. La arquitectura nueva ataca el lado que puede pesar más en sesiones largas, lo que el modelo vuelve a leer. Un proxy local puede comprimir resultados grandes de herramientas antes de la siguiente petición al modelo y conservar los bytes originales para recuperarlos después. README de Caveman 3.0

La intención de búsqueda es más estrecha que nuestra guía general para optimizar tokens en coding agents, que cubre caché, routing y reducción de contexto como un sistema completo. También es más específica que nuestra guía de compresión de tool output. Aquí analizamos específicamente Caveman 3.0, compresión de entrada en Claude Code, recuperación exacta, ejecución local y la evidencia que sostiene sus claims.

¿Quieres medir tu stack de agentes con tus propios traces?

 Reservar una AI Agent Review

¿Qué cambió en Caveman 3.0?

Caveman 3.0.0 se publicó el 30 de septiembre de 2026. La versión reúne varias decisiones que antes estaban separadas y crea una historia de despliegue más clara. Notas de la versión.

Cambios de Caveman 3.0 relevantes para equipos de ingeniería
ÁreaCaveman 3.0Por qué importa
LicenciaTodo el repositorio público pasa a Apache-2.0 desde 3.0.0.Engine, proxy, CLI, SDKs y middleware se pueden bifurcar, integrar y autoalojar bajo una licencia permisiva.
MiddlewareLos paquetes TypeScript y Python llegan a 1.0.0 y requieren SDK 1.2.0.El mismo patrón de compresión se puede integrar dentro de agentes propios, no solo alrededor de un agente de terminal.
caveman learnRefresh en segundo plano, memory checks, tendencias y cambios con consentimiento.Permite localizar contexto repetido antes de decidir qué comprimir.
Runtimebin-v2.0.0 mejora ciclo de vida, retención y primitivas de despliegue.Los originales para recovery se pueden asociar a un scope y borrar con la sesión.

El cambio de licencia requiere precisión. Antes de 3.0.0, parte del repositorio era MIT y el runtime ligado al engine usaba BSL-1.1. Desde 3.0.0 el repositorio es Apache-2.0, sin restricción de hosted service ni Change Date para ese código. Las versiones anteriores mantienen la licencia con la que se publicaron. Caveman Cloud es un producto alojado separado y no está cubierto por la licencia del repositorio. notas de licencia de Caveman

En una sesión de agente, releer puede costar más que la respuesta final

Un coding agent no paga solo por la explicación que escribe al final. Las sesiones largas arrastran instrucciones, mensajes anteriores y resultados de herramientas a peticiones posteriores. Un test que produce 80 KB una vez puede seguir inflando varias llamadas si el framework mantiene ese output en el historial. Lo mismo ocurre con JSON, YAML, diffs y resultados de búsqueda.

Caveman separa dos mecanismos:

  • El skill de respuesta hace que el agente escriba de forma más compacta y reduce output.
  • El proxy y el middleware transforman contexto elegible antes de la inferencia y reducen input.

El segundo es el cambio más interesante. El modelo no necesita cada línea INFO de un log para diagnosticar una excepción, pero truncar sin criterio es peligroso porque la línea eliminada podría ser la que resuelve la tarea. Por eso la idea es comprimir y recuperar, no simplemente descartar. Arquitectura del proyecto.

Cómo funciona el proxy local

Claude Code / Codex / otro agente
        |
        | petición + resultados de herramientas
        v
proxy local de Caveman
        |-- detecta contenido elegible
        |-- sustituye bloques ruidosos por representaciones más cortas
        |-- guarda originales exactos localmente
        |-- expone handles de recuperación
        v
proveedor del modelo elegido por el agente

El proxy sigue enviando la inferencia al proveedor que ya usaba el agente. Ejecutar Caveman en local no convierte Claude, GPT u otro modelo alojado en un modelo local. Lo que controlas es la capa de transformación y recovery. Si el modelo upstream sigue siendo una API cloud, ese proveedor continúa recibiendo la petición resultante. La documentación de seguridad de Caveman separa explícitamente estos flujos. modelo de seguridad y privacidad

Para agentes propios, middleware 1.0 aplica la misma lógica sin reemplazar el framework. El adaptador copia la petición saliente, comprime texto elegible de resultados de herramientas en esa copia y mantiene intacto el historial original de la aplicación. La compresión solo se activa en rutas capaces de registrar una herramienta real de recuperación. Si no puede vincular recovery, el comportamiento documentado es dejar pasar el contenido original en lugar de degradarlo silenciosamente. middleware TypeScript 1.0 middleware Python 1.0

Qué demuestra realmente el benchmark de 33,2% con Claude Code

La mejor evidencia pública del repositorio no es un claim de que cualquier bloque se reduzca un 98 o 99%. Es un benchmark emparejado a nivel de agente que mide tokens de entrada reportados por el proveedor después de que se ejecuta el comportamiento completo de la sesión. CaveBench wrap benchmark

Benchmark publicado de Caveman con Claude Code, tres ejecuciones por carga
CargaInput directoInput CavemanCambio reportadoChecks
Log needle148.80774.068-50,2%3/3
Deployment JSON147.975108.939-26,4%3/3
Fraud CSV165.82374.484-55,1%3/3
Test output150.377108.514-27,8%3/3
Configuration YAML132.12471.027-46,2%3/3
Dashboard HTML140.687154.641+9,9%3/3

En los 18 pares directos versus Caveman, el informe suma 885.793 tokens de entrada directos frente a 591.673 con Caveman, una reducción del 33,2%. Las 18 comprobaciones exactas de respuesta pasaron. El intervalo del 95% clusterizado por caso reportado es de 14,6 a 48,5%. El caso HTML negativo se mantiene dentro del total porque no se aplicó una transformación útil, pero el overhead de Caveman siguió existiendo. Método y resultados.

Esa fila negativa importa: una gran ratio de compresión de un payload no equivale automáticamente a ahorro de sesión. Si el contenido ya está compacto, no es compatible o el resto del contexto domina, una capa adicional puede consumir más tokens.

También hay un límite de evidencia. El repositorio publica la tabla, el método y hashes de procedencia, pero indica que no incluye el harness bruto ni los artefactos de ejecución. Debe tratarse como un informe fijado del proyecto, no como un benchmark completamente reproducible desde el checkout público. Disponibilidad de reproducción.

El material de lanzamiento contiene ejemplos de compresión individual todavía más extremos para logs, CSV, YAML y tests. Son útiles como smoke tests, pero no deberían convertirse directamente en una previsión de gasto. Para planificación, el benchmark a nivel de agente es la evidencia más sólida publicada.

Por qué 98% menos tool output no significa 98% menos coste

Un resultado de herramienta es solo una parte de la petición. Siguen existiendo system prompt, instrucciones del repositorio, historial, otros tool results y comportamiento de caché. Además, el agente puede pedir el original si la versión comprimida no basta. Por eso un piloto debe medir por separado:

  • tokens de entrada reportados por el proveedor por tarea completa,
  • cache reads y cache writes,
  • tokens de salida,
  • llamadas de recovery y bytes recuperados,
  • reintentos y llamadas LLM adicionales,
  • calidad de tareas aceptadas.

El objetivo correcto no es la cifra de compresión más espectacular, sino un coste menor por tarea aceptada.

caveman learn: medir primero dónde se van los tokens

caveman learn analiza historial y archivos de configuración locales para localizar fuentes recurrentes de tokens. La documentación incluye instrucciones siempre cargadas, skills sin usar, texto repetido, profundidad de contexto y problemas de memory. El análisis es local y los números se etiquetan como inferred, no como gasto verificado. documentación de caveman learn

Esto importa porque el contexto más barato es el que nunca necesitabas cargar. Un CLAUDE.md de cientos de líneas, descripciones de skills no utilizadas o el mismo procedimiento pegado en cada sesión pueden ser problemas más estructurales que un único test ruidoso.

caveman learn --plain --since 7d --sources claude,codex
caveman learn --all
caveman learn implement

La versión 3.0 también añade autopilot para volver a analizar en segundo plano después de sesiones, como máximo cada seis horas. Las notas de versión indican que los cambios siguen requiriendo consentimiento, se vuelven a medir y se revierten si no reducen cada mensaje. Se desactiva con caveman learn autopilot off. Notas de 3.0.

Local no significa que desaparezca el trabajo de privacidad

1. El proveedor del modelo sigue recibiendo la petición

Si Claude Code sigue conectado a Anthropic, la petición comprimida va a Anthropic. Si tu aplicación usa OpenAI, sigue yendo a OpenAI. Para inferencia completamente local necesitas también un endpoint de modelo local o autoalojado.

2. Los originales de recovery son datos locales sensibles

El runtime guarda resultados originales exactos para que el agente pueda recuperarlos. Desde bin-v2.0.0, los originales del middleware pertenecen al scope, la retención puede cubrirlos y borrar una sesión puede borrar sus originales. Hay cifrado at rest cuando se configura una clave; sin ella, la protección depende del sistema de archivos. La documentación también advierte que el ciclo de vida anterior a bin-v2.0.0 era más débil. ciclo de vida del almacenamiento.

3. La telemetría del CLI está activada por defecto

El skill por sí solo no envía nada. El CLI y los hooks de 3.0 usan telemetría opt-out. Según release y SECURITY.md incluye un identificador aleatorio de instalación, agregados de tokens y la IP del remitente, pero no prompts, código, rutas, argumentos o resultados de herramientas. El propio proyecto la describe como pseudónima, no anónima. CI no envía por defecto. detalles de telemetría.

caveman telemetry status
caveman telemetry off
# o
export DO_NOT_TRACK=1

Un piloto práctico de Caveman 3.0 con Claude Code

Paso 1. Fija versiones y revisa qué vas a ejecutar

npm install -g @caveman-ai/[email protected]
caveman setup
caveman telemetry off   # si coincide con tu política

El release 3.0 vincula CLI 2.0.0 con runtime bin-v2.0.0. Fijar versiones importa porque pueden cambiar retención, contratos y adaptadores. Matriz de versiones.

Paso 2. Mide primero tus fuentes de tokens

caveman learn --plain --since 7d

Si el mayor desperdicio viene de instrucciones siempre cargadas, corrígelo antes de interpretar la compresión del proxy como solución universal.

Paso 3. Escoge tareas con criterios exactos

Busca una línea fatal en un log grande, detecta un drift concreto en JSON, identifica el test que falla o extrae un outlier de CSV. Cada tarea debería tener un oracle verificable por script.

Paso 4. Ejecuta brazo directo y brazo comprimido

Mantén fijo modelo, versión del agente, fixtures, permisos y estado inicial del repositorio. Registra input del proveedor, cache reads/writes, output, latencia, reintentos y recovery. Alterna el orden de ejecuciones para reducir sesgos de caché.

Paso 5. Gatea el rollout por economía de tarea aceptada

Gates sugeridos para un piloto de Caveman
MétricaQué exigir
CorrecciónSin caída operacionalmente relevante en tareas holdout.
Input del proveedorMenor mediana y total en workloads comprimibles.
Casos negativosPayloads pequeños o no compatibles siguen visibles en el informe.
RecoveryEl original exacto se puede recuperar cuando la versión corta no basta.
ReintentosNo aumentan hasta borrar el ahorro o el tiempo humano.
StorageRetención, borrado, cifrado y telemetría cumplen la clasificación de datos.

Usar Caveman Middleware 1.0 en tu propio agente

La decisión clave es si la integración puede registrar recovery. TypeScript documenta rutas certificadas para Vercel AI SDK, OpenAI, Anthropic y LangChain; otros adaptadores son experimentales. Python documenta rutas certificadas para LangChain, OpenAI, Anthropic y LiteLLM. Versiones no soportadas y fallos del runtime suelen ser fail-open: la petición original sigue y se registra el motivo. contrato TypeScript contrato Python.

Un rollout sano usa tres modos:

  • record para validar integración sin cambiar el input.
  • compress para el brazo de tratamiento.
  • off como rollback explícito.

Los quickstarts oficiales permiten probar runtime, compresión y recuperación paginada exacta sin hacer una llamada al proveedor por defecto. Es una buena secuencia para un piloto de infraestructura.

¿Apache-2.0 significa que ahora “posees tu IA”?

Da mucho más control sobre esta capa. Se puede inspeccionar, modificar, bifurcar e integrar el runtime público sin la restricción BSL anterior. Eso importa para plataformas internas que no quieren un optimizador propietario en cada petición. alcance de licencia.

Pero ownership tiene capas. Puedes poseer el proxy y seguir alquilando el modelo. Puedes autoalojar el modelo y depender de herramientas propietarias. La pregunta útil es qué partes de inferencia, contexto, memory, tooling y observabilidad puedes inspeccionar, reemplazar y operar tú mismo.

Cuándo merece la pena probar Caveman

Prueba Caveman cuando...Empieza por otra cosa cuando...
Las sesiones ingieren repetidamente logs, tests, JSON o YAML grandes.Las peticiones ya son cortas.
Puedes definir resultados exactos o verificables.No puedes detectar una regresión de calidad.
Necesitas recuperación local exacta, no truncado irreversible.Tu política no permite retener originales localmente.
Quieres una capa Apache-2.0 que puedas bifurcar e integrar.El problema real es routing, caché o demasiadas llamadas.
Usas una ruta de middleware soportada.Tu framework está fuera del rango probado y no puedes validarlo.

Para el panorama general, nuestra guía de uso de tokens empieza por cacheability y routing. Para comparar la categoría usa la guía de compresión de tool output. Para contexto gestionado por el propio modelo, consulta Context Language Models vs Compaction.

Preguntas frecuentes

¿Caveman 3.0 es completamente open source?

El repositorio público desde 3.0.0 está bajo Apache-2.0, incluidos engine, proxy, CLI, SDKs y middleware. Releases anteriores conservan sus licencias. Caveman Cloud es software comercial separado. Detalles.

¿Reduce los tokens de entrada de Claude Code?

En el benchmark publicado de seis workloads, Caveman usó 33,2% menos input reportado por el proveedor y pasó 18/18 checks exactos. Es evidencia específica de ese benchmark, no una promesa universal, y los artefactos brutos no están publicados. Benchmark.

¿Caveman envía mi código a servidores de Caveman?

El proxy local y el middleware no necesitan cuenta y no envían prompts o tool results a Caveman. El proveedor de modelo sí recibe la inferencia. El CLI tiene telemetría opt-out separada con metadatos de uso e IP, sin prompts o rutas según la documentación. Security.

¿Puede recuperar el agente contenido comprimido?

Sí. Las rutas compatibles conservan originales exactos y registran recovery. Si recovery no se puede vincular, el contenido debe pasar sin compresión. Recovery contract.

¿caveman learn es local?

El análisis lee historial y archivos locales y documenta que no envía esos datos. Es independiente de la telemetría del CLI, que se puede desactivar. Learn Telemetría.

¿Es lo mismo que prompt caching?

No. Prompt caching reutiliza cómputo del proveedor en prefijos repetidos; Caveman transforma contexto antes de enviarlo. Pueden complementarse y por eso conviene medir ambos.

¿Soporta LiteLLM?

La documentación Python 1.0 enumera LiteLLM como familia certificada en rutas async y proxy compatibles, con requisitos explícitos de recovery. Matriz Python.

Fuentes y notas de verificación

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Reflexiones finales

Caveman 3.0 convierte una broma sobre respuestas cortas en una capa de eficiencia de contexto mucho más seria. La relicencia Apache-2.0, la compresión local recuperable y el middleware estable merecen una prueba cuando los coding agents vuelven a ingerir grandes outputs. El rollout correcto no confía en una captura con 98% de compresión: ejecuta tareas emparejadas, mide uso del proveedor, conserva casos negativos, verifica recovery exacto y rechaza cualquier ahorro que reduzca la calidad aceptada.

Ayuda para IA en producción

Si estás construyendo un producto de IA y te preocupan el coste de inferencia, la arquitectura o la preparación para producción, Wavect ayuda a fundadores a convertir prototipos de IA en sistemas fiables.

Ruta de servicio:

Tu bandeja, sin ruido

Sigue el trabajo que te importa

Recibe un correo breve cuando publiquemos algo nuevo. Sigue todo el blog o solo los temas que te interesan.

¿Qué quieres recibir?
Elige tus temas

Gratis, doble opt-in y sin píxeles de seguimiento.

Volver
Kevin Riedl

16 min de lectura · 2 oct 2026
Última revisión

Siguiente

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Gratis, doble opt-in y sin píxeles de seguimiento.