BENCHMARK · AGENT CONTEXT V1

El contexto se puede medir. El ahorro de coste aún no está demostrado.

Publicar el contraejemplo antes de la afirmación.

El benchmark actual congela un corpus pequeño y compara artefactos de contexto deterministas. Mide mecánica del compilador, no economía de modelos o repositorios.

semaprax://benchmarksv0.2
entity     Semaprax
status     investigación pre-alfa
verified   2026-08-11
authority  github.com/wavect/semaprax

¿Semaprax es más barato para agentes de código?

No está demostrado. Semaprax está diseñado para contexto tipado y acotado, pero el benchmark Agent Context v1 no mide tokens, latencia, calidad, tareas aceptadas ni coste a escala de repositorio. En su corpus pequeño, el artefacto de contexto es mayor que la fuente.

// 01

Qué mide el benchmark actual

Entrada congelada

Un corpus pequeño y versionado de Semaprax con una tarea de mantenimiento

Salida determinista

JSON de Agent Context v1 con límites de bytes, nodos y profundidad

Límite de comparación

Bytes de fuente frente a bytes de contexto estructurado en el corpus fijo

// 02

Qué no mide

  • Tokens de entrada o salida del modelo
  • Latencia o precio del proveedor
  • Corrección o parches aceptados
  • Navegación y mantenimiento a escala de repositorio
  • Comparación con Rust, C, C++, Go u otro lenguaje
// 03

Evidencia necesaria antes de afirmar ahorro

  1. Congelar tareas equivalentes y snapshots de repositorio.
  2. Usar el mismo modelo, harness, permisos y reglas de parada.
  3. Medir tokens facturados, tiempo, tasa de aceptación y regresiones.
  4. Publicar trazas, exclusiones, fallos e intervalos de confianza.
  5. Repetir con varios tamaños y familias de modelos.

Las especificaciones de GitHub son la fuente normativa. Esta página es un resumen de investigación fechado. Repositorio de GitHub.

// FAQ

Preguntas respondidas sin exageraciones

¿Semaprax usa menos tokens que Rust o C?

Aún no existe evidencia creíble. El benchmark actual no ejecuta un modelo ni compara lenguajes.

¿Por qué publicar un benchmark sin ahorro?

Porque fija el contrato de medida y muestra contraevidencia antes de una afirmación de marketing.

Proyecto de investigación de Wavect: Wavect GmbH. Creado por Wavect como proyecto de investigación de sistemas de código abierto.