BENCHMARK · AGENT CONTEXT V1

El contexto se puede medir. El ahorro de coste aún no está demostrado.

Publicar el contraejemplo antes de la afirmación.

El benchmark actual sigue siendo específico de Agent Context v1. Congela un corpus pequeño y compara artefactos de contexto deterministas. Mide mecánica del compilador, no economía de modelos o repositorios.

semaprax://benchmarksv0.2
entity     Semaprax
status     investigación pre-alfa
snapshot   c16348f
authority  github.com/wavect/semaprax
// STATUS

Estado del repositorio en la instantánea auditada

Instantánea del repositorioc16348f · 2026-08-29. La documentación pasó, pero el workflow general falló. Por eso este head no se etiqueta como verificado.
Estado del producto completo49 Parcial · 0 Implementado · 0 Faltante
Contrato de grafo y proyectoGraph ≤ v24 · Project v1 base · Project v8, v9, v10 vista previa
Base de promociónEsta instantánea no afirma ningún commit ni ejecución de workflow de promoción exactos y correctos.
Vista previa de desarrollo en el código fuenteLos perfiles de proyecto de datos owned, records y UTF-8, el análisis de paquetes, las ampliaciones de borrowing, Project Agent Transport y Revision Store existen en el código fuente, pero no están publicados o promovidos.

¿Semaprax es más barato para agentes de código?

No está demostrado. Semaprax está diseñado para contexto tipado y acotado, pero el benchmark Agent Context v1 no mide tokens, latencia, calidad, tareas aceptadas ni coste a escala de repositorio. En su corpus pequeño, el artefacto de contexto es mayor que la fuente.

// 01

Qué mide el benchmark actual

Entrada congelada

Un corpus pequeño y versionado de Semaprax con una tarea de mantenimiento

Salida determinista

JSON de Agent Context v1 con límites de bytes, nodos y profundidad

Límite de comparación

Bytes de fuente frente a bytes de contexto estructurado en el corpus fijo

// 02

Qué no mide

  • Tokens de entrada o salida del modelo
  • Latencia o precio del proveedor
  • Corrección o parches aceptados
  • Navegación y mantenimiento a escala de repositorio
  • Comparación con Rust, C, C++, Go u otro lenguaje
// 03

Evidencia necesaria antes de afirmar ahorro

  1. Congelar tareas equivalentes y snapshots de repositorio.
  2. Usar el mismo modelo, harness, permisos y reglas de parada.
  3. Medir tokens facturados, tiempo, tasa de aceptación y regresiones.
  4. Publicar trazas, exclusiones, fallos e intervalos de confianza.
  5. Repetir con varios tamaños y familias de modelos.

Las especificaciones de GitHub son la fuente normativa. Esta página es un resumen de investigación fechado. Repositorio de GitHub.

// FAQ

Preguntas respondidas sin exageraciones

¿Semaprax usa menos tokens que Rust o C?

Aún no existe evidencia creíble. El benchmark actual no ejecuta un modelo ni compara lenguajes.

¿Por qué publicar un benchmark sin ahorro?

Porque fija el contrato de medida y muestra contraevidencia antes de una afirmación de marketing.

Proyecto de investigación de Wavect: Wavect GmbH. Creado por Wavect como proyecto de investigación de sistemas de código abierto.