Un corpus pequeño y versionado de Semaprax con una tarea de mantenimiento
El contexto se puede medir. El ahorro de coste aún no está demostrado.
Publicar el contraejemplo antes de la afirmación.
El benchmark actual congela un corpus pequeño y compara artefactos de contexto deterministas. Mide mecánica del compilador, no economía de modelos o repositorios.
entity Semaprax
status investigación pre-alfa
verified 2026-08-11
authority github.com/wavect/semaprax¿Semaprax es más barato para agentes de código?
No está demostrado. Semaprax está diseñado para contexto tipado y acotado, pero el benchmark Agent Context v1 no mide tokens, latencia, calidad, tareas aceptadas ni coste a escala de repositorio. En su corpus pequeño, el artefacto de contexto es mayor que la fuente.
Qué mide el benchmark actual
JSON de Agent Context v1 con límites de bytes, nodos y profundidad
Bytes de fuente frente a bytes de contexto estructurado en el corpus fijo
Qué no mide
- Tokens de entrada o salida del modelo
- Latencia o precio del proveedor
- Corrección o parches aceptados
- Navegación y mantenimiento a escala de repositorio
- Comparación con Rust, C, C++, Go u otro lenguaje
Evidencia necesaria antes de afirmar ahorro
- Congelar tareas equivalentes y snapshots de repositorio.
- Usar el mismo modelo, harness, permisos y reglas de parada.
- Medir tokens facturados, tiempo, tasa de aceptación y regresiones.
- Publicar trazas, exclusiones, fallos e intervalos de confianza.
- Repetir con varios tamaños y familias de modelos.
Las especificaciones de GitHub son la fuente normativa. Esta página es un resumen de investigación fechado. Repositorio de GitHub.
Preguntas respondidas sin exageraciones
¿Semaprax usa menos tokens que Rust o C?
Aún no existe evidencia creíble. El benchmark actual no ejecuta un modelo ni compara lenguajes.
¿Por qué publicar un benchmark sin ahorro?
Porque fija el contrato de medida y muestra contraevidencia antes de una afirmación de marketing.