Un corpus pequeño y versionado de Semaprax con una tarea de mantenimiento
El contexto se puede medir. El ahorro de coste aún no está demostrado.
Publicar el contraejemplo antes de la afirmación.
El benchmark actual sigue siendo específico de Agent Context v1. Congela un corpus pequeño y compara artefactos de contexto deterministas. Mide mecánica del compilador, no economía de modelos o repositorios.
entity Semaprax
status investigación pre-alfa
snapshot c16348f
authority github.com/wavect/semapraxEstado del repositorio en la instantánea auditada
| Instantánea del repositorio | c16348f · 2026-08-29. La documentación pasó, pero el workflow general falló. Por eso este head no se etiqueta como verificado. |
|---|---|
| Estado del producto completo | 49 Parcial · 0 Implementado · 0 Faltante |
| Contrato de grafo y proyecto | Graph ≤ v24 · Project v1 base · Project v8, v9, v10 vista previa |
| Base de promoción | Esta instantánea no afirma ningún commit ni ejecución de workflow de promoción exactos y correctos. |
| Vista previa de desarrollo en el código fuente | Los perfiles de proyecto de datos owned, records y UTF-8, el análisis de paquetes, las ampliaciones de borrowing, Project Agent Transport y Revision Store existen en el código fuente, pero no están publicados o promovidos. |
¿Semaprax es más barato para agentes de código?
No está demostrado. Semaprax está diseñado para contexto tipado y acotado, pero el benchmark Agent Context v1 no mide tokens, latencia, calidad, tareas aceptadas ni coste a escala de repositorio. En su corpus pequeño, el artefacto de contexto es mayor que la fuente.
Qué mide el benchmark actual
JSON de Agent Context v1 con límites de bytes, nodos y profundidad
Bytes de fuente frente a bytes de contexto estructurado en el corpus fijo
Qué no mide
- Tokens de entrada o salida del modelo
- Latencia o precio del proveedor
- Corrección o parches aceptados
- Navegación y mantenimiento a escala de repositorio
- Comparación con Rust, C, C++, Go u otro lenguaje
Evidencia necesaria antes de afirmar ahorro
- Congelar tareas equivalentes y snapshots de repositorio.
- Usar el mismo modelo, harness, permisos y reglas de parada.
- Medir tokens facturados, tiempo, tasa de aceptación y regresiones.
- Publicar trazas, exclusiones, fallos e intervalos de confianza.
- Repetir con varios tamaños y familias de modelos.
Las especificaciones de GitHub son la fuente normativa. Esta página es un resumen de investigación fechado. Repositorio de GitHub.
Preguntas respondidas sin exageraciones
¿Semaprax usa menos tokens que Rust o C?
Aún no existe evidencia creíble. El benchmark actual no ejecuta un modelo ni compara lenguajes.
¿Por qué publicar un benchmark sin ahorro?
Porque fija el contrato de medida y muestra contraevidencia antes de una afirmación de marketing.