Un corpus congelado de Agent Context v1 compara bytes de código con contexto estructurado determinista. No llama a un modelo ni compara lenguajes.
El contexto se puede medir. El ahorro de coste aún no está demostrado.
Publicar el contraejemplo antes de la afirmación.
El repositorio contiene varios sistemas de medición, no solo la comparación original de bytes de Agent Context v1. Revisa objeto, toolchain, host y estado de evidencia antes de interpretarlos como resultados. Una versión nueva no actualiza mediciones históricas.
entity Semaprax
status investigación pre-alfa
snapshot b9f593c
authority github.com/wavect/semapraxEstado del repositorio en la instantánea auditada
| Instantánea del repositorio | b9f593c · 2026-09-16. El commit de main revisado coincide con la etiqueta v0.5.0. La CI de esa etiqueta terminó correctamente; la CI independiente de la rama fue cancelada. Esto no garantiza aptitud para producción ni seguridad general. |
|---|---|
| Estado del producto completo | 55 Parcial · 0 Implementado · 0 Faltante |
| Contrato de grafo y proyecto | Los esquemas del grafo se seleccionan por función y preservan contratos anteriores. Project v1 es la base; los perfiles de datos con ownership v8, v9, v10 y v11 tienen límites propios. |
| Versión preliminar publicada | v0.5.0 · Publicada el 16 de septiembre de 2026 a las 09:43 UTC. Tres archivos: Linux x86-64, macOS Apple Silicon y Windows x86-64, con SHA256SUMS. El binario semaprax incluido es la toolchain completa, no la CLI independiente de Cargo. CI de la etiqueta exacta. |
| Previews de paquetes y API | Publicar la toolchain no publica sus paquetes Rust/npm generados ni promueve APIs privadas. Las decisiones sobre Project v8-v11, ownership genérico público, más plataformas y etapas Agent nativas/Wasm siguen siendo independientes. |
¿Semaprax es más barato para agentes de código?
No se demuestra una ventaja general de coste. Las proyecciones compactas miden bytes y tokens de grafos/contexto verificados por replay con cl100k_base y o200k_base en caché. Son recuentos del tokenizador, no facturas ni coste por tarea aceptada. El pequeño corpus v1 sigue siendo contraevidencia: su contexto estructurado es mayor que el código fuente.
Cinco líneas de evidencia con límites distintos
El script emite proyecciones text, binary y model-text, verifica su replay contra el grafo ordinario y registra bytes, hashes y tokens offline. Que exista el script no demuestra un porcentaje de ahorro.
La línea base del 6 de septiembre registra 22 escenarios correctos en un host darwin-arm64 con un binario debug v0.3.5 y cinco muestras por escenario. Sus p50/p95 son evidencia histórica orientativa, no rendimiento de v0.5.0.
Se enumeran nueve lenguajes; Semaprax, Rust y TypeScript tienen adaptadores operativos. Los otros seis están bloqueados, no fallidos. Tareas, oráculos ocultos y procedencia permiten comparar pass/fail, pero no hay tiempos registrados ni un ranking de lenguajes.
v0.5.0 añade orden contrabalanceado, herramientas MCP aisladas para dos vías, fuentes candidatas retenidas y archivos exactos de transporte. Las pruebas capturadas no equivalen a observaciones elegibles y revisadas. Una demo offline de reparación con dos llamadas no mide productividad con proveedores reales.
Qué no establece la evidencia disponible
- Ventaja general en tokens facturados o coste por tarea aceptada.
- Mayor corrección, menor latencia o más productividad que Rust, TypeScript u otros lenguajes.
- Rendimiento de v0.5.0 a partir de una medición histórica debug v0.3.5.
- Resultados amplios entre repositorios y modelos a partir de un corpus pequeño, un harness o un piloto capturado.
Evidencia necesaria antes de afirmar ahorro
- Congelar tareas equivalentes y snapshots de repositorio.
- Usar el mismo modelo, harness, permisos y reglas de parada.
- Medir tokens facturados, tiempo, tasa de aceptación y regresiones.
- Publicar trazas, exclusiones, fallos e intervalos de confianza.
- Repetir con varios tamaños y familias de modelos.
Revisado contra el commit fijado y el registro de v0.5.0. Las especificaciones versionadas delimitan admisión y autoridad; los encabezados antiguos de v0.4 en la matriz y el roadmap no identifican la última versión. Repositorio de GitHub.
Fuentes primarias de esta página
Revisado contra el commit fijado y el registro de v0.5.0. Las especificaciones versionadas delimitan admisión y autoridad; los encabezados antiguos de v0.4 en la matriz y el roadmap no identifican la última versión.
Preguntas respondidas sin exageraciones
¿Semaprax usa menos tokens que Rust o C?
No hay comparación general demostrada. El script compacto cuenta tokens con tokenizadores offline; el laboratorio ejecuta tareas Semaprax, Rust y TypeScript sin tiempos registrados. Ninguno demuestra ahorro de tokens facturados ni menor coste por tarea aceptada.
¿Por qué publicar un benchmark sin ahorro?
Para mostrar límites y contraevidencia. Tiempos históricos, tokens verificados por replay, corrección del harness y pilotos capturados deben seguir separados hasta que observaciones comparables revisadas permitan una afirmación concreta.