BENCHMARKS · CÓDIGO V0.5.0

El contexto se puede medir. El ahorro de coste aún no está demostrado.

Publicar el contraejemplo antes de la afirmación.

El repositorio contiene varios sistemas de medición, no solo la comparación original de bytes de Agent Context v1. Revisa objeto, toolchain, host y estado de evidencia antes de interpretarlos como resultados. Una versión nueva no actualiza mediciones históricas.

semaprax://benchmarksv0.5.0
entity     Semaprax
status     investigación pre-alfa
snapshot   b9f593c
authority  github.com/wavect/semaprax
// STATUS

Estado del repositorio en la instantánea auditada

Instantánea del repositoriob9f593c · 2026-09-16. El commit de main revisado coincide con la etiqueta v0.5.0. La CI de esa etiqueta terminó correctamente; la CI independiente de la rama fue cancelada. Esto no garantiza aptitud para producción ni seguridad general.
Estado del producto completo55 Parcial · 0 Implementado · 0 Faltante
Contrato de grafo y proyectoLos esquemas del grafo se seleccionan por función y preservan contratos anteriores. Project v1 es la base; los perfiles de datos con ownership v8, v9, v10 y v11 tienen límites propios.
Versión preliminar publicadav0.5.0 · Publicada el 16 de septiembre de 2026 a las 09:43 UTC. Tres archivos: Linux x86-64, macOS Apple Silicon y Windows x86-64, con SHA256SUMS. El binario semaprax incluido es la toolchain completa, no la CLI independiente de Cargo. CI de la etiqueta exacta.
Previews de paquetes y APIPublicar la toolchain no publica sus paquetes Rust/npm generados ni promueve APIs privadas. Las decisiones sobre Project v8-v11, ownership genérico público, más plataformas y etapas Agent nativas/Wasm siguen siendo independientes.

¿Semaprax es más barato para agentes de código?

No se demuestra una ventaja general de coste. Las proyecciones compactas miden bytes y tokens de grafos/contexto verificados por replay con cl100k_base y o200k_base en caché. Son recuentos del tokenizador, no facturas ni coste por tarea aceptada. El pequeño corpus v1 sigue siendo contraevidencia: su contexto estructurado es mayor que el código fuente.

// 01

Cinco líneas de evidencia con límites distintos

Línea base original de contexto

Un corpus congelado de Agent Context v1 compara bytes de código con contexto estructurado determinista. No llama a un modelo ni compara lenguajes.

Grafo compacto y contexto de tarea

El script emite proyecciones text, binary y model-text, verifica su replay contra el grafo ordinario y registra bytes, hashes y tokens offline. Que exista el script no demuestra un porcentaje de ahorro.

Rendimiento local histórico

La línea base del 6 de septiembre registra 22 escenarios correctos en un host darwin-arm64 con un binario debug v0.3.5 y cinco muestras por escenario. Sus p50/p95 son evidencia histórica orientativa, no rendimiento de v0.5.0.

Laboratorio multilenguaje

Se enumeran nueve lenguajes; Semaprax, Rust y TypeScript tienen adaptadores operativos. Los otros seis están bloqueados, no fallidos. Tareas, oráculos ocultos y procedencia permiten comparar pass/fail, pero no hay tiempos registrados ni un ranking de lenguajes.

Captura de pilotos de modelo controlados

v0.5.0 añade orden contrabalanceado, herramientas MCP aisladas para dos vías, fuentes candidatas retenidas y archivos exactos de transporte. Las pruebas capturadas no equivalen a observaciones elegibles y revisadas. Una demo offline de reparación con dos llamadas no mide productividad con proveedores reales.

// 02

Qué no establece la evidencia disponible

  • Ventaja general en tokens facturados o coste por tarea aceptada.
  • Mayor corrección, menor latencia o más productividad que Rust, TypeScript u otros lenguajes.
  • Rendimiento de v0.5.0 a partir de una medición histórica debug v0.3.5.
  • Resultados amplios entre repositorios y modelos a partir de un corpus pequeño, un harness o un piloto capturado.
// 03

Evidencia necesaria antes de afirmar ahorro

  1. Congelar tareas equivalentes y snapshots de repositorio.
  2. Usar el mismo modelo, harness, permisos y reglas de parada.
  3. Medir tokens facturados, tiempo, tasa de aceptación y regresiones.
  4. Publicar trazas, exclusiones, fallos e intervalos de confianza.
  5. Repetir con varios tamaños y familias de modelos.

Revisado contra el commit fijado y el registro de v0.5.0. Las especificaciones versionadas delimitan admisión y autoridad; los encabezados antiguos de v0.4 en la matriz y el roadmap no identifican la última versión. Repositorio de GitHub.

// REF

Fuentes primarias de esta página

Revisado contra el commit fijado y el registro de v0.5.0. Las especificaciones versionadas delimitan admisión y autoridad; los encabezados antiguos de v0.4 en la matriz y el roadmap no identifican la última versión.

  1. Contrato original de evidencia Agent Context
  2. Código de proyecciones compactas y medición offline de tokens
  3. Línea base histórica local de rendimiento v0.3.5
  4. Laboratorio multilenguaje y no afirmaciones explícitas
  5. Publicación v0.5.0 y archivos disponibles
// FAQ

Preguntas respondidas sin exageraciones

¿Semaprax usa menos tokens que Rust o C?

No hay comparación general demostrada. El script compacto cuenta tokens con tokenizadores offline; el laboratorio ejecuta tareas Semaprax, Rust y TypeScript sin tiempos registrados. Ninguno demuestra ahorro de tokens facturados ni menor coste por tarea aceptada.

¿Por qué publicar un benchmark sin ahorro?

Para mostrar límites y contraevidencia. Tiempos históricos, tokens verificados por replay, corrección del harness y pilotos capturados deben seguir separados hasta que observaciones comparables revisadas permitan una afirmación concreta.

Proyecto de investigación de Wavect: Wavect GmbH. Creado por Wavect como proyecto de investigación de sistemas de código abierto.