BENCHMARKS · CÓDIGO V0.8.0

El contexto se puede medir. El ahorro de coste aún no está demostrado.

Publicar el contraejemplo antes de la afirmación.

Semaprax publica ahora tokens medidos de proyecciones compactas, registros del proveedor por tarea, una evaluación de pago de la orquestación y mediciones reales de aplicaciones Rust y recarga en caliente. Algunas vistas se reducen; las pequeñas crecen. La campaña de costes registrada no justificó un nuevo valor predeterminado y el pequeño caso de recarga fue más lento que reiniciar.

semaprax://benchmarksv0.8.0
entity     Semaprax
status     beta
snapshot   615e501
authority  github.com/wavect/semaprax
// STATUS

Estado del repositorio en la instantánea auditada

Instantánea del repositorio615e501 · 2026-10-06. La etiqueta v0.8.0 apunta al commit de código fijado. La CI exacta de la etiqueta terminó correctamente. Esto no garantiza aptitud para producción ni seguridad general.
Estado del producto completo55 Parcial · 0 Implementado · 0 Faltante
Contrato de grafo y proyectoEl código canónico, los ID estables y las representaciones comprobadas del compilador conectan leyes, consultas semánticas, cambios y ejecución. Los esquemas de grafo y Project seleccionados por funcionalidad conservan sus propios contratos de admisión, compatibilidad y autoridad del anfitrión.
Versión beta publicadav0.8.0 · Publicada el 6 de octubre de 2026 a las 07:37 UTC. Los 82 trabajos de CI de la etiqueta exacta finalizaron correctamente. Se publicaron tres archivos de la cadena de herramientas, SHA256SUMS, atestaciones por archivo y procedencia agregada firmada. El trabajo de lanzamiento verificó de forma independiente el conjunto firmado antes de publicarlo. Los archivos no están notarizados ni se afirma que las compilaciones sean reproducibles; la verificación sin conexión no acredita el estado actual de revocación. CI de la etiqueta exacta.
Previews de paquetes y APILa versión incluye perfiles útiles del lenguaje, leyes del programa, orquestación e integración con el sistema anfitrión. La publicación y el soporte de los paquetes Rust/npm generados, las ABI genéricas públicas y otras plataformas siguen requiriendo decisiones independientes.

¿Semaprax es más barato para agentes de código?

No se ha demostrado una ventaja general de coste. Las mediciones locales exactas con cl100k_base muestran cargas model-text más pequeñas para dos grafos grandes y el contexto de una tarea HTTP, mientras que los contextos pequeños crecen. Otra campaña de pago midió el coste por tarea aceptada; el mejor ahorro fue de aproximadamente un 1%, por debajo del umbral del 10% fijado de antemano. Uso del proveedor, tokens locales, velocidad de ejecución y corrección de tareas siguen siendo mediciones distintas.

// TOKENS

Los mismos hechos seleccionados, contados de dos formas

Cinco filas del informe local model-text v2 guardado en el repositorio. Los recuentos utilizan cl100k_base sobre la carga completa, incluidos los metadatos. Son recuentos de un tokenizador local, no facturas del proveedor; un valor model-text mayor es una regresión.

Vista seleccionadaTokens JSONTokens model-text
Libro contable bancario: grafo completo3784632486
ledger.apply: contexto de tarea16791802
Aplicación HTTP: grafo completo161861134165
HTTP app.main: contexto de tarea56025010
Project de calculadora: grafo25002615

Consulta el corpus exacto, los dos tokenizadores y el contrato de comprobación

// 01

Seis líneas de evidencia medida o comprobada de nuevo

Tokens exactos de las cargas compactas

Con tiktoken 0.12.0 en caché, los grafos grandes bancario y HTTP bajan de 37.846 a 32.486 y de 161.861 a 134.165 tokens cl100k_base. La vista de tarea HTTP baja de 5.602 a 5.010. Se cuenta el sobre model-text completo y se comprueba de nuevo contra el mismo JSON seleccionado.

Regresiones en vistas pequeñas

El contexto de tarea del libro contable aumenta de 1.679 a 1.802 tokens; el grafo del Project de calculadora pasa de 2.500 a 2.615. Los metadatos fijos pueden superar el ahorro de la compresión. Comparar código y contexto responde a una pregunta distinta de codificar los mismos hechos seleccionados.

Informes de sesión y registros del proveedor

Los informes de tokens agrupan huellas de tokenizadores, métodos y límites de medición compatibles. Los registros de orquestación conservan el uso real del proveedor, los intentos fallidos o truncados y los costes estimados frente a los declarados. Los recuentos ausentes siguen sin estar disponibles; un registro por sí solo no es el resultado de una comparación.

Evaluación de pago del coste por tarea

La campaña del 5 de octubre utilizó Claude Haiku 4.5 mediante una capa de medición: 711 llamadas y 3,10 USD de gasto registrado. Cada variante aceptó 109 de 120 tareas. El mejor ahorro por tarea aceptada fue de aproximadamente un 1%, por debajo del 10% exigido; ninguna variante superó la evaluación y los valores predeterminados no cambiaron. La ruta de tareas de aplicación no ejercita todo el flujo del código Semaprax.

Sobrecoste real de aplicaciones Rust

Las aplicaciones guardadas con Regex/Url, Serde/iteradores y reqwest/Tokio tienen registros limpios, bloqueados y sin conexión en macOS arm64 y un invitado Linux x86-64, cada uno con 22 etapas o mediciones superadas. Los resultados incluyen registros de copias y asignaciones. El rendimiento adverso de M1/M3 sigue bajo investigación; no demuestra un sobrecoste cercano a cero.

Recarga comprobada frente a reinicio

En el caso registrado de macOS arm64, la recarga en frío de A a B tuvo una mediana de 545,694 ms, frente a 37,904 ms para un reinicio completo. Once muestras y mediciones separadas de admisión, preparación, espera y activación conservan esa evidencia contraria. Demuestra continuidad comprobada, no una aceleración ni un resultado aplicable a otros sistemas operativos.

// 02

Lo que estos resultados no demuestran

  • Una ventaja general en tokens facturados por el proveedor o coste por tarea aceptada entre proyectos y modelos.
  • Mayor corrección, menor latencia o más productividad de mantenimiento que Rust, TypeScript u otro lenguaje.
  • Interoperabilidad universal con Rust sin sobrecoste, ni rendimiento físico de Linux x86-64 a partir de un invitado emulado.
  • Una ventaja de velocidad en recarga, sustitución de procesos nativos/Wasm o rendimiento amplio entre plataformas.
  • Rendimiento de la versión actual a partir de tiempos históricos de compilaciones de depuración, ni corrección a partir de una proporción de compresión.
// 03

Evidencia necesaria antes de afirmar ahorro

  1. Fija tareas equivalentes, revisiones del código, adaptadores y el evaluador de aceptación antes del experimento.
  2. Mantén comparables la identidad del modelo, los permisos, los límites de tokens y dinero, los reintentos y las reglas de parada.
  3. Registra los datos completos del proveedor, el tiempo transcurrido, la tasa de tareas aceptadas y los fallos de regresión, incluidos los intentos sin éxito.
  4. Publica mediciones sin procesar, evidencia ausente, exclusiones e incertidumbre. Mantén separados los tokenizadores locales y el uso facturado.
  5. Exige los umbrales declarados de calidad y coste antes de cambiar los valores predeterminados; repite la evaluación con otros proyectos, modelos y anfitriones.

Revisado frente a la etiqueta v0.8.0 y su commit de código fijado. Las especificaciones versionadas definen admisión y autoridad; los títulos de versiones anteriores en la matriz y el roadmap son históricos. GitHub repository.

// DOCS

Abre el manual de Semaprax

El manual en línea es la guía en inglés publicada desde main y puede incluir cambios posteriores a 0.8.0. Utiliza la copia fijada a la revisión al reproducir esta versión.

// REF

Fuentes primarias de esta página

Revisado frente a la etiqueta v0.8.0 y su commit de código fijado. Las especificaciones versionadas definen admisión y autoridad; los títulos de versiones anteriores en la matriz y el roadmap son históricos.

  1. Contrato model-text compacto y tabla exacta de tokens
  2. Informe original de mediciones locales de tokens
  3. Informes de tokens por entrada y sesión
  4. Semántica de registros del proveedor, costes y límites de salida
  5. Evaluación de pago y valores predeterminados sin cambios
  6. Registros de aplicaciones Rust reales y sobrecoste
  7. Tiempos de recarga y comparación con reinicio
  8. Límite de la medición original de contexto
// FAQ

Preguntas y respuestas prácticas

¿Semaprax usa menos tokens que Rust o C?

No se ha establecido una comparación general entre lenguajes. La tabla de contexto compacto compara dos codificaciones de los mismos hechos Semaprax seleccionados e incluye reducciones y regresiones. Otra campaña de pago midió el coste por tarea aceptada, pero su mejor ahorro, de aproximadamente el 1%, no alcanzó el umbral del 10%.

¿Por qué publicar un benchmark sin ahorro?

Permite saber cuándo ayuda una optimización y cuándo no. Las vistas compactas pequeñas pueden crecer, el caso registrado de recarga es más lento que reiniciar y algunas rutas de aplicaciones Rust tienen rendimiento adverso. Mantener esos resultados junto a la evidencia positiva permite revisar las decisiones de soporte y valores predeterminados.

Proyecto de investigación de Wavect: Wavect GmbH. Creado por Wavect como proyecto de investigación de sistemas de código abierto.