BENCHMARKS · V0.5.0-QUELLSTAND

Kontext ist messbar. Kostenvorteile sind noch nicht belegt.

Das Gegenbeispiel vor der Behauptung veröffentlichen.

Das Repository enthält inzwischen mehrere Messsysteme, nicht nur den ursprünglichen Bytevergleich von Agent Context v1. Prüfe Gegenstand, Toolchain, Host und Evidenzstatus, bevor daraus Ergebnisse abgeleitet werden. Ein neuer Compiler-Release aktualisiert keine historischen Messungen.

semaprax://benchmarksv0.5.0
entity     Semaprax
status     Pre-Alpha-Forschung
snapshot   b9f593c
authority  github.com/wavect/semaprax
// STATUS

Repository-Status zum geprüften Snapshot

Repository-Snapshotb9f593c · 2026-09-16. Der geprüfte main-Commit entspricht dem Tag v0.5.0. Dessen exakte Tag-CI war erfolgreich; die separate Branch-CI wurde abgebrochen. Daraus folgt keine allgemeine Produktions- oder Sicherheitsgarantie.
Status des Gesamtprodukts55 Teilweise · 0 Implementiert · 0 Fehlend
Graph- und ProjektvertragFunktionsabhängige Graphschemas erhalten frühere Verträge. Project v1 ist die Baseline; die Owned-Data-Profile v8, v9, v10 und v11 haben eigene Zulassungs- und Supportgrenzen.
Veröffentlichtes Prereleasev0.5.0 · Veröffentlicht am 16. September 2026 um 09:43 UTC. Drei Archive: Linux x86-64, macOS Apple Silicon und Windows x86-64, mit SHA256SUMS. Das enthaltene semaprax ist die vollständige Toolchain, nicht die eigenständige Cargo-CLI. Exakte Tag-CI.
Paket- und API-VorschauEine veröffentlichte Toolchain veröffentlicht weder ihre generierten Rust/npm-Pakete noch private APIs. Supportentscheidungen für Project v8-v11, öffentliche generische Ownership, weitere Plattformen und native/Wasm-Ausführung von Agent-Stufen bleiben separat.

Ist Semaprax für Coding-Agenten günstiger?

Ein allgemeiner Kostenvorteil ist nicht belegt. Compact-Projection-Werkzeuge messen replay-geprüfte Graph-/Kontext-Bytes und Tokens mit gecachten cl100k_base- und o200k_base-Tokenizern. Das sind Tokenizer-Zählungen, keine Provider-Rechnungen oder Kosten je akzeptierter Aufgabe. Der kleine v1-Korpus bleibt ein Gegenbeispiel: Sein strukturierter Kontext ist größer als der Quelltext.

// 01

Fünf Evidenzstränge mit unterschiedlichen Grenzen

Ursprüngliche Kontext-Baseline

Ein eingefrorener Agent-Context-v1-Korpus vergleicht Quelltext-Bytes mit deterministischen strukturierten Kontext-Bytes. Er ruft kein Modell auf und vergleicht keine Programmiersprachen.

Kompakter Graph und Aufgabenkontext

Das Skript erzeugt Text-, Binär- und Model-Text-Projektionen, prüft sie durch Replay gegen den normalen Graph und erfasst Bytes, Hashes und Offline-Tokenzahlen. Seine Existenz belegt keinen gemessenen Einsparungsprozentsatz.

Historische lokale Performance

Die gespeicherte Baseline vom 6. September enthält 22 erfolgreiche Szenarien auf einem darwin-arm64-Host mit einem Debug-v0.3.5-Binary und fünf Messungen pro Szenario. p50/p95 sind historische lokale Hinweise, keine v0.5.0-Release-Performance.

Sprachübergreifendes Labor

Neun Sprachen sind aufgeführt; Semaprax, Rust und TypeScript haben funktionsfähige Adapter. Die sechs anderen sind blockiert, nicht fehlgeschlagen. Aufgaben, verdeckte Prüfungen und Provenienz ermöglichen Pass/Fail-Vergleiche. Zeitmessungen sind nicht hinterlegt, eine Rangliste folgt daraus nicht.

Kontrollierte Modell-Piloterfassung

v0.5.0 ergänzt ausbalancierte Reihenfolgen, isolierte MCP-Werkzeuge für zwei Vergleichspfade, gespeicherte Kandidatenquellen und exakte Transportarchive. Erfasste Versuche bleiben von zulässigen, geprüften Beobachtungen getrennt. Eine Offline-Reparaturdemo mit zwei Aufrufen ist kein Live-Provider-Produktivitätsbenchmark.

// 02

Was die verfügbare Evidenz nicht belegt

  • Allgemein niedrigere abgerechnete Tokens oder Kosten je akzeptierter Aufgabe.
  • Bessere Korrektheit, Latenz oder Wartungsproduktivität als Rust, TypeScript oder andere Sprachen.
  • v0.5.0-Release-Performance aus einer historischen Debug-v0.3.5-Messung.
  • Breite Repository- oder Multi-Modell-Ergebnisse aus einem kleinen Korpus, einem Harness oder einem erfassten Pilotversuch.
// 03

Nötige Evidenz vor einer Kostenaussage

  1. Gleichwertige Wartungsaufgaben und Repository-Snapshots fixieren.
  2. Dasselbe Modell, Harness, dieselben Rechte und Abbruchregeln verwenden.
  3. Abgerechnete Tokens, Zeit, Akzeptanzrate und Regressionen messen.
  4. Rohtraces, Ausschlüsse, Fehlversuche und Konfidenzintervalle veröffentlichen.
  5. Über Repository-Größen und mehrere Modellfamilien wiederholen.

Geprüft anhand des festgehaltenen Commits und des Release-Eintrags v0.5.0. Versionierte Spezifikationen definieren Zulassung und Befugnisse. Ältere v0.4-Release-Überschriften in Matrix und Roadmap sind historisch, nicht die aktuelle Release-Identität. GitHub-Repository.

// REF

Primärquellen für diese Seite

Geprüft anhand des festgehaltenen Commits und des Release-Eintrags v0.5.0. Versionierte Spezifikationen definieren Zulassung und Befugnisse. Ältere v0.4-Release-Überschriften in Matrix und Roadmap sind historisch, nicht die aktuelle Release-Identität.

  1. Ursprünglicher Agent-Context-Evidenzvertrag
  2. Code für kompakte Projektionen und Offline-Tokenmessung
  3. Historische lokale v0.3.5-Performance-Baseline
  4. Sprachvergleichslabor und ausdrückliche Nicht-Aussagen
  5. v0.5.0-Release und verfügbare Archive
// FAQ

Fragen, ohne Hype beantwortet

Braucht Semaprax weniger Tokens als Rust oder C?

Ein allgemeiner Vergleich ist nicht belegt. Das Compact-Skript zählt Tokens mit bestimmten Offline-Tokenizern; der Sprachvergleich führt Semaprax-, Rust- und TypeScript-Aufgaben ohne hinterlegte Zeitmessungen aus. Beides belegt weder weniger abgerechnete Tokens noch bessere Kosten je akzeptierter Aufgabe.

Warum einen Benchmark ohne Einsparung veröffentlichen?

Damit Messgrenzen und Gegenbelege sichtbar werden. Historische lokale Zeiten, replay-geprüfte Tokenzahlen, Harness-Korrektheit und erfasste Modellversuche bleiben getrennt, bis vergleichbare geprüfte Beobachtungen eine engere Aussage tragen.

Forschungsprojekt von Wavect: Wavect GmbH. Von Wavect als Open-Source-Forschungsprojekt für Programmiersysteme entwickelt.