Ein eingefrorener Agent-Context-v1-Korpus vergleicht Quelltext-Bytes mit deterministischen strukturierten Kontext-Bytes. Er ruft kein Modell auf und vergleicht keine Programmiersprachen.
Kontext ist messbar. Kostenvorteile sind noch nicht belegt.
Das Gegenbeispiel vor der Behauptung veröffentlichen.
Das Repository enthält inzwischen mehrere Messsysteme, nicht nur den ursprünglichen Bytevergleich von Agent Context v1. Prüfe Gegenstand, Toolchain, Host und Evidenzstatus, bevor daraus Ergebnisse abgeleitet werden. Ein neuer Compiler-Release aktualisiert keine historischen Messungen.
entity Semaprax
status Pre-Alpha-Forschung
snapshot b9f593c
authority github.com/wavect/semapraxRepository-Status zum geprüften Snapshot
| Repository-Snapshot | b9f593c · 2026-09-16. Der geprüfte main-Commit entspricht dem Tag v0.5.0. Dessen exakte Tag-CI war erfolgreich; die separate Branch-CI wurde abgebrochen. Daraus folgt keine allgemeine Produktions- oder Sicherheitsgarantie. |
|---|---|
| Status des Gesamtprodukts | 55 Teilweise · 0 Implementiert · 0 Fehlend |
| Graph- und Projektvertrag | Funktionsabhängige Graphschemas erhalten frühere Verträge. Project v1 ist die Baseline; die Owned-Data-Profile v8, v9, v10 und v11 haben eigene Zulassungs- und Supportgrenzen. |
| Veröffentlichtes Prerelease | v0.5.0 · Veröffentlicht am 16. September 2026 um 09:43 UTC. Drei Archive: Linux x86-64, macOS Apple Silicon und Windows x86-64, mit SHA256SUMS. Das enthaltene semaprax ist die vollständige Toolchain, nicht die eigenständige Cargo-CLI. Exakte Tag-CI. |
| Paket- und API-Vorschau | Eine veröffentlichte Toolchain veröffentlicht weder ihre generierten Rust/npm-Pakete noch private APIs. Supportentscheidungen für Project v8-v11, öffentliche generische Ownership, weitere Plattformen und native/Wasm-Ausführung von Agent-Stufen bleiben separat. |
Ist Semaprax für Coding-Agenten günstiger?
Ein allgemeiner Kostenvorteil ist nicht belegt. Compact-Projection-Werkzeuge messen replay-geprüfte Graph-/Kontext-Bytes und Tokens mit gecachten cl100k_base- und o200k_base-Tokenizern. Das sind Tokenizer-Zählungen, keine Provider-Rechnungen oder Kosten je akzeptierter Aufgabe. Der kleine v1-Korpus bleibt ein Gegenbeispiel: Sein strukturierter Kontext ist größer als der Quelltext.
Fünf Evidenzstränge mit unterschiedlichen Grenzen
Das Skript erzeugt Text-, Binär- und Model-Text-Projektionen, prüft sie durch Replay gegen den normalen Graph und erfasst Bytes, Hashes und Offline-Tokenzahlen. Seine Existenz belegt keinen gemessenen Einsparungsprozentsatz.
Die gespeicherte Baseline vom 6. September enthält 22 erfolgreiche Szenarien auf einem darwin-arm64-Host mit einem Debug-v0.3.5-Binary und fünf Messungen pro Szenario. p50/p95 sind historische lokale Hinweise, keine v0.5.0-Release-Performance.
Neun Sprachen sind aufgeführt; Semaprax, Rust und TypeScript haben funktionsfähige Adapter. Die sechs anderen sind blockiert, nicht fehlgeschlagen. Aufgaben, verdeckte Prüfungen und Provenienz ermöglichen Pass/Fail-Vergleiche. Zeitmessungen sind nicht hinterlegt, eine Rangliste folgt daraus nicht.
v0.5.0 ergänzt ausbalancierte Reihenfolgen, isolierte MCP-Werkzeuge für zwei Vergleichspfade, gespeicherte Kandidatenquellen und exakte Transportarchive. Erfasste Versuche bleiben von zulässigen, geprüften Beobachtungen getrennt. Eine Offline-Reparaturdemo mit zwei Aufrufen ist kein Live-Provider-Produktivitätsbenchmark.
Was die verfügbare Evidenz nicht belegt
- Allgemein niedrigere abgerechnete Tokens oder Kosten je akzeptierter Aufgabe.
- Bessere Korrektheit, Latenz oder Wartungsproduktivität als Rust, TypeScript oder andere Sprachen.
- v0.5.0-Release-Performance aus einer historischen Debug-v0.3.5-Messung.
- Breite Repository- oder Multi-Modell-Ergebnisse aus einem kleinen Korpus, einem Harness oder einem erfassten Pilotversuch.
Nötige Evidenz vor einer Kostenaussage
- Gleichwertige Wartungsaufgaben und Repository-Snapshots fixieren.
- Dasselbe Modell, Harness, dieselben Rechte und Abbruchregeln verwenden.
- Abgerechnete Tokens, Zeit, Akzeptanzrate und Regressionen messen.
- Rohtraces, Ausschlüsse, Fehlversuche und Konfidenzintervalle veröffentlichen.
- Über Repository-Größen und mehrere Modellfamilien wiederholen.
Geprüft anhand des festgehaltenen Commits und des Release-Eintrags v0.5.0. Versionierte Spezifikationen definieren Zulassung und Befugnisse. Ältere v0.4-Release-Überschriften in Matrix und Roadmap sind historisch, nicht die aktuelle Release-Identität. GitHub-Repository.
Primärquellen für diese Seite
Geprüft anhand des festgehaltenen Commits und des Release-Eintrags v0.5.0. Versionierte Spezifikationen definieren Zulassung und Befugnisse. Ältere v0.4-Release-Überschriften in Matrix und Roadmap sind historisch, nicht die aktuelle Release-Identität.
Fragen, ohne Hype beantwortet
Braucht Semaprax weniger Tokens als Rust oder C?
Ein allgemeiner Vergleich ist nicht belegt. Das Compact-Skript zählt Tokens mit bestimmten Offline-Tokenizern; der Sprachvergleich führt Semaprax-, Rust- und TypeScript-Aufgaben ohne hinterlegte Zeitmessungen aus. Beides belegt weder weniger abgerechnete Tokens noch bessere Kosten je akzeptierter Aufgabe.
Warum einen Benchmark ohne Einsparung veröffentlichen?
Damit Messgrenzen und Gegenbelege sichtbar werden. Historische lokale Zeiten, replay-geprüfte Tokenzahlen, Harness-Korrektheit und erfasste Modellversuche bleiben getrennt, bis vergleichbare geprüfte Beobachtungen eine engere Aussage tragen.