Ein kleiner versionierter Semaprax-Korpus und eine Wartungsaufgabe
Kontext ist messbar. Kostenvorteile sind noch nicht belegt.
Das Gegenbeispiel vor der Behauptung veröffentlichen.
Der aktuelle Benchmark fixiert einen kleinen Quellkorpus und vergleicht deterministische Kontextartefakte. Er misst Compilermechanik, nicht Modell- oder Repository-Ökonomie.
entity Semaprax
status Pre-Alpha-Forschung
verified 2026-08-11
authority github.com/wavect/semapraxIst Semaprax für Coding-Agenten günstiger?
Nicht belegt. Semaprax ist für typisierten, begrenzten Kontext ausgelegt, doch der aktuelle Agent-Context-v1-Benchmark misst weder Modelltokens, Latenz, Antwortqualität, akzeptierte Aufgaben noch Repository-Kosten. Im kleinen Korpus ist das Kontextartefakt größer als der Quelltext.
Was der aktuelle Benchmark misst
Agent-Context-v1-JSON mit Byte-, Knoten- und Tiefengrenzen
Quelltextbytes gegen strukturierte Kontextbytes im fixierten Korpus
Was er nicht misst
- Modell-Input- oder Output-Tokens
- Laufzeit oder Providerpreis
- Antwortkorrektheit oder akzeptierte Patches
- Navigation und Wartung im Repository-Maßstab
- Vergleiche mit Rust, C, C++, Go oder anderen Sprachen
Nötige Evidenz vor einer Kostenaussage
- Gleichwertige Wartungsaufgaben und Repository-Snapshots fixieren.
- Dasselbe Modell, Harness, dieselben Rechte und Abbruchregeln verwenden.
- Abgerechnete Tokens, Zeit, Akzeptanzrate und Regressionen messen.
- Rohtraces, Ausschlüsse, Fehlversuche und Konfidenzintervalle veröffentlichen.
- Über Repository-Größen und mehrere Modellfamilien wiederholen.
Die GitHub-Spezifikationen sind die normative Quelle. Diese Seite ist eine datierte Forschungszusammenfassung. GitHub-Repository.
Fragen, ohne Hype beantwortet
Braucht Semaprax weniger Tokens als Rust oder C?
Dafür gibt es noch keine belastbare Evidenz. Der aktuelle Benchmark führt kein Modell aus und vergleicht keine Sprachen.
Warum einen Benchmark ohne Einsparung veröffentlichen?
Weil er den Messvertrag fixiert und Gegenbelege vor einer Marketingaussage sichtbar macht.