冻结的 Agent Context v1 语料比较源码字节与确定性结构化上下文字节,不调用模型,也不比较编程语言。
上下文可以测量,成本节省尚未得到证明。
先公布反例,再提出结论。
仓库现在包含多种测量系统,不再只有最初 Agent Context v1 的字节比较。解读结果前应核对测量对象、工具链、宿主与证据状态。编译器新版本不会自动更新历史测量。
entity Semaprax
status 预 Alpha 研究
snapshot b9f593c
authority github.com/wavect/semaprax审计快照中的仓库状态
| 仓库快照 | b9f593c · 2026-09-16. 审阅时 main 提交与 v0.5.0 标签一致。该标签的 CI 已成功完成;独立分支 CI 被取消。这不构成全面的生产可用性或安全保证。 |
|---|---|
| 完整产品状态 | 55 部分 · 0 已实现 · 0 缺失 |
| 语义图与项目契约 | 图模式按功能选择并保留旧版契约。Project v1 为基础;所有权数据配置 v8、v9、v10 和 v11 各自具有独立的准入与支持边界。 |
| 已发布的预发布版 | v0.5.0 · 发布于 2026 年 9 月 16 日 09:43 UTC。提供 Linux x86-64、macOS Apple Silicon 和 Windows x86-64 三种压缩包及 SHA256SUMS。包内 semaprax 是完整工具链,并非独立的 Cargo CLI。 确切标签 CI. |
| 包与 API 预览 | 发布工具链并不等于发布其生成的 Rust/npm 包,也不会自动开放私有 API。Project v8-v11 支持决定、公共泛型所有权、更广的平台支持及原生/Wasm Agent 阶段执行仍是独立事项。 |
Semaprax 对编码智能体更便宜吗?
尚未确立普遍成本优势。紧凑投影工具使用缓存的 cl100k_base 与 o200k_base 分词器测量经重放验证的图/上下文字节及 token。这是分词器计数,不是服务商账单或每项已接受任务的成本。最初的小型 v1 语料仍提供反证:其结构化上下文大于源码。
五条证据路线,各有边界
脚本生成文本、二进制及 model-text 投影,与普通图输出进行重放核对,并记录字节、哈希和离线 token 数。脚本存在不代表已测得某个节省比例。
9 月 6 日提交的基线在单一 darwin-arm64 宿主上使用 debug v0.3.5 二进制,记录 22 项成功场景,每项五次采样。p50/p95 是仅供参考的历史本地证据,不是 v0.5.0 发布性能。
清单列出九种语言;Semaprax、Rust、TypeScript 已有可运行适配器,其余六种是受阻而非失败。任务、隐藏判定器与来源记录支持通过/失败比较,但没有提交耗时测量,也不能据此排名。
v0.5.0 增加平衡顺序调度、两条对照路线的隔离 MCP 工具、候选源码留存和确切传输归档。已记录试验仍须区别于合格且经过审阅的观测。两次调用的离线修复演示不是在线服务商生产力基准。
现有证据尚未确立什么
- 普遍减少服务商计费 token 或每项已接受任务成本。
- 相对 Rust、TypeScript 或其他语言具备更好正确性、延迟或维护生产力。
- 用历史 debug v0.3.5 测量推断 v0.5.0 发布性能。
- 从小型语料、测试框架或已记录试验推出大规模仓库或多模型结果。
提出成本声明前所需证据
- 冻结等价维护任务与仓库快照。
- 使用同一模型、工具框架、权限和停止规则。
- 测量计费 Token、耗时、接受率和回归失败。
- 公布原始轨迹、排除项、失败运行和置信区间。
- 跨仓库规模和多个模型家族重复实验。
本页依据固定提交和 v0.5.0 发布记录审阅。版本化规范定义准入范围与权限;矩阵和路线图中保留的 v0.4 发布标题属于历史记录,不代表最新版本。 GitHub 仓库.
本页一手来源
本页依据固定提交和 v0.5.0 发布记录审阅。版本化规范定义准入范围与权限;矩阵和路线图中保留的 v0.4 发布标题属于历史记录,不代表最新版本。
不夸大的问答
Semaprax 比 Rust 或 C 使用更少 Token 吗?
尚未建立普遍比较。紧凑脚本可使用指定离线分词器计数 token;跨语言框架执行 Semaprax、Rust 和 TypeScript 任务,但未提交耗时结果。两者都不证明服务商计费 token 节省或更低已接受任务成本。
为什么发布没有节省结果的基准?
为了明确测量边界和反证。历史本地耗时、重放验证 token 计数、框架正确性及模型试验记录应保持区分,直到可比较且经过审阅的观测支持更具体的结论。