使用已缓存的 tiktoken 0.12.0,大型银行和 HTTP 图的 cl100k_base token 数分别从 37,846 降至 32,486、从 161,861 降至 134,165。HTTP 任务视图从 5,602 降至 5,010。测量计算完整模型文本封装,并针对同一份选定 JSON 进行重放。
上下文可以测量,成本节省尚未得到证明。
先公布反例,再提出结论。
Semaprax 现已发布紧凑投影的实测 token 数、任务级提供方回执、付费开发工具评测,以及真实 Rust 应用和热重载测量。有些视图缩小,小视图则可能增大。已记录的成本试验未达到更改默认配置的要求,小型热重载测试用例也比重启更慢。
entity Semaprax
status Beta 测试版
snapshot 615e501
authority github.com/wavect/semaprax审计快照中的仓库状态
| 仓库快照 | 615e501 · 2026-10-06. v0.8.0 标签指向固定的源码提交。该标签的确切 CI 已成功完成,但不构成全面的生产可用性或安全保证。 |
|---|---|
| 完整产品状态 | 55 部分 · 0 已实现 · 0 缺失 |
| 语义图与项目契约 | 规范源码、稳定 ID 和经过检查的编译器表示,将定律、语义查询、修改与执行连接起来。按功能选择的图模式和 Project 模式,各自保留独立的准入、兼容性和宿主权限契约。 |
| 已发布的 Beta 版本 | v0.8.0 · 发布于 2026 年 10 月 6 日 07:37 UTC。确切标签的 82 个作业全部成功。已发布三个工具链包、SHA256SUMS、各包的构建证明和签名汇总来源证明。发布作业在发布前独立验证了签名文件集。工具链包未经过公证,也不声称构建可复现;离线验证不能确认当前的撤销状态。 确切标签 CI. |
| 包与 API 预览 | 此版本包含可用的语言、定律、开发工具和宿主集成配置。生成的 Rust/npm 包、公共泛型 ABI 及更广泛的平台支持,仍须分别决定其发布与支持范围。 |
Semaprax 对编码智能体更便宜吗?
尚未证明普遍的成本优势。确切的本地 cl100k_base 测量显示,两个大图和一个 HTTP 任务上下文的模型文本载荷更小,但小型上下文反而增大。另一项付费开发工具试验测量了每个已接受任务的成本;最佳节省约为 1%,低于预先声明的 10% 门槛。提供方用量、本地 token 数、执行速度与任务正确性仍是不同的测量。
同一组选定事实,两种计数方式
下表列出已提交的本地 model-text v2 报告中的五行结果。计数使用 cl100k_base,覆盖包括元数据在内的完整载荷。这是本地分词器计数,不是提供方账单;模型文本数字更高表示退步。
| 选定视图 | JSON token 数 | 模型文本 token 数 |
|---|---|---|
| 银行账本:完整图 | 37846 | 32486 |
| ledger.apply:任务上下文 | 1679 | 1802 |
| HTTP 应用:完整图 | 161861 | 134165 |
| HTTP app.main:任务上下文 | 5602 | 5010 |
| 计算器 Project:图 | 2500 | 2615 |
六类实测或重放证据
账本任务上下文从 1,679 增至 1,802 token;计算器 Project 图从 2,500 增至 2,615。固定元数据可能抵消压缩收益。比较源码与上下文,和比较同一组选定事实的不同编码,回答的是不同问题。
Token 报告按兼容的分词器指纹、方法和测量边界分组。开发工具回执保留提供方实际用量、失败或截断的尝试,并区分估算成本与报告成本。缺失计数保持不可用状态;回执本身不构成比较结论。
10 月 5 日的试验通过计量适配层使用 Claude Haiku 4.5,记录了 711 次调用和 3.10 美元支出。每个试验组均接受了 120 个任务中的 109 个。每个已接受任务的最佳成本节省约为 1%,低于所需的 10%;没有试验组通过资格要求,默认配置保持不变。应用任务路径并未执行完整的 Semaprax 源码工作流。
保存的 Regex/Url、Serde/迭代器和 reqwest/Tokio 应用,具备在干净环境、锁定依赖、离线条件下运行的 macOS arm64 与 Linux x86-64 客体回执,每份均有 22 个通过的阶段或测量。结果附带复制与分配记录。M1/M3 吞吐量退步仍待调查,不能据此声称接近零开销。
在已记录的 macOS arm64 测试用例中,冷启动 A 到 B 重载的中位数为 545.694 ms,完整重启则为 37.904 ms。11 个样本,以及准入、准备、等待和激活的独立测量,完整保留了这一不利结果。它展示的是经过检查的连续运行能力,并非速度提升,也不代表其他操作系统的结果。
这些结果尚不能证明什么
- 跨项目、跨模型的提供方计费 token 或每个已接受任务成本的普遍优势。
- 相较 Rust、TypeScript 或其他语言,更好的正确性、延迟或维护生产率。
- 普遍无开销的 Rust 互操作性,或由模拟客体结果推断出的物理 Linux x86-64 性能。
- 热重载速度优势、原生/Wasm 进程切换能力,或广泛的平台性能结论。
- 由历史调试构建耗时推断的当前发布性能,或由上下文压缩率推断的正确性。
提出成本声明前所需证据
- 实验前固定等价任务、源码修订、适配器和验收评分器。
- 保持模型身份、权限、token 与金额上限、重试和停止规则可比较。
- 记录完整提供方回执、耗时、已接受任务比例和回归失败,包括未成功的尝试。
- 公开原始测量、缺失证据、排除项与不确定性。将本地分词器计数与计费用量分开。
- 达到声明的质量与成本门槛后,才能更改默认配置;并在更多项目、模型和宿主上重复验证。
本页依据 v0.8.0 标签及其固定源码提交审阅。版本化规范定义准入范围与权限;矩阵和路线图中的旧发布标题属于历史记录。 GitHub 仓库.
阅读 Semaprax 手册
在线手册是从 main 发布的英文指南,可能包含 0.8.0 之后的变更。复现本次发布时,请使用固定提交的手册快照。
本页一手来源
本页依据 v0.8.0 标签及其固定源码提交审阅。版本化规范定义准入范围与权限;矩阵和路线图中的旧发布标题属于历史记录。
常见问题与实用解答
Semaprax 比 Rust 或 C 使用更少 Token 吗?
尚无普遍的语言间比较结论。紧凑上下文表比较的是同一组选定 Semaprax 事实的两种编码,结果同时包含缩减与退步。另一项付费开发工具试验测量了每个已接受任务的成本,但最佳节省约 1%,未达到 10% 的资格门槛。
为什么发布没有节省结果的基准?
它帮助用户判断优化何时有效、何时无效。小型紧凑视图可能增大,已记录的热重载测试用例比重启更慢,部分 Rust 应用路径也存在吞吐量退步。将这些结果与正向证据一起保留,使默认配置与支持决策能够接受审阅。