基准测试 · V0.5.0 源码审阅

上下文可以测量,成本节省尚未得到证明。

先公布反例,再提出结论。

仓库现在包含多种测量系统,不再只有最初 Agent Context v1 的字节比较。解读结果前应核对测量对象、工具链、宿主与证据状态。编译器新版本不会自动更新历史测量。

semaprax://benchmarksv0.5.0
entity     Semaprax
status     预 Alpha 研究
snapshot   b9f593c
authority  github.com/wavect/semaprax
// STATUS

审计快照中的仓库状态

仓库快照b9f593c · 2026-09-16. 审阅时 main 提交与 v0.5.0 标签一致。该标签的 CI 已成功完成;独立分支 CI 被取消。这不构成全面的生产可用性或安全保证。
完整产品状态55 部分 · 0 已实现 · 0 缺失
语义图与项目契约图模式按功能选择并保留旧版契约。Project v1 为基础;所有权数据配置 v8、v9、v10 和 v11 各自具有独立的准入与支持边界。
已发布的预发布版v0.5.0 · 发布于 2026 年 9 月 16 日 09:43 UTC。提供 Linux x86-64、macOS Apple Silicon 和 Windows x86-64 三种压缩包及 SHA256SUMS。包内 semaprax 是完整工具链,并非独立的 Cargo CLI。 确切标签 CI.
包与 API 预览发布工具链并不等于发布其生成的 Rust/npm 包,也不会自动开放私有 API。Project v8-v11 支持决定、公共泛型所有权、更广的平台支持及原生/Wasm Agent 阶段执行仍是独立事项。

Semaprax 对编码智能体更便宜吗?

尚未确立普遍成本优势。紧凑投影工具使用缓存的 cl100k_base 与 o200k_base 分词器测量经重放验证的图/上下文字节及 token。这是分词器计数,不是服务商账单或每项已接受任务的成本。最初的小型 v1 语料仍提供反证:其结构化上下文大于源码。

// 01

五条证据路线,各有边界

最初的上下文基线

冻结的 Agent Context v1 语料比较源码字节与确定性结构化上下文字节,不调用模型,也不比较编程语言。

紧凑图与任务上下文

脚本生成文本、二进制及 model-text 投影,与普通图输出进行重放核对,并记录字节、哈希和离线 token 数。脚本存在不代表已测得某个节省比例。

历史本地性能

9 月 6 日提交的基线在单一 darwin-arm64 宿主上使用 debug v0.3.5 二进制,记录 22 项成功场景,每项五次采样。p50/p95 是仅供参考的历史本地证据,不是 v0.5.0 发布性能。

跨语言实验框架

清单列出九种语言;Semaprax、Rust、TypeScript 已有可运行适配器,其余六种是受阻而非失败。任务、隐藏判定器与来源记录支持通过/失败比较,但没有提交耗时测量,也不能据此排名。

受控模型试验记录

v0.5.0 增加平衡顺序调度、两条对照路线的隔离 MCP 工具、候选源码留存和确切传输归档。已记录试验仍须区别于合格且经过审阅的观测。两次调用的离线修复演示不是在线服务商生产力基准。

// 02

现有证据尚未确立什么

  • 普遍减少服务商计费 token 或每项已接受任务成本。
  • 相对 Rust、TypeScript 或其他语言具备更好正确性、延迟或维护生产力。
  • 用历史 debug v0.3.5 测量推断 v0.5.0 发布性能。
  • 从小型语料、测试框架或已记录试验推出大规模仓库或多模型结果。
// 03

提出成本声明前所需证据

  1. 冻结等价维护任务与仓库快照。
  2. 使用同一模型、工具框架、权限和停止规则。
  3. 测量计费 Token、耗时、接受率和回归失败。
  4. 公布原始轨迹、排除项、失败运行和置信区间。
  5. 跨仓库规模和多个模型家族重复实验。

本页依据固定提交和 v0.5.0 发布记录审阅。版本化规范定义准入范围与权限;矩阵和路线图中保留的 v0.4 发布标题属于历史记录,不代表最新版本。 GitHub 仓库.

// REF

本页一手来源

本页依据固定提交和 v0.5.0 发布记录审阅。版本化规范定义准入范围与权限;矩阵和路线图中保留的 v0.4 发布标题属于历史记录,不代表最新版本。

  1. 最初 Agent Context 证据契约
  2. 紧凑投影与离线 token 测量代码
  3. 历史本地 v0.3.5 性能基线
  4. 跨语言实验框架及明确非主张
  5. v0.5.0 发布与下载包
// FAQ

不夸大的问答

Semaprax 比 Rust 或 C 使用更少 Token 吗?

尚未建立普遍比较。紧凑脚本可使用指定离线分词器计数 token;跨语言框架执行 Semaprax、Rust 和 TypeScript 任务,但未提交耗时结果。两者都不证明服务商计费 token 节省或更低已接受任务成本。

为什么发布没有节省结果的基准?

为了明确测量边界和反证。历史本地耗时、重放验证 token 计数、框架正确性及模型试验记录应保持区分,直到可比较且经过审阅的观测支持更具体的结论。

Wavect 研究项目: Wavect GmbH. 由 Wavect 创建的开源系统研究项目。