基准 · AGENT CONTEXT V1

上下文可以测量,成本节省尚未得到证明。

先公布反例,再提出结论。

当前基准冻结一个小型源代码语料并比较确定性上下文产物。它测量编译器机制,不测量模型或仓库经济性。

semaprax://benchmarksv0.2
entity     Semaprax
status     预 Alpha 研究
verified   2026-08-11
authority  github.com/wavect/semaprax

Semaprax 对编码智能体更便宜吗?

尚未证明。Semaprax 旨在让智能体请求类型化受限上下文,但当前 Agent Context v1 基准不测量模型 Token、延迟、答案质量、被接受任务或仓库规模成本。在小型语料中,上下文产物比源代码更大。

// 01

当前基准测量的内容

冻结输入

一个小型版本化 Semaprax 语料和维护任务

确定性输出

带字节、节点和深度限制的 Agent Context v1 JSON

比较边界

固定语料中的源代码字节与结构化上下文字节

// 02

当前不测量的内容

  • 模型输入或输出 Token
  • 墙上时钟延迟或供应商价格
  • 答案正确性或被接受补丁
  • 仓库规模导航和维护
  • 与 Rust、C、C++、Go 或其他语言比较
// 03

提出成本声明前所需证据

  1. 冻结等价维护任务与仓库快照。
  2. 使用同一模型、工具框架、权限和停止规则。
  3. 测量计费 Token、耗时、接受率和回归失败。
  4. 公布原始轨迹、排除项、失败运行和置信区间。
  5. 跨仓库规模和多个模型家族重复实验。

GitHub 规范是权威来源。本页是带日期的研究摘要。 GitHub 仓库.

// FAQ

不夸大的问答

Semaprax 比 Rust 或 C 使用更少 Token 吗?

目前没有可信证据。当前基准不运行模型,也不比较语言。

为什么发布没有节省结果的基准?

因为它先固定测量契约并展示反证,再允许提出营销结论。

Wavect 研究项目: Wavect GmbH. 由 Wavect 创建的开源系统研究项目。