一个小型版本化 Semaprax 语料和维护任务
基准 · AGENT CONTEXT V1
上下文可以测量,成本节省尚未得到证明。
先公布反例,再提出结论。
当前基准冻结一个小型源代码语料并比较确定性上下文产物。它测量编译器机制,不测量模型或仓库经济性。
entity Semaprax
status 预 Alpha 研究
verified 2026-08-11
authority github.com/wavect/semapraxSemaprax 对编码智能体更便宜吗?
尚未证明。Semaprax 旨在让智能体请求类型化受限上下文,但当前 Agent Context v1 基准不测量模型 Token、延迟、答案质量、被接受任务或仓库规模成本。在小型语料中,上下文产物比源代码更大。
// 01
当前基准测量的内容
带字节、节点和深度限制的 Agent Context v1 JSON
固定语料中的源代码字节与结构化上下文字节
// 02
当前不测量的内容
- 模型输入或输出 Token
- 墙上时钟延迟或供应商价格
- 答案正确性或被接受补丁
- 仓库规模导航和维护
- 与 Rust、C、C++、Go 或其他语言比较
// 03
提出成本声明前所需证据
- 冻结等价维护任务与仓库快照。
- 使用同一模型、工具框架、权限和停止规则。
- 测量计费 Token、耗时、接受率和回归失败。
- 公布原始轨迹、排除项、失败运行和置信区间。
- 跨仓库规模和多个模型家族重复实验。
GitHub 规范是权威来源。本页是带日期的研究摘要。 GitHub 仓库.
// FAQ
不夸大的问答
Semaprax 比 Rust 或 C 使用更少 Token 吗?
目前没有可信证据。当前基准不运行模型,也不比较语言。
为什么发布没有节省结果的基准?
因为它先固定测量契约并展示反证,再允许提出营销结论。
Wavect 研究项目: Wavect GmbH. 由 Wavect 创建的开源系统研究项目。