这项试验测量什么

这项试验想回答一个问题:当每个环境请求相同的模型和推理强度时,执行框架 会在多大程度上影响专业任务的输出质量?比较对象是三个完整配置的系统: Rudder、Codex CLI 和 Claude Code。 每个系统都请求 gpt-5.6-sol 和高推理强度。各系统原有的编排方式、会话和 工具边界仍属于试验条件,因此这不是三个相同无状态封装之间的比较。 基于 GDPval 的执行框架基准测试:三组均请求 gpt-5.6-sol;Rudder 为 81.7,Codex CLI 为 75.7,Claude Code 为 75.6。

结果概览

在这组冻结样本中,按本地等任务权重指标计算,Rudder 领先 Codex CLI 6.0 个 百分点,领先 Claude Code 6.1 个百分点。三个执行框架与标准答案对比的粗粒度 结果完全相同。分差来自评分准则覆盖程度和对扣分项的规避,不是因为其中一组 取得了更多两两比较胜利。 这些结果不是官方 GDPval 分数或排行榜结果。有证据支持的结论更窄:在 我们的本地等任务权重评分准则指标下,完整配置的 Rudder 系统在这组冻结的 10 项任务中领先。 这个排名只能作为各完整配置系统之间的方向性证据,不能 用来推断 Rudder、记忆功能或任何单独执行框架组件带来的因果效果。

冻结的比较范围

试验从 GDPval 的 220 项任务中随机抽取 10 项,并在执行前冻结样本。这组任务 覆盖 10 个职业,需要提交 11 份 XLSX、DOCX、PPTX 或 PDF 产物。每项任务总共 执行三遍:Rudder、Codex CLI 和 Claude Code 各执行一遍。因此共有 30 次评分 执行,每个“执行框架 × 任务”组合对应一次执行。 任务包来自 openai/gdpval 数据集,固定版本为 11e7900cdcac61bc4daf59e65feb238acda98fbf。候选系统可以查看任务要求和源 文件,评分准则与标准答案则始终保存在独立的评分工作区。

三组执行条件

因此,这是一项完整配置系统的比较,不是记忆功能的消融试验。Rudder 的组织 上下文、工具、指令和托管记忆共同构成正常执行条件,不能把分差单独归因于 其中一项。

模型身份的验证证据

三组都请求了 gpt-5.6-sol 和高推理强度,但各执行框架能够提供的实际模型 身份验证证据并不相同。

评分方法

每个有效候选结果都由看不到执行框架标签的本地大语言模型评分器独立评分。 评分器检查源文件、候选产物、标准答案和各项评分准则,再记录逐项证据以及候选 结果与标准答案的对比结论。 所有结果都使用相同的评分器配置:gpt-5.6-sol 与高推理强度。 主要指标让每项任务的权重相同,不受 GDPval 原始评分准则分值范围不同的影响:
扣分项可以降低单项任务得分。求平均前,每项任务都被限制在 0 到 100 之间, 避免某项扣分特别重的任务主导整组结果。 指标的完整名称是 Local case-equal macro-normalized rubric score · 0-100, 即“本地等任务权重宏观归一化评分准则得分”。它不是完成率,产物有效性会单独 报告。

各任务结果

下表显示“获得的原始评分准则分数 / 正向最高分”。负数表示扣分项超过正向 得分;计算宏观得分时,该项任务会按零分计。

证据边界

比较市场分析任务含有异常大的扣分项,放大了汇总差距。排除该项任务后, Rudder 仍领先约 4.4 至 4.6 个百分点。 引用结果时必须同时保留以下边界:
  • 每项任务总共执行三遍,三个执行框架各执行一遍。由于每个“执行框架 × 任务” 组合仍只有一次执行,因此无法估计同一执行框架内不同运行之间的方差。
  • 10 项任务从全部 220 项任务中随机抽样,但样本量仍然较小,未必能代表完整 数据集。
  • 评分准则分数来自本地大语言模型评分器,而不是 GDPval 的盲测专家人工评审 流程。
  • 三个执行框架相对标准答案都是 9 胜 / 0 平 / 1 负。这是理解分数差距时不可 忽略的反证。
  • 本次运行历史跨越设置和恢复事件,最终从保留的执行与评分记录中恢复并审计。
  • Rudder 的记忆功能确实启用,但连续性并不完整,也没有进行记忆功能开关消融 试验。不能把分差归因于记忆功能。
  • Codex CLI 的模型身份只验证到请求层。

更强的后续试验

后续试验应覆盖 30 至 50 项任务,每个执行框架对每项任务至少重复三次,引入 专家人工盲评和其他评分器,并采用平衡任务顺序,对比 Rudder 记忆功能开启与 关闭两种条件。这样的设计可以测量结果稳定性,并开始区分执行框架、记忆、 顺序和评分器各自的影响。