bug is isolated, context fits one prompt, cost matters
claude/sonnet-4.6OCG Lab任务域决策系统
OCG Bench
OCG Bench
以认知转移表达的任务域模型决策。
摘要
C'Sonnet 4.6 足以处理约 300 行以内的孤立 bug。涉及共享状态或多步因果链时升级到 Opus 4.8。
默认claude/sonnet-4.6
避免openai/gpt-5.5
决策卡
bug involves subtle state, multiple suspects, correctness is critical
claude/opus-4.8you need precise root-cause location, not symptom description
openai/gpt-5.5terminal-heavy debugging workflow
openai/gpt-5.5claude/opus-4.8
Claude Opus 4.8
高风险推理与不确定性敏感任务
- SWE-Bench Pro 领先
- 幻觉暴露更低
- OSWorld Verified 表现强
当静默失败的代价高于延迟或价格时使用。
claude/sonnet-4.6
Claude Sonnet 4.6
高吞吐默认执行模型
- 开发者偏好的编码流程
- 企业文档阅读
- 成本敏感分流
当任务需要跨源一致性或隐式约束跟踪时升级。
openai/gpt-5.5
GPT-5.5
终端与输入密集流程专家
- Terminal-Bench 2.1 领先
- CLI 集成流水线
- 输入量经济性
避免把它作为未验证提取或强引用任务的唯一事实源。
任务域
内容主文件中的全部 10 个任务域。
D1
代码工程 / 单文件调试
@code_engineering/single_file_debug
5转移
4决策
3证据
认知转移图
c 通过 r@D 转移到 C';关系标签来自当前任务域。
c我的 Python 函数第二次调用时返回错误结果
已接受identify@single_file_debugclaude/opus-4.8
已接受validate@single_file_debugclaude/opus-4.8
C'Sonnet 4.6 足以处理约 300 行以内的孤立 bug。涉及共享状态或多步因果链时升级到 Opus 4.8。
关系模式:
c > r@D > C'identifyvalidate认知转移
按 r@D 与模型| r@D | 模型 | 结果 | C' | Evidence |
|---|---|---|---|---|
identify@single_file_debug | claude/opus-4.8 | 已接受 | 能准确分类 bug 类型,包括隐蔽状态问题 | E-GLOBAL-001, E-D1-001 |
identify@single_file_debug | claude/sonnet-4.6 | 已接受 | 常见模式接近 Opus,且受开发者偏好 | E-D1-002 |
identify@single_file_debug | openai/gpt-5.5 | 有边界 | 分类准确,但有时停留在症状层面 | E-D1-003 |
validate@single_file_debug | claude/opus-4.8 | 已接受 | 比前代 Opus 更容易标记自身代码缺陷,且更能抵抗不诚实摘要 | E-GLOBAL-004 |
validate@single_file_debug | claude/sonnet-4.6 | 有边界 | 孤立 bug 可靠,但相比 Opus 4.8 更可能静默漏掉细微缺陷 | E-GLOBAL-004 |
证据账本
来自主文件的全局基准、声明与更新动作。
基准
- E-GLOBAL-001: Opus 4.8 SWE-Bench Pro 69.2% vs GPT-5.5 58.6%
- E-GLOBAL-002: GPT-5.5 leads Terminal-Bench 2.1: 78.2% vs Opus 4.8 74.6%
- E-GLOBAL-007: Opus 4.8 OSWorld-Verified 83.4% vs GPT-5.5 78.7%
声明
- E-GLOBAL-003: Opus 4.8 hallucination rate 35.9% vs GPT-5.5 86% on AA-Omniscience
- E-GLOBAL-004: Opus 4.8 is 4x less likely than Opus 4.7 to miss code flaws; 17x less likely than Sonnet 4.6 to produce dishonest summaries
- E-GLOBAL-005: Sonnet 4.6 matches Opus 4.6 on OfficeQA enterprise document reading
- E-GLOBAL-006: Opus 4.8 Finance Agent v2: highest recorded score
- E-GLOBAL-008: Opus 4.8 Legal Agent 基准: highest recorded, first to break 10% all-pass
- E-GLOBAL-009: Sonnet 4.6 vs GPT-5.5: Sonnet leads on coding; GPT-5.5 leads aggregate (89 vs 82)
动作
- 更新触发: 模型版本变化
- 更新触发: 新基准出现
- 更新触发: 能力事件
路由总结
Opus 4.8
需要跨状态一致性的多文件代码任务
超出初筛的法律分析
超过 100 页且引用关键的文档提取
Sonnet 4.6
约 300 行以内的单文件调试
高吞吐单次文档摘要
从已标注输入中提取 JSON
GPT-5.5
终端密集型 agent 编码
CLI 集成流水线
成本是首要约束的输入密集批处理
人工门禁
安全代码审查最终批准
有约束力的法律决策
用于报告或审计的财务输出