OCG Lab任务域决策系统
搜索证据
在线
EN
OCG Bench

OCG Bench

以认知转移表达的任务域模型决策。

证据约束任务域路由模型转移图

摘要

C'Sonnet 4.6 足以处理约 300 行以内的孤立 bug。涉及共享状态或多步因果链时升级到 Opus 4.8。

默认claude/sonnet-4.6

避免openai/gpt-5.5

决策卡

bug is isolated, context fits one prompt, cost matters

claude/sonnet-4.6

bug involves subtle state, multiple suspects, correctness is critical

claude/opus-4.8

you need precise root-cause location, not symptom description

openai/gpt-5.5

terminal-heavy debugging workflow

openai/gpt-5.5
claude/opus-4.8

Claude Opus 4.8

高风险推理与不确定性敏感任务

  • SWE-Bench Pro 领先
  • 幻觉暴露更低
  • OSWorld Verified 表现强
当静默失败的代价高于延迟或价格时使用。
claude/sonnet-4.6

Claude Sonnet 4.6

高吞吐默认执行模型

  • 开发者偏好的编码流程
  • 企业文档阅读
  • 成本敏感分流
当任务需要跨源一致性或隐式约束跟踪时升级。
openai/gpt-5.5

GPT-5.5

终端与输入密集流程专家

  • Terminal-Bench 2.1 领先
  • CLI 集成流水线
  • 输入量经济性
避免把它作为未验证提取或强引用任务的唯一事实源。

任务域

内容主文件中的全部 10 个任务域。

D1 已选择
D1

代码工程 / 单文件调试

@code_engineering/single_file_debug

5转移
4决策
3证据

认知转移图

c 通过 r@D 转移到 C';关系标签来自当前任务域。

c我的 Python 函数第二次调用时返回错误结果
已接受identify@single_file_debugclaude/opus-4.8
已接受validate@single_file_debugclaude/opus-4.8
C'Sonnet 4.6 足以处理约 300 行以内的孤立 bug。涉及共享状态或多步因果链时升级到 Opus 4.8。
关系模式:c > r@D > C'identifyvalidate

认知转移

按 r@D 与模型
r@D模型结果C'Evidence
identify@single_file_debugclaude/opus-4.8已接受能准确分类 bug 类型,包括隐蔽状态问题E-GLOBAL-001, E-D1-001
identify@single_file_debugclaude/sonnet-4.6已接受常见模式接近 Opus,且受开发者偏好E-D1-002
identify@single_file_debugopenai/gpt-5.5有边界分类准确,但有时停留在症状层面E-D1-003
validate@single_file_debugclaude/opus-4.8已接受比前代 Opus 更容易标记自身代码缺陷,且更能抵抗不诚实摘要E-GLOBAL-004
validate@single_file_debugclaude/sonnet-4.6有边界孤立 bug 可靠,但相比 Opus 4.8 更可能静默漏掉细微缺陷E-GLOBAL-004

证据账本

来自主文件的全局基准、声明与更新动作。

约 35% 为中等置信声明

基准

  • E-GLOBAL-001: Opus 4.8 SWE-Bench Pro 69.2% vs GPT-5.5 58.6%
  • E-GLOBAL-002: GPT-5.5 leads Terminal-Bench 2.1: 78.2% vs Opus 4.8 74.6%
  • E-GLOBAL-007: Opus 4.8 OSWorld-Verified 83.4% vs GPT-5.5 78.7%

声明

  • E-GLOBAL-003: Opus 4.8 hallucination rate 35.9% vs GPT-5.5 86% on AA-Omniscience
  • E-GLOBAL-004: Opus 4.8 is 4x less likely than Opus 4.7 to miss code flaws; 17x less likely than Sonnet 4.6 to produce dishonest summaries
  • E-GLOBAL-005: Sonnet 4.6 matches Opus 4.6 on OfficeQA enterprise document reading
  • E-GLOBAL-006: Opus 4.8 Finance Agent v2: highest recorded score
  • E-GLOBAL-008: Opus 4.8 Legal Agent 基准: highest recorded, first to break 10% all-pass
  • E-GLOBAL-009: Sonnet 4.6 vs GPT-5.5: Sonnet leads on coding; GPT-5.5 leads aggregate (89 vs 82)

动作

  • 更新触发: 模型版本变化
  • 更新触发: 新基准出现
  • 更新触发: 能力事件

路由总结

Opus 4.8

需要跨状态一致性的多文件代码任务

超出初筛的法律分析

超过 100 页且引用关键的文档提取

Sonnet 4.6

约 300 行以内的单文件调试

高吞吐单次文档摘要

从已标注输入中提取 JSON

GPT-5.5

终端密集型 agent 编码

CLI 集成流水线

成本是首要约束的输入密集批处理

人工门禁

安全代码审查最终批准

有约束力的法律决策

用于报告或审计的财务输出