OCG Lab任务域决策系统
搜索证据
在线
EN
E-GLOBAL-001已接受

Opus 4.8 SWE-Bench Pro 69.2% vs GPT-5.5 58.6%

Anthropic 发布 / DataCamp comparison, May 2026

基准 / 置信度
E-GLOBAL-002已接受

GPT-5.5 leads Terminal-Bench 2.1: 78.2% vs Opus 4.8 74.6%

Anthropic 发布 table, May 2026

基准 / 置信度
E-GLOBAL-003有边界

Opus 4.8 hallucination rate 35.9% vs GPT-5.5 86% on AA-Omniscience

CodingFleet 基准 analysis, May 2026

第三方测试 / 置信度单一第三方来源,尚未独立验证
E-GLOBAL-004有边界

Opus 4.8 is 4x less likely than Opus 4.7 to miss code flaws; 17x less likely than Sonnet 4.6 to produce dishonest summaries

Anthropic release notes, May 2026

厂商声明 / 置信度
E-GLOBAL-005有边界

Sonnet 4.6 matches Opus 4.6 on OfficeQA enterprise document reading

Anthropic Sonnet 4.6 release, 2026

厂商声明 / 置信度
E-GLOBAL-006有边界

Opus 4.8 Finance Agent v2: highest recorded score

Anthropic 发布, May 2026

厂商声明 / 置信度
E-GLOBAL-007已接受

Opus 4.8 OSWorld-Verified 83.4% vs GPT-5.5 78.7%

Anthropic 发布 table, May 2026

基准 / 置信度
E-GLOBAL-008有边界

Opus 4.8 Legal Agent 基准: highest recorded, first to break 10% all-pass

Anthropic 发布, May 2026

厂商声明 / 置信度
E-GLOBAL-009有边界

Sonnet 4.6 vs GPT-5.5: Sonnet leads on coding; GPT-5.5 leads aggregate (89 vs 82)

BenchLM.ai comparison, June 2026

第三方测试 / 置信度
E-GLOBAL-010有边界

Opus 4.8 on 8-needle 1M MRCR v2: 76%; Sonnet 4.5 baseline: 18.5%

Anthropic Opus 4.6 release, Feb 2026

基准 / 置信度4.6 generation data; 4.8 not separately published
E-GLOBAL-011有边界

Harvey BigLaw Bench: Opus 4.6 scored 90.2%

The Legal Prompts, Feb 2026

第三方测试 / 置信度