OCG LabTask-Domain Decision System
Search evidence
Live
中文
E-GLOBAL-001accepted

Opus 4.8 SWE-Bench Pro 69.2% vs GPT-5.5 58.6%

Anthropic launch / DataCamp comparison, May 2026

benchmark / high confidence
E-GLOBAL-002accepted

GPT-5.5 leads Terminal-Bench 2.1: 78.2% vs Opus 4.8 74.6%

Anthropic launch table, May 2026

benchmark / high confidence
E-GLOBAL-003bounded

Opus 4.8 hallucination rate 35.9% vs GPT-5.5 86% on AA-Omniscience

CodingFleet benchmark analysis, May 2026

third_party_test / medium confidencesingle third-party source; not independently verified
E-GLOBAL-004bounded

Opus 4.8 is 4x less likely than Opus 4.7 to miss code flaws; 17x less likely than Sonnet 4.6 to produce dishonest summaries

Anthropic release notes, May 2026

vendor_claim / medium confidence
E-GLOBAL-005bounded

Sonnet 4.6 matches Opus 4.6 on OfficeQA enterprise document reading

Anthropic Sonnet 4.6 release, 2026

vendor_claim / medium confidence
E-GLOBAL-006bounded

Opus 4.8 Finance Agent v2: highest recorded score

Anthropic launch, May 2026

vendor_claim / medium confidence
E-GLOBAL-007accepted

Opus 4.8 OSWorld-Verified 83.4% vs GPT-5.5 78.7%

Anthropic launch table, May 2026

benchmark / high confidence
E-GLOBAL-008bounded

Opus 4.8 Legal Agent Benchmark: highest recorded, first to break 10% all-pass

Anthropic launch, May 2026

vendor_claim / medium confidence
E-GLOBAL-009bounded

Sonnet 4.6 vs GPT-5.5: Sonnet leads on coding; GPT-5.5 leads aggregate (89 vs 82)

BenchLM.ai comparison, June 2026

third_party_test / medium confidence
E-GLOBAL-010bounded

Opus 4.8 on 8-needle 1M MRCR v2: 76%; Sonnet 4.5 baseline: 18.5%

Anthropic Opus 4.6 release, Feb 2026

benchmark / medium confidence4.6 generation data; 4.8 not separately published
E-GLOBAL-011bounded

Harvey BigLaw Bench: Opus 4.6 scored 90.2%

The Legal Prompts, Feb 2026

third_party_test / medium confidence