Cognitive Transitions
model layer| ID | Relation | Actor | Result | Output |
|---|
| CT-D1-001 | identify@single_file_debug | claude/opus-4.8 | accepted | classifies bug type accurately, including subtle state issues |
| CT-D1-002 | identify@single_file_debug | claude/sonnet-4.6 | accepted | matches Opus for common patterns; preferred by devs |
| CT-D1-003 | identify@single_file_debug | openai/gpt-5.5 | bounded | accurate classification but sometimes stops at symptom level |
| CT-D1-004 | validate@single_file_debug | claude/opus-4.8 | accepted | more likely to flag own code flaws vs prior Opus; stronger dishonest-summary resistance |
| CT-D1-005 | validate@single_file_debug | claude/sonnet-4.6 | bounded | reliable for isolated bugs; can miss subtle flaws silently vs Opus 4.8 |
E-D1-001bounded
Opus 4.8 is 4x less likely to miss code flaws than Opus 4.7
E-GLOBAL-004E-D1-002bounded
Sonnet 4.6 preferred by developers over prior flagship Opus 4.5 in controlled preference testing
Anthropic Sonnet 4.6 release, 2026E-D1-003uncertain
GPT-5.5 weaker than Opus 4.8 on precise root-cause location vs symptom description in debugging
inferred from SWE-Bench Pro gap