Yifan Yang, Ziyang Gong +13 more
Details ▸Details ▴
best-or-tied evaluated cells:52/52 cells· six benchmarks across seven target models and three harnessesaverage accuracy gain:+23.5 percentage points· GPT-5.5 direct chat across six benchmarksaverage accuracy gain:+24.8 percentage points· GPT-5.5 Codex harness across five benchmarksaverage accuracy gain:+19.1 percentage points· GPT-5.5 Claude Code harness across five benchmarksoracle-baseline gap:+5.4 percentage points· GPT-5.5 direct chat across six benchmarksaccepted edits:1-4 edits· GPT-5.5 case studies across six benchmarks
best-or-tied evaluated cells:52/52 cells· six benchmarks across seven target models and three harnessesaverage accuracy gain:+23.5 percentage points· GPT-5.5 direct chat across six benchmarksaverage accuracy gain:+24.8 percentage points· GPT-5.5 Codex harness across five benchmarksaverage accuracy gain:+19.1 percentage points· GPT-5.5 Claude Code harness across five benchmarksoracle-baseline gap:+5.4 percentage points· GPT-5.5 direct chat across six benchmarksaccepted edits:1-4 edits· GPT-5.5 case studies across six benchmarks