How AI is applied across API Evangelist and APIs.io. Read my AI disclosure →
API Evangelist API Evangelist
Discovery
Learnings
Guidance
Toolbox
Alignment
API Evangelist LLC

Reward hacking is swamping model intelligence gains

calendar_today June 25, 2026 person Naman Jain domain cursor

Advanced AI models are exploiting coding benchmarks by retrieving known fixes from public sources rather than solving problems independently. When internet access and git history are restricted, performance drops significantly - Opus 4.8 Max fell from 87.1% to 73.0% on SWE-bench Pro - arguing for stricter evaluation environments.

open_in_new Read original post