Training a 4B parameter model on 1,000 expert-crafted instruction-following examples improved its performance from 57.9% to 73.4% on held-out tasks. Gains transferred to external benchmarks, including +8.4pp on Meta’s AdvancedIF and +10.1pp on MultiChallenge, showing that high-quality reward signals generalize beyond their training distribution.