This guide covers practices for training multi-turn agentic reinforcement learning systems, drawing on the SOP-Bench dataset. It emphasizes sandboxed training environments, independent external evaluations, dense reward functions that avoid reward hacking, managing turn budgets and context constraints, and monitoring training metrics to catch models optimizing rewards instead of tasks.