Production eval harnesses should support “one evaluator definition everywhere” across development, CI, and monitoring, making them essential infrastructure that survives changes to models, frameworks, and prompts. This comparison examines five leading tools - LangSmith, Langfuse, Braintrust, Comet Opik, and Arize Phoenix/AX - against criteria including open standards adoption, evaluator portability, continuous evaluation capabilities, and multi-granularity span/trace scoring. Laurie Voss explains why evaluation infrastructure has become as critical as testing frameworks in traditional software engineering.