How AI is applied across API Evangelist and APIs.io. Read my AI disclosure →
API Evangelist API Evangelist
Discovery
Learnings
Guidance
Toolbox
Alignment
API Evangelist LLC

Grading the Machine: Using LLM as a Judge to Monitor AI Agents in Production

calendar_today June 15, 2026 person domain state-farm

State Farm engineering explores using large language models as evaluators of AI chatbot quality in production, using reference-free metrics to surface issues without pre-written correct answers. The piece covers building custom evaluation criteria, meta-analysis of failure patterns, and validating the judge’s reliability against human reviewers using Claude Sonnet 4.5 and AWS services.

open_in_new Read original post