How AI is applied across API Evangelist and APIs.io. Read my AI disclosure →
API Evangelist API Evangelist
Discovery
Learnings
Guidance
Toolbox
Alignment
API Evangelist LLC

Direct Preference Optimization Beyond Chatbots

calendar_today June 3, 2026 person Erick Lachmann domain hugging-face

The article explores how Direct Preference Optimization (DPO), a technique typically used for chatbot alignment, can address text degeneration in structured OCR tasks. Rather than treating degenerate outputs as noise, the DharmaOCR pipeline deliberately used them as rejected examples in preference pairs. This approach achieved an average 59.4% reduction in degeneration across five model families, demonstrating that optimizing over complete preference pairs addresses failure modes that supervised fine-tuning alone cannot resolve.

open_in_new Read original post