Hugging Face Blog·· 2026-06-03AI 评分32
超越聊天机器人:用模型自身失败样本做 DPO 抑制 OCR 文本退化
Direct Preference Optimization Beyond Chatbots
AI 导读
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,以正确转录为 chosen、退化循环为 rejected 构建偏好数据,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。
来源:Hugging Face Blog · huggingface.co