Hugging Face Blog·· 2024-01-18AI 评分32
用 DPO、IPO 与 KTO 做偏好微调:Hugging Face 的 LLM 对齐方法实证评测
Preference Tuning LLMs with Direct Preference Optimization Methods
AI 导读
Hugging Face 在 7B 模型上实证评测了 DPO、IPO、KTO 三种无需强化学习的 LLM 偏好对齐方法,扫描 β 等关键超参数并用 MT-Bench 评估。
来源:Hugging Face Blog · huggingface.co