OpenAI News·2025-12-03 18:00· 2025-12-03AI 评分42OpenAI 如何用"confessions"让语言模型更诚实How confessions can keep language models honestAI 导读OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或做出不当行为时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。来源:OpenAI News · openai.com#论文/研究#安全/对齐#OpenAI