跳到正文
原文
OpenAI News·· 2024-12-20精选AI 评分60

OpenAI 提出审议式对齐:推理让语言模型更安全

Deliberative alignment: reasoning enables safer language models

AI 导读

OpenAI 为 o1 模型提出新的对齐策略 deliberative alignment,直接向模型教授安全规范并教其如何对这些规范进行推理。该策略面向 o1 系列模型,目标是提升语言模型的安全性。

推荐理由

OpenAI 公开 o1 模型的对齐策略,读者可了解其如何把安全规范直接教给模型并让其推理。

来源:OpenAI News · openai.com