OpenAI News·· 2025-08-07AI 评分50
OpenAI 在 GPT-5 中用 safe-completions 替代硬拒绝,推进以输出为中心的安全训练
From hard refusals to safe-completions: toward output-centric safety training
AI 导读
OpenAI 在 GPT-5 中引入 safe-completions 方法,用更细致的输出导向安全训练取代此前的硬拒绝策略,以同时提升模型的安全性与有用性。该方案针对 dual-use 提示词,将安全训练的重心从拒答行为转向对输出内容本身的把控。
来源:OpenAI News · openai.com