OpenAI News·2016-12-21 16:00· 2016-12-21AI 评分17OpenAI 探讨强化学习中的错误奖励函数问题Faulty reward functions in the wildAI 导读OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式崩溃。来源:OpenAI News · openai.com#教程/实践#安全/对齐#推理#OpenAI