OpenAI 联合多家机构发布 AI 恶意使用预测论文
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 与多家机构联合预测 AI 被恶意利用的路径,并给出预防与缓解思路。
OpenAI 与 Future of Humanity Institute、Centre for the Study of Existential Risk、Center for a New American Security。
推荐理由:OpenAI 与多家机构联合预测 AI 被恶意利用的路径,并给出预防与缓解思路。
OpenAI 开源了 RL-Teacher,一种通过偶发人类反馈而非手工设计奖励函数来训练 AI 的接口实现。该技术旨在推进安全 AI 系统,也适用于奖励难以明确指定的强化学习问题。
OpenAI 造出可从不同尺度和视角稳定欺骗神经网络分类器的对抗图像,直接挑战上周"自动驾驶汽车因多尺度、多角度采集图像而难以被恶意欺骗"的说法。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类判断两种候选行为哪个更好,来推断人类想要什么。OpenAI 表示,构建安全 AI 系统的一步是免去人类编写目标函数的需要,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队合作提出用人类偏好比较替代手写目标函数,可了解早期对齐研究的一条思路。
对抗样本是攻击者刻意设计、能让机器学习模型出错的输入,相当于机器的视觉错觉。OpenAI 展示了对抗样本如何跨不同媒介生效,并讨论了防御这类攻击为何困难。
OpenAI 发文探讨强化学习算法中一种反直觉的失效模式:奖励函数设定错误。当奖励函数被错误指定时,算法会以出人意料的方式崩溃。
OpenAI 与 Berkeley、Stanford 研究人员共同合著了由 Google Brain 主导的论文《Concrete Problems in AI Safety》,探讨如何确保现代机器学习系统按预期运行。论文聚焦于围绕这一目标的诸多研究问题。
OpenAI 阐述其使命是构建安全的 AI,并确保 AI 带来的益处尽可能广泛且均衡地分配。该目标强调安全与普惠并重,是其技术工作的总体方向。