OpenAI 发布 DALL·E 3 系统卡
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与对齐方面的评估情况。原文正文未能抓取,具体评估内容暂不可见。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与对齐方面的评估情况。原文正文未能抓取,具体评估内容暂不可见。
Hugging Face 发布 Ethics and Society Newsletter #5,回顾 2023 夏季在 AI 伦理与政策方面的工作。CEO Clem 向美国国会作证并在参议院 AI Insight Forum 发言,公司还就 E.U. AI Act、NTIA AI Accountability 提交意见。
OpenAI 宣布公开招募 Red Teaming Network 成员,邀请各领域专家参与,以提升其模型的安全性。
OpenAI 将 GPT-4 用于内容政策制定与内容审核决策,可实现更一致的标注、更快的政策优化反馈循环,并减少人工审核员的参与。
Zama 展示了如何借助 Hugging Face transformers 库,用全同态加密(FHE)在加密数据上运行 GPT2 的部分推理,从而同时保护用户数据隐私与模型 IP。实现中将 GPT2 首个多头注意力头改写为 FHE 兼容算子,权重与激活量化为整数,4-bit 量化可保留原模型 96% 的准确率。完整代码已在该用例示例中开源。
OpenAI 宣布参与组建一个新的行业机构 Frontier Model Forum,以推动前沿 AI 系统的安全与负责任开发。该机构的目标包括推进 AI 安全研究、识别最佳实践与标准,并促进政策制定者与产业界之间的信息共享。
OpenAI 与其他领先 AI 实验室通过自愿承诺,共同强化 AI 的安全性、安保与可信度。此举旨在推动 AI 治理向前迈进。
Hugging Face 发布 Ethics and Society Newsletter 第4期,聚焦文本到图像模型的偏见问题。文章梳理了训练数据、预训练数据过滤、推理、模型潜在空间及事后过滤等偏见来源,并指出 Stable Diffusion 和 Dall-E 2 等模型存在多样性不足与刻板印象。文中还介绍了 Stable Bias 项目用于探索和比较偏见的工具。
OpenAI 启动网络安全资助计划,通过资助及其他支持方式,推动面向防御方的 AI 网络安全能力建设。
OpenAI 旗下非营利组织 OpenAI, Inc. 启动一项资助计划,将发放十笔 10 万美元的资助金,用于资助在法律允许范围内建立民主流程、决定 AI 系统应遵循何种规则的实验。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题,即未来能力远超 AGI 的 AI 系统。文章未给出具体治理方案或时间表,仅强调当下是着手讨论这一议题的合适时机。
OpenAI 宣布推出漏洞赏金计划,邀请外界帮助发现其技术与服务中的安全漏洞。该计划是 OpenAI 致力于开发安全、先进 AI 的一部分,目标是打造安全、可靠、可信的技术与服务。
OpenAI 阐述了其确保 AI 系统安全构建、部署和使用的方法,称这是其使命的关键。
Hugging Face 发布 Ethics and Society Newsletter #3,阐述其在开放 ML 中兼顾伦理的思路。平台推出 6 类伦理标签(严谨、知情同意、社会意识、可持续、包容、探究),并上线举报功能,供社区标记违规的模型、数据集或 Space。
Hugging Face 为 Diffusers 库发布伦理框架,用于指导维护者处理社区贡献时的技术决策,并承诺随项目演进和社区反馈持续调整。准则涵盖透明、一致、简洁、可及、可复现与责任六项价值,同时列出 Community tab、Tag 功能、偏见探索 Space、Safe Stable Diffusion、Hub 分阶段发布及 OpenRAILs 许可等安全机制。
OpenAI 发布《Planning for AGI and beyond》,阐述其使命是确保通用人工智能(即比人类更聪明的 AI 系统)造福全人类。该文为 OpenAI 官方对 AGI 长期规划的表态,目前仅提供摘要。
红队测试通过构造自然语言提示词诱导 LLM 生成有害内容,从而暴露模型漏洞,与人类难以理解的对抗攻击不同。GPT3 早期版本曾表现出性别歧视与针对穆斯林的偏见,微软 Tay 和 Bing 的 Sydney 是缺乏红队评估导致灾难性后果的真实案例。红队可由人工或另一个 LM 执行,角色扮演攻击和用代码作答能绕过经 RLHF 或 SFT 对齐的模型,该领域仍处早期,需要多机构协作共享数据集与最佳实践。
OpenAI 正在澄清 ChatGPT 的行为是如何被塑造的,并公布改进计划:让用户拥有更多自定义空间,同时让公众更多地参与相关决策。
OpenAI 研究人员与乔治城大学安全与新兴技术中心、斯坦福互联网观测台合作,调查大语言模型可能被用于虚假信息活动的风险。该合作基于一年多的研究,包括 2021 年 10 月汇集 30 位虚假信息研究者、机器学习专家与政策分析师的研讨会,最终形成联合报告,梳理语言模型对信息环境的威胁并提出潜在缓解措施的分析框架。
Hugging Face 发布 Ethics and Society Newsletter 第二期,讨论机器学习中的偏见问题。文章指出偏见是复杂的社会技术问题,单一技术手段难以有效解决,并介绍了团队在数据集与模型等 ML 开发各环节开发的偏见分析工具。
Hugging Face 为 🤗 Evaluate 库新增偏见评估指标,可对 GPT-2、BLOOM 等因果语言模型生成的文本进行 Toxicity、Polarity 和 Hurtfulness 三类提示词任务评测。
Hugging Face 发布首期《伦理与社会》通讯,计划在每年春分、秋分、夏至、冬至各出一期,由公司内部跨部门开放小组“Ethics and Society regulars”编写。
RAIL Initiative 推出 OpenRAIL 系列 AI 专用许可证,在允许免版税访问、下游使用与再分发的同时,嵌入针对特定关键场景的使用限制条款。该框架由 Hugging Face 支持,灵感来自 BigScience、开源与 Creative Commons,旨在让许可方在开放模型时保留对有害用途的约束与执行能力。
OpenAI 正在提升 AI 系统从人类反馈中学习、并协助人类评估 AI 的能力,目标是构建一个足够对齐的 AI 系统,再由它帮助解决其余所有对齐问题。
OpenAI 发布新版内容审核工具 Moderation 端点,改进此前的内容过滤器,即日起免费向 OpenAI API 开发者开放。
OpenAI 为 DALL·E 2 部署了一项新技术,使其生成的人物图像能更准确地反映世界人口的多样性,以减少偏见并提升安全性。
为向更广泛受众开放 DALL·E 2,OpenAI 在预训练阶段采取缓解措施,以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护栏,防止生成图像违反其内容政策。
Hugging Face 多模态学习团队发布了一份伦理章程,将伦理原则正式纳入其机器学习研究生命周期。章程列出了要防止的用例,包括生成虚假信息、生成个人身份信息,以及在医疗、法律、金融、移民等高风险领域的不谨慎使用。团队同时提出透明、开放可复现、公平、自我批判和尊重署名五项价值观,并承认这些价值观之间可能存在冲突,需逐案权衡。
Hugging Face 研究科学家 Sasha Luccioni 在访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围不止于统计 CO2 排放,还涵盖制造成本乃至一封邮件产生多少 CO2 等维度。
OpenAI 探讨了 Goodhart 定律在 AI 目标优化中的体现:当一个度量指标变成目标时,它就不再是好的度量。OpenAI 指出,在优化难以衡量或衡量成本高昂的目标时,必须应对这一问题。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 制定伦理 AI 研究协议与包容性招聘体系。她因在微软 Seeing AI 项目中目睹图像数据偏差而转向伦理 AI,指出 ML 团队普遍缺乏相关概念与词汇,且行业"Alpha"文化使女性主导的伦理研究被轻视。
OpenAI 分享了在已部署模型的安全与滥用问题上的最新思考,希望帮助其他 AI 开发者应对同类问题。
OpenAI 训练出比 GPT-3 更能遵循用户意图的语言模型 InstructGPT,同时更真实、毒性更低,采用对齐研究中的人类反馈方法。这些模型现已作为 OpenAI API 的默认语言模型部署。
推荐理由:OpenAI 官方说明 InstructGPT 通过人类反馈训练,在遵循用户意图、真实性和毒性控制上优于 GPT-3,并已成为 API 默认模型。
OpenAI 研究发现,通过在小型精选数据集上微调,可以改善语言模型在特定行为价值观方面的表现。
OpenAI 参与撰写了一份由 30 家机构、58 位合著者完成的多方报告,提出 10 种提升 AI 系统相关声明可验证性的机制。开发者可借此提供 AI 系统安全、可靠、公平或隐私保护的证据,用户、政策制定者与公民社会也可据此评估 AI 开发过程。
OpenAI 发布 Safety Gym,一套用于衡量强化学习智能体在训练中遵守安全约束进展的环境与工具套件。该套件面向在训练过程中兼顾安全约束的强化学习智能体,提供相应的环境和工具来度量其进展。
OpenAI 开发出一种评估神经网络分类器能否抵御训练中未见对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness),用于衡量单一模型面对未预期攻击时的鲁棒性。该方法同时指出,需要在更多样化的未知攻击范围内衡量模型表现。
OpenAI 发布政策研究论文,提出当前可用于提升 AI 安全规范长期行业合作可能性的四项策略:沟通风险与收益、技术协作、提高透明度、激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动问题,使 AI 公司对安全投入不足。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保 AI 对齐算法在真实人类参与的场景下有效。论文认为,将先进 AI 系统与人类价值观对齐,需要解决人类理性、情绪与偏见等心理学层面的诸多不确定性。OpenAI 计划招聘社会科学家全职投入这一方向,以推动机器学习与社会科学的进一步合作。
OpenAI 提出一种名为迭代放大(iterated amplification)的 AI 安全技术,通过把任务分解为更简单的子任务来指定超出人类规模的复杂行为与目标,而非依赖标注数据或奖励函数。该构想仍处早期阶段,目前仅在简单的玩具算法领域完成实验,OpenAI 认为它可能成为可扩展的 AI 安全方案。