OpenAI 安全与安保实践更新
OpenAI 发布安全与安保实践更新。原文未披露具体措施、模型版本或时间表等细节。
OpenAI 发布安全与安保实践更新。原文未披露具体措施、模型版本或时间表等细节。
Hugging Face 宣布与 Truffle Security 合作,将开源密钥扫描工具 TruffleHog 集成进平台。其自动化扫描流水线现包含恶意软件、pickle 文件和密钥三类扫描,每次推送都会用 trufflehog filesystem 命令检查新增或修改文件,发现已验证密钥即邮件通知用户。
Zico Kolter 加入 OpenAI 董事会,其在 AI 安全与对齐领域的专业能力将用于强化公司治理。他还将加入安全与安保委员会。
OpenAI 发布 GPT-4o 系统卡,用于说明该模型在安全与风险方面的评估情况。原文正文未能抓取,具体评估内容与结论暂无法确认。
Hugging Face 梳理了截至 2024 年 8 月 6 日 Hub 上的安全功能:面向所有用户的细粒度 Token、2FA、GPG commit signing、组织访问控制和自动化安全扫描(ClamAV 恶意软件扫描、picklescan 与 trufflehog 密钥扫描)。
Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。
推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
OpenAI 开发并应用了一种基于规则的奖励(RBRs)新方法,让模型在无需大量人工数据采集的情况下学会安全行为并对齐。该方法旨在改善模型的安全行为表现。
OpenAI 提出用证明者-验证者博弈提升语言模型输出的可读性,让 AI 给出的解题过程更清晰、更易被验证。该方法旨在使模型输出对人类和机器都更可信,从而增强 AI 解决方案的可核查性。
OpenAI 与洛斯阿拉莫斯国家实验室达成研究合作,共同开发安全评估方法,用于评估和衡量前沿模型相关的生物能力与风险。
Hugging Face 正在 Dataset Hub 上试验一项基于开源 PII 检测工具 Presidio 的新功能,可为数据集生成 PII 存在情况的估算报告。Presidio 依靠检测模式和机器学习模型识别 PII,报告可帮助开发者在训练前决定是否进一步过滤数据,也便于数据集所有者验证自身的 PII 过滤流程。
Hugging Face 发布《伦理与社会通讯》第6期,聚焦 AI 数据质量。文章指出高质量数据并非仅指准确或量大,而应契合具体用途,需具备相关性、全面性、时效性并减少偏见。数据质量直接影响模型性能、鲁棒性、效率与公平性,应从 AI 开发全生命周期加以重视。
OpenAI 公布网络安全资助计划,聚焦创新研究与 AI 在网络安全领域的整合。该计划旨在赋能防御者,具体资助金额、入选项目数量及申请条件尚未披露。
OpenAI 提出一套构建稳健自然语言分类系统的整体性方法,用于真实场景下的内容审核与不良内容检测。该方法强调从整体视角应对现实世界中的内容审核需求。
OpenAI 任命退役美国陆军上将 Paul M. Nakasone 加入董事会,他将加入董事会的安全与安保委员会。Nakasone 为持续扩大的董事会带来网络安全方面的经验。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理与安全研究。该模型可根据文本生成语音,OpenAI 同时介绍了围绕这一技术开展的安全研究工作。
OpenAI 用可扩展的稀疏自编码器技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。这些模式对应模型内部的可解释概念特征,规模远超以往同类工作。
Hugging Face 本周检测到 Spaces 平台遭未授权访问,涉及 Spaces secrets,怀疑部分 secrets 可能被未授权读取。作为处置,官方已撤销这些 secrets 中的部分 HF token 并邮件通知相关用户,建议用户刷新密钥或 token 并改用细粒度访问 token。
推荐理由:官方披露 Spaces secrets 遭未授权访问及已采取的处置措施,可了解平台安全策略的调整方向。
OpenAI 终止了与隐蔽影响力行动相关的账号,并称这些账号未因使用其服务而获得显著受众增长。
Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。
OpenAI 阐述了其安全实践的核心立场:通用人工智能有望惠及生活几乎方方面面,因此必须以负责任的方式开发和部署。
OpenAI 推出新技术,帮助研究人员识别由其工具生成的内容,同时加入 Coalition for Content Provenance and Authenticity(C2PA)指导委员会,以推动行业标准建设。
OpenAI 封禁了一批与源自中国的"Spamouflage"行动关联的账号,该行动利用 AI 研究社交媒体活动、生成帖文并调试一个此前未被报道的网站。
OpenAI 封禁了与伊朗背景行动 "IUVM" 相关的账号,该网络利用 AI 生成并翻译亲伊朗、反以色列和反美的网站内容。
OpenAI 封禁了一批与一个此前未被报道的以色列来源行动相关的账号,该行动被其命名为 Zero Zeno。这些账号使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党以及亲以色列总工会(Histadrut)的内容。
推荐理由:OpenAI 披露其封禁的以色列相关影响力行动,可了解平台对 AI 生成政治内容的处置口径。
OpenAI 封禁了与俄罗斯相关的影响力行动 Doppelganger 关联的账号,该行动利用 AI 生成反乌克兰的社交媒体评论、翻译和网站文案,涉及多种语言。
OpenAI 封禁了一批与代号 Bad Grammar 的俄罗斯来源行动相关的账号,该行动此前未被公开报道。这些账号利用 AI 生成英语和俄语的 Telegram 评论,涉及乌克兰、摩尔多瓦、波罗的海国家和美国政治议题。
OpenAI 提出"指令层级"方法,通过训练让 LLM 优先执行特权指令,以抵御提示词注入、越狱等攻击。当前 LLM 易被对抗者用恶意提示词覆盖原始指令,该方法旨在解决这一问题。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台的安全缺陷,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 聊天,尝试诱导其泄露虚构银行 XYZ001 客户的敏感财务信息,再投票选出隐私保护更强的模型。
Hugging Face 发文梳理 AI 生成内容的水印方案,区分生成时嵌入与生成后添加两类方法,并盘点 Hub 上的相关工具。文中提到 Glaze、Photoguard 可微调图像干扰 AI 处理,Nightshade、Fawkes 则通过"投毒"破坏训练假设;Truepic 按 C2PA 标准嵌入元数据,IMATAG 采用水印器与检测器闭源、调用代码开源的混合模式。
Haize Labs 在 Hugging Face 团队支持下发布 Red Teaming Resistance Benchmark,用真实人类越狱提示词测试前沿模型的抗攻击能力,最终得分由 LlamaGuard 与 GPT-4 判定为 Safe 的提示词百分比构成。
Hugging Face 发布用开源模型实现 Constitutional AI 的端到端配方,并开源 llm-swarm 工具,基于 TGI 和 vLLM 在 Slurm 集群上做可扩展合成数据生成。
推荐理由:Hugging Face 给出用开源模型复现 Constitutional AI 的完整配方,含数据集、模型与评测对比,可迁移到自定义价值观对齐。
OpenAI 正在制定一套评估大语言模型可能协助制造生物威胁风险的蓝图。在生物专家与学生参与的评估中,GPT-4 对生物威胁创建准确率的提升至多为轻微程度。该提升尚不足以形成定论,但可作为后续研究与社区讨论的起点。
Hugging Face 推出 LLM Safety Leaderboard,基于 DecodingTrust 评估框架对 LLM 安全性进行评测,该框架曾获 NeurIPS 2023 杰出论文奖。
OpenAI 公布了其"民主输入 AI"资助计划的结果,该计划资助了来自全球的 10 支团队,用于设计集体治理 AI 的想法和工具。OpenAI 总结了这些团队的创新成果与自身经验,并呼吁研究人员和工程师加入后续工作。
OpenAI 宣布投入 1000 万美元设立 Superalignment Fast Grants,资助面向超人类 AI 系统对齐与安全的技术研究。资助方向包括弱到强泛化、可解释性和可扩展监督等。
推荐理由:OpenAI 出资 1000 万美元资助超人类 AI 对齐研究,可了解其关注的具体技术方向。
OpenAI 提出"弱到强泛化"这一超级对齐新研究方向,探索能否利用深度学习的泛化特性,用弱监督者控制更强的模型,并给出了初步的积极结果。
OpenAI 正在制定灾难性风险应对方案,以保障高能力 AI 系统的安全,具体举措包括组建一支 Preparedness 团队并发起一项挑战赛。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元 AI 安全基金。该论坛由上述四家公司共同推进,此次更新聚焦于治理层人事与安全资金两项安排。
OpenAI 发布 DALL·E 3 系统卡,用于说明该图像生成模型在安全与对齐方面的评估情况。原文正文未能抓取,具体评估内容暂不可见。