OpenAI 推出 GPT-Red:用自我博弈提升鲁棒性
OpenAI 发布自动化红队系统 GPT-Red,通过自我博弈提升 AI 安全、对齐与提示注入鲁棒性。该系统面向 AI 安全与对齐场景,用于自动化红队测试。
OpenAI 发布自动化红队系统 GPT-Red,通过自我博弈提升 AI 安全、对齐与提示注入鲁棒性。该系统面向 AI 安全与对齐场景,用于自动化红队测试。
OpenAI 公布 GPT-5.5 Bio Bug Bounty 生物漏洞赏金计划详情。该计划面向 GPT-5.5 在生物领域的安全漏洞,具体奖励金额、参与方式与开放时间尚未在原文中披露。
加州大学伯克利分校 BAIR 实验室展示 2026 届博士毕业生,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可了解其在编码、科学与网络安全上的能力方向及配套安全栈。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织管理连接器访问权限的管理员控制、带连接器作用域的 API key、支持多账号登录的连接器均已 GA。
OpenAI 正通过 Appia Foundation 参与构建先进 AI 的共享标准,支持评测框架、安全实践与全球合作。
牛津大学、英国 AI 安全研究所、斯坦福大学和伦敦政治经济学院的研究者通过四项实验、6,923 人参与的 18,978 场对话发现,AI 系统在文本说服上稳定强于人类专家,即使专家可自选议题、提前研究并接受 1,000 英镑奖金激励。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为“对齐尚未走上正轨”,计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、博弈论与 personas。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
OpenAI 新报告披露,与中国相关的影响力行动正利用 AI 针对美国科技议题辩论,涉及数据中心叙事、关税以及关于 ChatGPT 的不实说法。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
伦敦国王学院、复旦大学与 Alan Turing Institute 构建了 SocioHack 基准,用 72 个沙盒社会环境测试 AI 的"社会性 hacking",RL 训练的 LLM 能以 61.25% 召回率和 90.85% 精确率重新发现历史上已被修补的规则漏洞。
OpenAI 公布名为“Built to benefit everyone”的未来 AI 愿景计划,聚焦可及性、安全与共同繁荣,目标是确保 AGI 惠及所有人。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行和可审计推理链统一到一次推理调用中。
推荐理由:NVIDIA 发布 4B 多模态安全模型,支持自定义策略与可审计推理链,并公开训练数据集。
OpenAI 发布《智能时代的生物防御》行动计划,提出以 AI 驱动的生物韧性方案。该计划面向"智能时代"的生物安全挑战,旨在利用 AI 提升生物防御能力。
OpenAI 呼吁就青少年 AI 安全采取全球行动,提议设立一个国际机构,以加强保护措施、标准制定并为年轻人创造机会。
Import AI 459 聚焦三个议题:英国 AI Security Institute 的论文指出用 AI 监督 AI 训练的自动化对齐研究比想象中更难;另有研究提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的讨论。同期还提到美国 AI 经济以每年约 2,000% 的速度增长,2025 年名义 AI GDP 约 2500 亿美元。
OpenAI 封禁了一批疑似源自中国的账号,这些账号利用 AI 生成关于美国科技政策、关税和贸易限制的评论与漫画。该行动针对名为 "Tech and Tariffs" 的影响力活动。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群利用 AI 生成社交媒体内容,批评美国数据中心与 AI 基础设施。相关行动被命名为“Data Center Bandwagon”Campaign,被定性为针对美国的境外影响力活动。
OpenAI 分享第三方 AI 评估指南,覆盖前沿模型的模型能力、防护措施与有效性评估方法。该指南面向第三方评估场景,旨在为可信评估提供统一参考。
OpenAI 发布前沿治理框架(Frontier Governance Framework),阐述其 AI 安全、安保与风险管理实践如何对齐欧盟和加州正在成形的监管要求。该框架聚焦于前沿模型的治理与合规路径。
Google 为隐私分析服务提出零信任聚合方案,将新型单次消息加密聚合协议与 TEE 结合,使设备无需多轮在线交互即可提交数据。该设计保证 Google 只能获得群体的匿名聚合洞察,原始数据即使在硬件保护范围内也不会被暴露或重建,未加密数据仅在聚合匿名化后的最终阶段于设备外处理。
OpenAI 公布 2026 年选举支持方案,涵盖可靠信息、网络防御、AI 透明度、滥用防护与偏见监测五个方面。该方案旨在为选举期间提供信息保障并防范 AI 滥用风险。
Import AI 458 收录了一篇基于 2026 Cosmos HAI Lab Lecture 的长文和一个设想"正向奇点"的虚构故事。文章以 Epoch Capabilities Index(ECI)追踪 40 多个 benchmark 上模型的进步,主张 AI 不能被视为普通技术,人类需在"探索未来"与"退缩于当下"之间做出选择。
OpenAI 推进 AI 内容溯源,采用 Content Credentials 与 SynthID,并推出验证工具,帮助人们识别和信任 AI 生成媒体。
Import AI 457 聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏科研与工程计算。
Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出多项计划,覆盖医疗健康、生命科学、教育和气候领域。合作包括探索 AI 辅助临床的"三方护理"、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,以及为盲人和低视力运动员开发基于 Gemma 的跑步助手。
OpenAI 就 TanStack“Mini Shai-Hulud”供应链攻击作出回应,说明为保护系统和签名证书所采取的措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。内容涵盖事件经过、受影响范围以及 OpenAI 如何加强对软件供应链威胁的防御。
OpenAI 详解 ChatGPT 的隐私保护机制:减少训练数据中的个人数据,并让用户自主控制自己的对话是否用于改进 AI 模型。
OpenAI 推出 Advanced Account Security,提供抗钓鱼登录、更强的账户恢复能力以及增强的防护机制。该功能旨在保护敏感数据并防止账户被接管。
OpenAI 提出一套五部分行动计划,旨在加强 Intelligence Age 的网络安全,重点是让 AI 驱动的网络防御普惠化并保护关键系统。
OpenAI 通过模型防护、滥用检测、政策执行以及与安全专家的合作来保护 ChatGPT 的社区安全。
Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与系统自主性的组合,而非单一模型。文章认为开源生态在检测、验证、协调、补丁传播四个阶段更具结构性优势,并主张用可私有部署的半自主 AI 智能体做防御。
OpenAI 推出 Trusted Access for Cyber 计划,领先安全公司与大型企业已加入,使用 GPT-5.4-Cyber 并配套 1000 万美元 API 资助强化全球网络防御。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。