Mistral AI 发布 Shieldstral 多模态安全分类模型
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,可对照其与 7 倍体量模型的基准表现。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。
推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,可对照其与 7 倍体量模型的基准表现。
OpenAI 分享了其在安全、安保、透明度与内容溯源方面的实践,用以支持欧洲的负责任 AI 治理。随着 EU AI Act 推进,相关工作将持续开展。
Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵其基础设施的完整时间线,共重建约 17,600 个攻击动作、归为约 6,280 个簇。
推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击手法与防御改动的对应关系。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。
推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。
Google DeepMind 与 Isomorphic Labs 公布联合生物韧性方案,一方面防止威胁行为者滥用其模型,另一方面让政府、科学家与生物安全专家用 AI 构建更具韧性的社会。
Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过数据集处理流程中的两个代码执行路径获得初始访问,随后提升至节点级权限、窃取云与集群凭证并在周末横向移动至多个内部集群。
推荐理由:Hugging Face 披露首起由自主 AI 智能体驱动的入侵,并说明防御方为何改用自托管开源模型做取证。
OpenAI 发布自动化红队系统 GPT-Red,通过自我博弈提升 AI 安全、对齐与提示注入鲁棒性。该系统面向 AI 安全与对齐场景,用于自动化红队测试。
OpenAI 公布 GPT-5.5 Bio Bug Bounty 生物漏洞赏金计划详情。该计划面向 GPT-5.5 在生物领域的安全漏洞,具体奖励金额、参与方式与开放时间尚未在原文中披露。
加州大学伯克利分校 BAIR 实验室展示 2026 届博士毕业生,其研究覆盖机器人、具身智能、大语言模型与推理、计算机视觉、生成建模、AI 安全、人机交互及 AI for Science 等方向。
OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全栈。
推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可了解其在编码、科学与网络安全上的能力方向及配套安全栈。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织管理连接器访问权限的管理员控制、带连接器作用域的 API key、支持多账号登录的连接器均已 GA。
OpenAI 正通过 Appia Foundation 参与构建先进 AI 的共享标准,支持评测框架、安全实践与全球合作。
OpenAI 推出 Patch the Planet,这是 Daybreak 计划下的一项新举措,帮助开源维护者借助 AI 与专家审核发现、验证并修复漏洞。
Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。
Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。
推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用相对距离检验判断遗忘后的模型在分布上更接近安全重训模型还是原始受损模型。
OpenAI 新报告披露,与中国相关的影响力行动正利用 AI 针对美国科技议题辩论,涉及数据中心叙事、关税以及关于 ChatGPT 的不实说法。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全技术研究资助,面向全球研究者征集方案。
OpenAI 公布名为“Built to benefit everyone”的未来 AI 愿景计划,聚焦可及性、安全与共同繁荣,目标是确保 AGI 惠及所有人。
NVIDIA 发布 Nemotron 3.5 Content Safety,基于 Gemma 3 4B IT 微调,将多模态输入、多语言覆盖、自定义企业策略执行和可审计推理链统一到一次推理调用中。
推荐理由:NVIDIA 发布 4B 多模态安全模型,支持自定义策略与可审计推理链,并公开训练数据集。
OpenAI 发布《智能时代的生物防御》行动计划,提出以 AI 驱动的生物韧性方案。该计划面向"智能时代"的生物安全挑战,旨在利用 AI 提升生物防御能力。
OpenAI 呼吁就青少年 AI 安全采取全球行动,提议设立一个国际机构,以加强保护措施、标准制定并为年轻人创造机会。
OpenAI 封禁了一批疑似源自中国的账号,这些账号利用 AI 生成关于美国科技政策、关税和贸易限制的评论与漫画。该行动针对名为 "Tech and Tariffs" 的影响力活动。
OpenAI 封禁了一个疑似源自中国的账号集群,该集群利用 AI 生成社交媒体内容,批评美国数据中心与 AI 基础设施。相关行动被命名为“Data Center Bandwagon”Campaign,被定性为针对美国的境外影响力活动。
OpenAI 分享第三方 AI 评估指南,覆盖前沿模型的模型能力、防护措施与有效性评估方法。该指南面向第三方评估场景,旨在为可信评估提供统一参考。
OpenAI 发布前沿治理框架(Frontier Governance Framework),阐述其 AI 安全、安保与风险管理实践如何对齐欧盟和加州正在成形的监管要求。该框架聚焦于前沿模型的治理与合规路径。
Google 为隐私分析服务提出零信任聚合方案,将新型单次消息加密聚合协议与 TEE 结合,使设备无需多轮在线交互即可提交数据。该设计保证 Google 只能获得群体的匿名聚合洞察,原始数据即使在硬件保护范围内也不会被暴露或重建,未加密数据仅在聚合匿名化后的最终阶段于设备外处理。
OpenAI 公布 2026 年选举支持方案,涵盖可靠信息、网络防御、AI 透明度、滥用防护与偏见监测五个方面。该方案旨在为选举期间提供信息保障并防范 AI 滥用风险。
OpenAI 推进 AI 内容溯源,采用 Content Credentials 与 SynthID,并推出验证工具,帮助人们识别和信任 AI 生成媒体。
Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出多项计划,覆盖医疗健康、生命科学、教育和气候领域。合作包括探索 AI 辅助临床的"三方护理"、用 AlphaFold 和 Google Earth 推进东南亚传染病研究,以及为盲人和低视力运动员开发基于 Gemma 的跑步助手。
OpenAI 就 TanStack“Mini Shai-Hulud”供应链攻击作出回应,说明为保护系统和签名证书所采取的措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。内容涵盖事件经过、受影响范围以及 OpenAI 如何加强对软件供应链威胁的防御。
OpenAI 详解 ChatGPT 的隐私保护机制:减少训练数据中的个人数据,并让用户自主控制自己的对话是否用于改进 AI 模型。
OpenAI 推出 Advanced Account Security,提供抗钓鱼登录、更强的账户恢复能力以及增强的防护机制。该功能旨在保护敏感数据并防止账户被接管。
OpenAI 提出一套五部分行动计划,旨在加强 Intelligence Age 的网络安全,重点是让 AI 驱动的网络防御普惠化并保护关键系统。
OpenAI 通过模型防护、滥用检测、政策执行以及与安全专家的合作来保护 ChatGPT 的社区安全。
Google DeepMind 与韩国科学技术信息通信部(MSIT)达成合作,将在首尔办公室设立 AI Campus,向韩国学界开放 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿模型。
Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与系统自主性的组合,而非单一模型。文章认为开源生态在检测、验证、协调、补丁传播四个阶段更具结构性优势,并主张用可私有部署的半自主 AI 智能体做防御。
OpenAI 推出 Trusted Access for Cyber 计划,领先安全公司与大型企业已加入,使用 GPT-5.4-Cyber 并配套 1000 万美元 API 资助强化全球网络防御。
OpenAI 扩展 Trusted Access for Cyber 计划,向经过审核的防御者推出 GPT-5.4-Cyber,并随 AI 网络安全能力提升强化防护措施。
OpenAI 就 Axios 供应链攻击作出回应,已轮换 macOS 代码签名证书并更新应用,同时确认没有用户数据遭到泄露。