跳到正文

#安全/对齐

今日 7 条
7月15日周三
7月9日周四
7月1日周三
6月26日周五
  1. OpenAI News60

    OpenAI 预告下一代模型 GPT-5.6 Sol

    OpenAI 预告下一代模型 GPT-5.6 Sol,称其在编码、科学和网络安全方面具备更强能力,并搭配其最先进的安全栈。

    推荐理由:OpenAI 官方预告下一代模型 GPT-5.6 Sol,读者可了解其在编码、科学与网络安全上的能力方向及配套安全栈。

6月24日周三
6月23日周二
6月22日周一
6月19日周五
  1. Hugging Face Blog48

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。

6月15日周一
6月11日周四
6月10日周三
6月8日周一
6月5日周五
6月4日周四
6月2日周二
6月1日周一
  1. Import AI22

    Import AI 459:AI 监管为何困难、蛋白质折叠模型的缩放定律、以及为 AI 系统灭绝风险定价

    Import AI 459 聚焦三个议题:英国 AI Security Institute 的论文指出用 AI 监督 AI 训练的自动化对齐研究比想象中更难;另有研究提出蛋白质折叠模型的缩放定律,以及为 AI 系统灭绝风险定价的讨论。同期还提到美国 AI 经济以每年约 2,000% 的速度增长,2025 年名义 AI GDP 约 2500 亿美元。

5月29日周五
5月28日周四
  1. Google Research34

    Google 推出零信任聚合的隐私分析方案

    Google 为隐私分析服务提出零信任聚合方案,将新型单次消息加密聚合协议与 TEE 结合,使设备无需多轮在线交互即可提交数据。该设计保证 Google 只能获得群体的匿名聚合洞察,原始数据即使在硬件保护范围内也不会被暴露或重建,未加密数据仅在聚合匿名化后的最终阶段于设备外处理。

5月27日周三
5月26日周二
5月19日周二
5月18日周一
5月16日周六
5月13日周三
  1. OpenAI News58

    OpenAI 回应 TanStack npm 供应链攻击

    OpenAI 就 TanStack“Mini Shai-Hulud”供应链攻击作出回应,说明为保护系统和签名证书所采取的措施,并解释 macOS 用户为何必须在 2026 年 6 月 12 日前更新 OpenAI 应用。内容涵盖事件经过、受影响范围以及 OpenAI 如何加强对软件供应链威胁的防御。

5月6日周三
4月30日周四
4月29日周三
4月28日周二
4月27日周一
4月21日周二
  1. Hugging Face Blog38

    Hugging Face 谈 AI 与网络安全未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与系统自主性的组合,而非单一模型。文章认为开源生态在检测、验证、协调、补丁传播四个阶段更具结构性优势,并主张用可私有部署的半自主 AI 智能体做防御。

4月16日周四
4月14日周二
4月10日周五