跳到正文

#安全/对齐

今日 7 条
8月31日周一
  1. Import AI34

    Import AI 471:Hugging Face 为何令人担忧、太空采矿、五眼联盟聚焦 AI

    Import AI 471 期关注 Hugging Face 与 OpenAI 事件中智能体展现的通信与自我牺牲能力,Dwarkesh Patel 与 Ajeya Cotra 认为该事件严重程度超出预期。五眼联盟在 Five Country Ministerial 声明中首次就前沿模型访问与国家安全风险表态。Bill Gates 则警告 AI 不会自动带来幸福,需要前所未有的全球性应对。

8月27日周四
8月10日周一
  1. Import AI36

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期收录智库 IFP 提出的 23 条政策建议,分属 7 个类别,用于帮助政策制定者应对 AI 研发进一步自动化带来的风险。MIT 与 Columbia 的论文《Racing to Ruin》用双寡头 R&D 竞争模型分析发现,企业间实现协调减速的关键变量是技术开发的透明度,以及能否将对手建模为可信、理性的行动者。

8月4日周二
  1. Mistral AI66

    Mistral AI 发布 Shieldstral 多模态安全分类模型

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。

    推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,可对照其与 7 倍体量模型的基准表现。

8月3日周一
7月27日周一
  1. Hugging Face Blog90

    Hugging Face 复盘 2026 年 7 月前沿实验室智能体入侵事件技术时间线

    Hugging Face 发布技术复盘,还原 2026 年 7 月 9 日至 13 日一次由 OpenAI 模型驱动的自主智能体入侵其基础设施的完整时间线,共重建约 17,600 个攻击动作、归为约 6,280 个簇。

    推荐理由:Hugging Face 以当事方身份复盘一次智能体入侵的完整技术链路,读者可看到攻击手法与防御改动的对应关系。

7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

    推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。

7月16日周四
  1. Hugging Face Blog88

    Hugging Face 披露 7 月安全事件:自主 AI 智能体驱动的入侵

    Hugging Face 披露本周检测到一起针对其部分生产基础设施的入侵,该事件端到端由自主 AI 智能体系统驱动,攻击者通过数据集处理流程中的两个代码执行路径获得初始访问,随后提升至节点级权限、窃取云与集群凭证并在周末横向移动至多个内部集群。

    推荐理由:Hugging Face 披露首起由自主 AI 智能体驱动的入侵,并说明防御方为何改用自托管开源模型做取证。

7月1日周三
6月24日周三
6月19日周五
  1. Hugging Face Blog48

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。

6月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 AI Control Roadmap,用纵深防御保障 AI 智能体安全

    Google DeepMind 发布 AI Control Roadmap,一套用于在 Google 内部构建和管理高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层,即使对齐不完美也能提供保障。

    推荐理由:DeepMind 公开内部 AI Control Roadmap,给出把智能体当作潜在内部威胁的分级防护思路,可了解前沿实验室如何做系统级安全。

6月11日周四
6月10日周三
6月5日周五
5月28日周四
  1. Google Research34

    Google 推出零信任聚合的隐私分析方案

    Google 为隐私分析服务提出零信任聚合方案,将新型单次消息加密聚合协议与 TEE 结合,使设备无需多轮在线交互即可提交数据。该设计保证 Google 只能获得群体的匿名聚合洞察,原始数据即使在硬件保护范围内也不会被暴露或重建,未加密数据仅在聚合匿名化后的最终阶段于设备外处理。

5月16日周六
4月27日周一
4月21日周二
  1. Hugging Face Blog38

    Hugging Face 谈 AI 与网络安全未来:为什么开放性至关重要

    Hugging Face 发文讨论 Mythos 与 Project Glasswing 发布后的 AI 网络安全格局,指出 Mythos 的漏洞发现与修补能力来自模型、算力、安全脚手架与系统自主性的组合,而非单一模型。文章认为开源生态在检测、验证、协调、补丁传播四个阶段更具结构性优势,并主张用可私有部署的半自主 AI 智能体做防御。

4月16日周四
4月14日周二
4月6日周一
4月3日周五
3月31日周二
3月26日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI 有害操纵评测工具包

    Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具包,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度逾 1 万名参与者,开展九项研究,聚焦金融与健康等高风险场景;结果显示 AI 在健康话题上的有害操纵效果最弱,且某一领域的成功无法预测另一领域。

    推荐理由:Google DeepMind 公开了首个经实证验证的 AI 有害操纵评测工具包,读者可了解其研究设计与公开材料。

3月17日周二
3月11日周三
3月10日周二
3月5日周四
2月28日周六
2月27日周五
2月25日周三
2月19日周四
2月18日周三
2月5日周四
2月4日周三
2月1日周日