跳到正文

#安全/对齐

今日 7 条
2月1日周日
1月28日周三
1月20日周二
12月23日周二
12月18日周四
12月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 Gemma Scope 2,为 Gemma 3 全系列提供可解释性工具

    Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAE)与 transcoder 查看模型内部计算。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供 SAE 与 transcoder,读者可据此了解模型可解释性工具的开源进展。

12月11日周四
  1. Google DeepMind24

    Google DeepMind 扩大与英国 AI Security Institute 的合作,聚焦基础安全研究

    Google DeepMind 宣布与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到基础安全与安全研究。双方将共享专有模型、数据与思路,并联合发布报告,重点研究 CoT 监控、社会情感错位影响以及 AI 对经济系统的冲击。Google DeepMind 称 Gemini 3 是其迄今最智能、最安全的模型。

  2. OpenAI News66

    OpenAI 更新 GPT-5 系统卡,纳入 GPT-5.2

    OpenAI 更新 GPT-5 系统卡,将 GPT-5.2 纳入其中。GPT-5.2 是 GPT-5 系列的最新模型家族,其安全缓解方案与 GPT-5 系统卡、GPT-5.1 系统卡所述基本一致。这些模型与 OpenAI 其他模型一样,训练数据包括互联网公开信息、通过第三方合作获取的信息,以及用户或人类训练师与研究人员提供或生成的信息。

    推荐理由:官方系统卡更新披露 GPT-5.2 的安全缓解思路与 GPT-5 系列保持一致,可对照前代系统卡了解其安全策略延续性。

  3. Google Research31

    Google 提出 Urania:用差分隐私从 AI 聊天机器人对话中挖掘使用洞察

    Google Research 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在人工评估中最高有 70% 的情况更受 LLM 评审青睐,但隐私预算收紧时主题覆盖度会下降。

12月10日周三
12月3日周三
12月1日周一
11月27日周四
11月19日周三
11月13日周四
11月12日周三
11月7日周五
11月6日周四
10月30日周四
  1. Google Research62

    Google 提出可证明隐私洞察 PPI,用 LLM 与差分隐私分析 AI 使用数据

    Google Research 提出可证明隐私洞察(PPI),结合大语言模型、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析非结构化 GenAI 数据。

    推荐理由:Google 把 LLM、差分隐私与 TEE 组合成可外部核验的隐私分析流程,读者可了解端侧 AI 数据如何在不暴露个体数据的前提下被统计。

10月29日周三
10月28日周二
  1. Hugging Face Blog40

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人同意

    Hugging Face 提出“语音同意门”机制,让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆。该方案用语言模型为每次授权生成一对全新句子,一句表达明确同意并包含模型名,另一句提供语音多样性,从而支持可追溯、可审计的授权流程。官方同时发布了示例 Space 和配套代码。

10月27日周一
10月22日周三
10月14日周二
10月9日周四
10月7日周二
10月1日周三