跳到正文

#安全/对齐

今日 0 条
10月2日周五
  1. BestBlogs.dev82

    谷歌发布 Gemini 4 系列首款旗舰模型 Argon

    谷歌于 9 月 30 日发布 Gemini 4 系列首款旗舰模型 Argon,在软件工程、金融研究、法律研究及企业自动化等领域评测中表现领先。Argon 支持最高 100 万单次词元输出,高于此前的 6.4 万,缓存输入价格较前版本降低 95%,并能自主发现、验证并修复软件漏洞,目前已向部分合作方开放。随着 Argon 落地,谷歌取消了原定于 6 月发布的 Gemini 3.5 Pro 迭代计划。

    推荐理由:谷歌 Gemini 4 系列首款旗舰模型 Argon 的能力与定价变化,以及随之取消的 Gemini 3.5 Pro 迭代计划。

10月1日周四
  1. BestBlogs.dev80

    谷歌发布 Gemini 4 Argon:多项基准登顶,首批仅限审核团队

    谷歌发布新一代旗舰模型 Gemini 4 Argon,在 DeepSWE v1.1(77.9%)、CWE-bench v1(68%)、Vals Index(68.90%)和 Text Arena(1525 分)等评测中领跑,但在 Code Arena 仅排第八。

    推荐理由:汇总了 Gemini 4 Argon 的多项基准成绩、定价与首批开放范围,并附上内部员工对跑分与实际编程表现的争议。

  2. Google DeepMind80

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。

    推荐理由:官方给出 Argon 在编码、企业知识与网络安全防御上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。

9月30日周三
  1. Google DeepMind71

    Google DeepMind 推出 SynthID Bio,为 AI 生成蛋白质嵌入可验证水印

    Google DeepMind 推出 SynthID Bio,将水印技术用于合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时实验室测试显示其不损害蛋白质的生物功能。

    推荐理由:Google DeepMind 把水印从数字内容延伸到合成生物,读者可了解其技术路径与生物安全筛查的衔接方式。

9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和面向网络安全的 Gemini 3.8 Flash Cyber,前者在软件工程、智能体任务和多步推理上较 3.7 Flash 明显提升,价格维持每百万输入 token 0.75 美元、输出 3.75 美元。

    推荐理由:Gemini 3.8 Flash 在编码与智能体任务上接近更贵的前沿模型,同时保持 3.7 Flash 的价格,可据此判断性价比取舍。

8月4日周二
  1. Mistral AI66

    Mistral AI 发布 Shieldstral 多模态安全分类模型

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,把内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。

    推荐理由:3B 开源权重模型以推理时自然语言策略替代固定分类体系,可对照其与 7 倍体量模型的基准表现。

7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

    推荐理由:官方给出轻量安全模型在 CyberGym、Chrome 提交扫描等基准上的表现与限量开放方式,可据此判断其定位与可用范围。

6月5日周五
12月23日周二
12月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 Gemma Scope 2,为 Gemma 3 全系列提供可解释性工具

    Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAE)与 transcoder 查看模型内部计算。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供 SAE 与 transcoder,读者可据此了解模型可解释性工具的开源进展。

4月29日周二
7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。

    推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。