跳到正文

#安全/对齐

今日 0 条
9月16日周一
9月4日周三
8月8日周四
8月6日周二
7月31日周三
  1. Hugging Face Blog62

    Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope

    Google 在 Gemma 2 发布一个月后扩充 Gemma 模型系列,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版)、安全分类器 ShieldGemma 以及稀疏自编码器套件 Gemma Scope。

    推荐理由:Google 一次补齐 Gemma 2 的小尺寸、安全分类器和可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。

7月24日周三
7月17日周三
7月10日周三
6月24日周一
  1. Hugging Face Blog22

    Hugging Face 伦理与社会通讯第6期:构建更好的 AI,数据质量为何至关重要

    Hugging Face 发布《伦理与社会通讯》第6期,聚焦 AI 数据质量。文章指出高质量数据并非仅指准确或量大,而应契合具体用途,需具备相关性、全面性、时效性并减少偏见。数据质量直接影响模型性能、鲁棒性、效率与公平性,应从 AI 开发全生命周期加以重视。

6月20日周四
6月13日周四
6月8日周六
6月6日周四
5月31日周五
  1. Hugging Face Blog62

    Hugging Face 披露 Spaces secrets 遭未授权访问并更新安全措施

    Hugging Face 本周检测到 Spaces 平台遭未授权访问,涉及 Spaces secrets,怀疑部分 secrets 可能被未授权读取。作为处置,官方已撤销这些 secrets 中的部分 HF token 并邮件通知相关用户,建议用户刷新密钥或 token 并改用细粒度访问 token。

    推荐理由:官方披露 Spaces secrets 遭未授权访问及已采取的处置措施,可了解平台安全策略的调整方向。

5月30日周四
5月24日周五
  1. Hugging Face Blog45

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。

5月21日周二
5月7日周二
5月1日周三
  1. OpenAI News60

    OpenAI 封禁以色列相关影响力行动 Zero Zeno 账号

    OpenAI 封禁了一批与一个此前未被报道的以色列来源行动相关的账号,该行动被其命名为 Zero Zeno。这些账号使用 AI 生成反哈马斯、反卡塔尔、亲以色列、反印度人民党以及亲以色列总工会(Histadrut)的内容。

    推荐理由:OpenAI 披露其封禁的以色列相关影响力行动,可了解平台对 AI 生成政治内容的处置口径。

4月20日周六
4月4日周四
  1. Hugging Face Blog38

    Hugging Face 与 Wiz Research 合作提升 AI 安全

    Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了平台的安全缺陷,相关问题已全部修复。Hugging Face 已将 Wiz 用于漏洞管理和云安全态势管理(CSPM),并基于其工具自动修复 Spaces 等产品中的问题。

3月21日周四
2月26日周一
  1. Hugging Face Blog36

    Hugging Face:AI 水印工具与技术入门指南

    Hugging Face 发文梳理 AI 生成内容的水印方案,区分生成时嵌入与生成后添加两类方法,并盘点 Hub 上的相关工具。文中提到 Glaze、Photoguard 可微调图像干扰 AI 处理,Nightshade、Fawkes 则通过"投毒"破坏训练假设;Truepic 按 C2PA 标准嵌入元数据,IMATAG 采用水印器与检测器闭源、调用代码开源的混合模式。

2月23日周五
2月1日周四
1月31日周三
1月26日周五
1月16日周二
12月14日周四
10月26日周四
10月25日周三
10月3日周二