跳到正文

#Hugging Face

今日 0 条
9月29日周二
  1. Hugging Face Blog36

    ProvenanceGuard:面向 MCP 智能体的来源感知事实核查

    Hugging Face 博客介绍论文 ProvenanceGuard,一个运行在黑盒 MCP 智能体之上的生成后验证层,用于识别"跨来源混淆"——即事实真实但被归因到错误来源。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四个对照检查器的比较中得分最高。

9月16日周三
9月2日周三
8月28日周五
8月25日周二
  1. Hugging Face Blog60

    Multiverse Computing 提出 Quantization-Aware Healing:4-bit 压缩模型在 7/9 基准上超过其全精度版本

    Multiverse Computing 发布论文提出 Quantization-Aware Healing(QAH),在 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 checkpoint 蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复方法,并附9项基准对比,可看4-bit模型反超16-bit来源的具体条件。

8月21日周五
8月13日周四
  1. Hugging Face Blog71

    Hugging Face 用编码智能体复现 ICML 2026 的 2,226 篇论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1,221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文主张,共发布 6,816 份 Trackio logbook,覆盖 2,226 篇论文,约占会议论文的三分之一。

    推荐理由:Hugging Face 用 1,200 多名社区成员和编码智能体复现 ICML 2026 论文,给出了大规模论文审计的可行路径与人类角色的具体观察。

8月11日周二
8月10日周一
  1. Hugging Face Blog44

    Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,大幅降低 LLM 知识蒸馏成本

    Hugging Face 论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB,超过单张 H200 的 141GB,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。

7月15日周三
  1. Hugging Face Blog62

    Hume 发布 Real World VoiceEQ 语音 AI 人类质量评测基准

    Hume 发布 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个专有与开源语音模型、15 个以上评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 与语音理解。

    推荐理由:Hume 公开了语音 AI 人类质量评测基准的规模与关键发现,读者可据此理解现有基准为何高估真实表现。

7月1日周三
  1. Hugging Face Blog39

    ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试

    Hugging Face 发布开源基准 ScarfBench,用于评测 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。评测显示最强智能体行为成功率不足 10%,Claude Code 报告 30 个应用中 29 个构建成功,实际仅 22 个通过。

6月30日周二
6月24日周三
6月19日周五
  1. Hugging Face Blog48

    Hugging Face 提出 MosaicLeaks:深度研究智能体能否守住秘密?

    Hugging Face 发布 MosaicLeaks,用 1001 条多跳研究链评测深度研究智能体的隐私泄露风险,这些链交替穿插本地企业文档与公开网页信息。测试中智能体频繁泄露隐私,仅训练任务性能还会加剧泄露;其提出的 PA-DR 方法将严格链成功率从 48.7% 提升至 58.7%,并把答案/全信息泄露率从 34.0% 降至 9.9%。

4月21日周二
  1. Hugging Face Blog28

    QIMMA:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜

    Hugging Face 发布 QIMMA(阿拉伯语"顶峰"),一个先验证基准质量再评测模型的开源阿拉伯语 LLM 排行榜。QIMMA 整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖文化、STEM、法律、医疗、安全、诗歌与编程 7 大领域,其中 99% 为原生阿拉伯语内容,并首次在阿拉伯语排行榜中引入代码评测。

4月16日周四
4月15日周三
  1. Hugging Face Blog38

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具调用与失败模式的可执行基准

    Hugging Face 推出 VAKRA,一个面向企业级环境的工具接地可执行基准,用于评测 AI 智能体的组合推理与多步工作流执行能力。VAKRA 提供 8,000+ 本地托管 API、覆盖 62 个领域并配有领域文档,任务需 3-7 步推理链,包含 API Chaining、Tool Selection、Multi-Hop Reasoning 等四项任务,模型整体表现不佳。

3月31日周二
  1. Hugging Face Blog26

    OpenMed 用 165 美元训练跨 25 物种的 mRNA 语言模型

    OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线,其 CodonRoBERTa-large-v2 以困惑度 4.10、Spearman CAI 相关性 0.40 显著优于 ModernBERT。团队随后扩展到 25 个物种,用 55 GPU-hours 训练出 4 个生产模型,并搭建了目前其他开源项目尚未提供的物种条件化系统。

3月24日周二
  1. Hugging Face Blog42

    Hugging Face 推出语音智能体评估框架 EVA

    Hugging Face 发布端到端语音智能体评估框架 EVA,首次同时打分任务成功率(EVA-A)与对话体验(EVA-X),并开源含 50 个航司场景的数据集。对 20 个级联与音频原生系统的基准测试显示,准确率与体验之间存在一致的权衡:任务完成得好的智能体,用户体验往往更差。

1月27日周二
  1. Hugging Face Blog21

    Hugging Face 发布 Alyah:面向阿拉伯语 LLM 阿联酋方言能力的评测基准

    Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星"),一个专门评估阿拉伯语 LLM 阿联酋方言能力的基准,包含 1,173 条由阿联酋母语者手工采集的样本,每题四选一。评测覆盖 54 个模型(23 个基座、31 个指令微调),google/gemma-3-27b-pt 以 74.68 的准确率居首,tiiuae/Falcon-H1-34B-Base 为 73.66。

1月21日周三
12月4日周四
11月21日周五
11月19日周三
10月1日周三
  1. Hugging Face Blog40

    Hugging Face 推出 RTEB:面向真实场景的检索嵌入基准测试

    Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用公开与私有数据集混合的方式评估嵌入模型的真实检索泛化能力。该基准覆盖 20 种语言,聚焦法律、医疗、代码、金融等企业领域,默认榜单指标为 NDCG@10,私有数据集由 MTEB 维护者评测,部分模型在私有集上出现明显性能下滑。

9月22日周一
9月3日周三
8月21日周四
  1. Hugging Face Blog60

    NVIDIA 发布 600 万多语言推理数据集 Nemotron Post-Training Dataset V2

    NVIDIA 发布 Nemotron Post-Training Dataset V2,将此前英文推理数据翻译为法语、德语、意大利语、日语和西班牙语五种语言,共 600 万多语言推理样本。

    推荐理由:NVIDIA 公开了多语言推理数据集的构建流程与筛选比例,读者可据此了解后训练数据的翻译与幻觉控制方法。

8月14日周四
8月12日周二
8月1日周五
7月23日周三
7月18日周五
7月17日周四
7月4日周五
6月6日周五
5月28日周三
1月9日周四
  1. Hugging Face Blog29

    Hugging Face 开放 LLM 排行榜新增 CO₂ 排放数据:社区微调模型更低碳

    Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。

12月10日周二
12月9日周一