跳到正文

全部动态

今日 2 条
2月2日周日
1月28日周二
1月22日周三
1月9日周四
  1. Hugging Face Blog29

    Hugging Face 开放 LLM 排行榜新增 CO₂ 排放数据:社区微调模型更低碳

    Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。

12月20日周五
12月10日周二
12月9日周一
12月4日周三
  1. Hugging Face Blog29

    Hugging Face 推出 AraGen:基于 3C3H 的阿拉伯语 LLM 生成式评测基准与榜单

    Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与榜单,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度基于 LLM-as-judge 打分。榜单采用动态评测策略,数据集与评测代码先盲测三个月再公开,随后更换新私有基准,以缓解数据污染。该基准同时覆盖多轮与单轮场景,是这一语言无关评测框架的首次应用。

11月20日周三
  1. Hugging Face Blog28

    Hugging Face 与 LLM-jp 联合推出日语 LLM 开放排行榜

    Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式运行。该榜单整合超 20 个数据集,由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,旨在为日语 LLM 提供集中、开放的对比平台。

  2. Hugging Face Blog40

    BAAI 推出 FlagEval Debate:首个多语言 LLM 辩论竞赛平台

    BAAI 推出 FlagEval Debate 平台,让大模型以辩论形式直接对抗,目前支持英语、中文、阿拉伯语和韩语四种语言。平台采用专家评审与用户投票的双重评估机制,并提供开发者自定义参数功能,以解决静态评测和 Chatbot Arena 存在的判别力不足、模型孤立生成及投票偏差等问题。2024 年 Q3 的实验显示,当前多数模型已具备参与辩论的能力。

10月30日周三
10月23日周三
10月15日周二
10月10日周四
10月4日周五
  1. Hugging Face Blog28

    Hugging Face 推出 Open FinLLM Leaderboard:金融大模型专用评测榜单

    Hugging Face 发布 Open FinLLM Leaderboard,为金融场景提供专门的 LLM 评测框架,覆盖信息抽取、文本分析、问答、文本生成、风险管理、预测和决策七大类任务。榜单采用零样本评测,使用 Accuracy、F1、ROUGE 和 MCC 等指标,数据集来自金融行业真实挑战,如信用评分、欺诈检测和股价走势预测。

10月1日周二
  1. Hugging Face Blog22

    BenCzechMark:你的 LLM 能理解捷克语吗?

    Hugging Face 发布 BenCzechMark,首个面向捷克语的大语言模型综合评测套件,涵盖 9 大类共 50 项任务,其中 90% 为原生非翻译内容。配套榜单已收录超过 25 个不同规模的开源模型,任务采用 Acc、EM、AUROC、Ppl 等指标,并区分阅读理解、事实知识、捷克语理解、语言建模、数学推理、自然语言推理、命名实体识别、情感分析与文档检索等类别。

9月23日周一
8月13日周二
8月8日周四
7月25日周四
7月24日周三
7月18日周四
7月17日周三
7月11日周四
  1. Hugging Face Blog62

    NuminaMath 如何赢得首届 AIMO 进步奖

    Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AI 数学奥林匹克(AIMO)进步奖,在私有测试集 50 题中解出 29 题。

    推荐理由:获胜方案完整公开了两阶段微调、SC-TIR 解码与内部验证集设计,可迁移到其他推理类竞赛与模型训练。

7月1日周一
  1. Hugging Face Blog62

    Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准

    Hugging Face 用 transformers.agents 构建的 ReactCodeAgent 在 GAIA 验证集上取得 44.2%,排名第一,比第二名高 4 个百分点;测试集为 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。

    推荐理由:官方披露 Code Agent 在 GAIA 上的成绩与实现细节,可看到代码动作与多智能体编排的具体做法。

6月20日周四
6月18日周二
6月6日周四
5月24日周五
  1. Hugging Face Blog45

    Meta 发布 CyberSecEval 2:大语言模型网络安全风险与能力评估框架

    Meta 发布 CyberSecEval 2,用于评估 LLM 在生成不安全代码、协助网络攻击、提示注入、滥用代码解释器及自动化攻击能力等方面的表现。相比 2023 年 12 月的首版,LLM 协助网络攻击的平均合规率从 52% 降至 28%。提示注入仍是未解决问题,代码解释器滥用风险突出,全部代码已开源。

5月14日周二
5月5日周日
4月22日周一
4月20日周六
4月19日周五
4月16日周二
3月20日周三
  1. Hugging Face Blog62

    Cosmopedia:如何为 LLM 预训练构建大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超过 3000 万个文件、250 亿 token,目标是复现 Phi-1.5 的训练数据。

    推荐理由:Hugging Face 公开了从提示词构建到去污染、训练的完整合成数据流水线,可对照 Phi 系列的做法理解预训练数据如何规模化生成。