跳到正文

#Hugging Face

今日 0 条
2月12日周三
2月11日周二
  1. Hugging Face Blog62

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个答案,共 80 万条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万道题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的生成与过滤流程,读者可参考其本地推理与验证方法。

2月10日周一
  1. Hugging Face Blog31

    Hugging Face 发布 Open Arabic LLM Leaderboard 2

    Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测平台。初版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 180 多个机构提交的 700 多个模型,参数规模从 1B 到 70B 以上。新版回应社区对阿拉伯语专项任务直接评测、基准透明度和方言多样性数据集的诉求。

2月4日周二
  1. Hugging Face Blog38

    Adyen 与 Hugging Face 联合发布 DABstep:多步推理数据智能体基准

    Adyen 与 Hugging Face 联合推出 DABstep,一个面向多步推理的数据分析智能体基准,包含 450+ 个源自 Adyen 真实业务的数据分析任务。评测显示,当前最强的推理型智能体准确率仅 16%,凸显模型在真实数据分析场景中的巨大差距。该基准同时包含结构化与非结构化数据,任务答案采用二元判定,仅需代码执行环境即可运行并提交至实时排行榜。

2月2日周日
1月31日周五
1月30日周四
1月28日周二
  1. Hugging Face Blog62

    Hugging Face Hub 上线 Inference Providers,接入 fal、Replicate、SambaNova、Together AI

    Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。

    推荐理由:官方说明 Hub 模型页接入四家无服务器推理服务商,并给出 SDK 与路由代理的调用方式,便于判断接入成本。

1月27日周一
  1. Hugging Face Blog48

    Diffusers 中的开源视频生成模型现状

    Hugging Face 发文梳理开源视频生成模型现状,CogVideoX、Mochi-1、Hunyuan Video、Allegro、LTX Video 均已开放,而 Sora、Veo 2、Gen 3 Alpha、Kling、Pika 2.0、MiniMax 仍为闭源。文章指出开源模型受限于高算力成本、泛化能力不足和生成延迟,Diffusers 团队正从推理优化与微调两方面推进其规模化采用。

1月24日周五
  1. Hugging Face Blog62

    smolagents 新增视觉支持,可在智能体流程中原生使用 VLM

    Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 回调在每步把截图写入 ActionStep 的 observation_images。

    推荐理由:官方给出两种向智能体传入图像的方式和回调写法,可直接迁移到浏览器自动化等视觉场景。

1月23日周四
  1. Hugging Face Blog60

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 两个小尺寸视觉语言模型

    Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX,并提供 transformers 与 WebGPU 演示。

    推荐理由:官方披露了从 2B 缩到 256M 与 500M 的取舍细节,可看到小模型在视觉编码器和 tokenization 上的具体权衡。

1月22日周三
1月16日周四
1月15日周三
1月13日周一
  1. Hugging Face Blog22

    Hugging Face 发文《AI Agents Are Here. What Now?》:建议不要开发完全自主的 AI 智能体

    Hugging Face 发布文章《AI Agents Are Here. What Now?》,指出 AI 智能体的风险随自主性等级上升而增加,建议不要开发能自行编写并执行代码的完全自主智能体。文章按自主程度将智能体分为五级,从模型不影响程序流程到模型自行编写并执行新代码,并认为半自主智能体在自主性水平、可用任务和人类控制方式合适时,收益可能大于风险。

1月10日周五
1月9日周四
  1. Hugging Face Blog29

    Hugging Face 开放 LLM 排行榜新增 CO₂ 排放数据:社区微调模型更低碳

    Hugging Face 在 Open LLM Leaderboard 中新增模型推理的 CO₂ 排放估算,基于 2024 年 6 月以来对 3000 多个模型的评测数据。分析覆盖 Gemma、Llama、Mistral、Mixtral、Phi、Qwen2 等 2742 个模型,发现社区微调或合并模型通常比其官方基座模型更低碳,而部分 MoE 模型因推理时间过长导致排放高于预期。

12月31日周二
12月23日周一
12月19日周四
12月18日周三
12月17日周二
  1. Hugging Face Blog62

    TII 发布 Falcon3 开源模型家族,含 1B 至 10B 五款基础模型

    阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。

    推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。

12月16日周一
12月10日周二
12月9日周一
12月5日周四
  1. Hugging Face Blog27

    LLM 修复自身错误的能力如何?基于 Keras 与 TPU 的 chatbot arena 实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。

12月4日周三
  1. Hugging Face Blog29

    Hugging Face 推出 AraGen:基于 3C3H 的阿拉伯语 LLM 生成式评测基准与榜单

    Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与榜单,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度基于 LLM-as-judge 打分。榜单采用动态评测策略,数据集与评测代码先盲测三个月再公开,随后更换新私有基准,以缓解数据污染。该基准同时覆盖多轮与单轮场景,是这一语言无关评测框架的首次应用。

12月3日周二
12月2日周一
11月26日周二
  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM:2B 视觉语言模型,显存占用为同类最低

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。

    推荐理由:官方给出 2B 视觉语言模型的显存占用、吞吐与基准对比,可据此判断端侧多模态部署的可行边界。