跳到正文

#开源生态

今日 4 条
2月12日周三
2月11日周二
  1. Hugging Face Blog62

    Open R1 发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face 的 Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,用 DeepSeek R1 为 NuminaMath 1.5 的 40 万道题各生成两个答案,共 80 万条推理轨迹,经 Math Verify 与 Llama3.3-70B-Instruct 过滤后保留 22 万道题。

    推荐理由:Open R1 项目公开了 220k 数学推理数据集的生成与过滤流程,读者可参考其本地推理与验证方法。

2月10日周一
  1. Hugging Face Blog31

    Hugging Face 发布 Open Arabic LLM Leaderboard 2

    Hugging Face 联合 2A2I、TII 推出 Open Arabic LLM Leaderboard 2,升级阿拉伯语大模型评测平台。初版 OALL 上线不到 7 个月吸引超 46,000 名访客,收到 180 多个机构提交的 700 多个模型,参数规模从 1B 到 70B 以上。新版回应社区对阿拉伯语专项任务直接评测、基准透明度和方言多样性数据集的诉求。

2月4日周二
2月2日周日
1月31日周五
1月30日周四
1月28日周二
  1. Hugging Face Blog62

    Hugging Face Hub 上线 Inference Providers,接入 fal、Replicate、SambaNova、Together AI

    Hugging Face 在 Hub 模型页上线 Inference Providers,首批接入 fal、Replicate、SambaNova、Together AI 四家无服务器推理服务商,并集成到 JS 和 Python 客户端 SDK。

    推荐理由:官方说明 Hub 模型页接入四家无服务器推理服务商,并给出 SDK 与路由代理的调用方式,便于判断接入成本。

1月27日周一
  1. Hugging Face Blog48

    Diffusers 中的开源视频生成模型现状

    Hugging Face 发文梳理开源视频生成模型现状,CogVideoX、Mochi-1、Hunyuan Video、Allegro、LTX Video 均已开放,而 Sora、Veo 2、Gen 3 Alpha、Kling、Pika 2.0、MiniMax 仍为闭源。文章指出开源模型受限于高算力成本、泛化能力不足和生成延迟,Diffusers 团队正从推理优化与微调两方面推进其规模化采用。

1月24日周五
  1. Hugging Face Blog62

    smolagents 新增视觉支持,可在智能体流程中原生使用 VLM

    Hugging Face 为 smolagents 加入视觉支持,可在智能体流程中原生使用视觉语言模型。图像既可在 run 方法中一次性传入并存入 TaskStep 的 task_images,也可通过 step_callbacks 回调在每步把截图写入 ActionStep 的 observation_images。

    推荐理由:官方给出两种向智能体传入图像的方式和回调写法,可直接迁移到浏览器自动化等视觉场景。

1月23日周四
  1. Hugging Face Blog60

    Hugging Face 发布 SmolVLM-256M 与 SmolVLM-500M 两个小尺寸视觉语言模型

    Hugging Face 发布 SmolVLM 家族新成员 SmolVLM-256M 和 SmolVLM-500M,共四个 checkpoint,含两个 base 模型和两个指令微调模型,可直接加载到 transformers、MLX 和 ONNX,并提供 transformers 与 WebGPU 演示。

    推荐理由:官方披露了从 2B 缩到 256M 与 500M 的取舍细节,可看到小模型在视觉编码器和 tokenization 上的具体权衡。

1月22日周三
1月16日周四
1月15日周三
1月13日周一
12月31日周二
12月23日周一
12月19日周四
12月18日周三
12月17日周二
  1. Hugging Face Blog62

    TII 发布 Falcon3 开源模型家族,含 1B 至 10B 五款基础模型

    阿布扎比技术创新研究院(TII)发布 Falcon3 开源模型家族,包含 Falcon3-1B-Base、3B-Base、Mamba-7B-Base、7B-Base 和 10B-Base 五款基础模型,全部在 100 亿参数以下。

    推荐理由:Falcon3 家族覆盖 1B 到 10B 五款模型,给出了训练数据规模与基准对比,可据此判断小尺寸开源模型的选型空间。

12月16日周一
12月9日周一
12月5日周四
  1. Hugging Face Blog27

    LLM 修复自身错误的能力如何?基于 Keras 与 TPU 的 chatbot arena 实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。

12月4日周三
  1. Hugging Face Blog29

    Hugging Face 推出 AraGen:基于 3C3H 的阿拉伯语 LLM 生成式评测基准与榜单

    Hugging Face 发布 AraGen,一个面向阿拉伯语 LLM 的生成式任务基准与榜单,采用新的 3C3H 评测指标,从正确性、完整性、简洁性、有用性、诚实性和无害性六个维度基于 LLM-as-judge 打分。榜单采用动态评测策略,数据集与评测代码先盲测三个月再公开,随后更换新私有基准,以缓解数据污染。该基准同时覆盖多轮与单轮场景,是这一语言无关评测框架的首次应用。

12月2日周一
11月26日周二
  1. Hugging Face Blog62

    Hugging Face 发布 SmolVLM:2B 视觉语言模型,显存占用为同类最低

    Hugging Face 发布 SmolVLM,一个 2B 参数的小型视觉语言模型家族,包含 Base、Synthetic 和 Instruct 三个版本,模型权重、数据集、训练配方与工具均以 Apache 2.0 协议开源。

    推荐理由:官方给出 2B 视觉语言模型的显存占用、吞吐与基准对比,可据此判断端侧多模态部署的可行边界。

  2. Hugging Face Blog28

    Hugging Face 重构 Hub 上传与下载架构

    Hugging Face 的 Xet 团队正在重新设计 Hub 的上传与下载架构,计划引入内容寻址存储(CAS)作为内容分发第一站,并基于"读简单、写智能"理念构建自定义协议。新架构在字节级别分析文件,对 tensor 文件(如 Safetensors)的压缩探索有望将上传速度提升 10-25%。CAS 节点将部署在 AWS 少数区域,以覆盖北美、欧洲和亚洲的主要上传流量。

11月25日周一
  1. Hugging Face Blog22

    如何一步步推导出 SOTA 位置编码 RoPE

    Hugging Face 博客通过逐步改进位置编码方案,最终推导出 Llama 3.2 及多数现代 Transformer 使用的 RoPE(旋转位置编码)。文章以 Llama 3.2 1B 为例演示:不加位置信息时,多头自注意力对同一 token 在不同位置的输出完全相同。作者提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。

11月20日周三
  1. Hugging Face Blog28

    Hugging Face 与 LLM-jp 联合推出日语 LLM 开放排行榜

    Hugging Face 与 LLM-jp 联合发布 Open Japanese LLM Leaderboard,用 llm-jp-eval 评测套件覆盖 16 项任务,从自然语言推理、机器翻译到代码生成与数学推理,均以 4-shot 方式运行。该榜单整合超 20 个数据集,由 LLM-jp 评测团队联合语言学家与标注人员构建或翻译调整,旨在为日语 LLM 提供集中、开放的对比平台。

11月18日周一
  1. Mistral AI75

    Mistral AI 发布 124B 开源多模态模型 Pixtral Large

    Mistral AI 发布 Pixtral Large,一个基于 Mistral Large 2 的 124B 开放权重多模态模型,含 123B 多模态解码器和 1B 参数视觉编码器,支持 128K 上下文窗口,可容纳至少 30 张高分辨率图像。

    推荐理由:原文给出 Pixtral Large 的基准成绩与开放权重许可,读者可据此判断开源多模态模型与闭源前沿模型的差距。

11月12日周二
  1. Hugging Face Blog22

    在 Hugging Face Hub 上分享你的开放机器学习数据集

    Hugging Face Hub 支持托管 TB 级数据集,并提供 Dataset Viewer、全文搜索、SQL Console 及 Pandas、DuckDB 等第三方库的一行代码加载支持。Xet 团队正将单文件上限从 50 GB 提升至 500 GB,同时改进存储与传输效率。数据集可设为公开、私有或门控访问,Nvidia、Google、NASA 等机构已在使用该平台。

11月5日周二
11月4日周一
10月24日周四
  1. Hugging Face Blog62

    Cohere For AI 发布 Aya Expanse 8B 与 32B 多语言模型

    Cohere For AI 发布 Aya Expanse 系列多语言模型,包含 8B 和 32B 两个参数版本,并以开放权重形式提供给研究社区。在成对比较中,Aya Expanse 32B 优于 Gemma 2 27B、Mistral 8x22B 和参数量超过其两倍的 Llama 3.1 70B;Aya Expanse 8B 在同参数级别中胜率为 60.4% 至 70.6%。

    推荐理由:Cohere For AI 公开了 Aya Expanse 的完整后训练流程,读者可了解多语言模型如何用数据套利、偏好训练与模型合并提升表现。