跳到正文

#开源/仓库

今日 0 条
10月2日周五
  1. Hugging Face Blog62

    Ai2 开源科学报告生成模型 AstaBrief 8B

    Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 训练,已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。

    推荐理由:原文给出了从 Qwen3-8B 出发的 SFT 与 DPO 数据构造细节,以及引用密度过滤带来增益的对比经验。

9月3日周四
9月1日周二
8月13日周四
6月1日周一
  1. Hugging Face Blog62

    JetBrains 发布 Mellum2:12B MoE 模型,Apache 2.0 开源

    JetBrains 发布 Mellum2,一个从零训练的 12B 参数 Mixture-of-Experts 模型,覆盖自然语言与代码,每个 token 仅激活 2.5B 参数,以 Apache 2.0 许可开源。官方称其面向路由、RAG、摘要、子智能体和高吞吐编码等低延迟场景,相比同规模模型推理速度提升 2 倍以上。模型已在 Hugging Face 开放下载,架构、训练与评测细节见技术报告。

    推荐理由:JetBrains 开源 12B MoE 模型,激活 2.5B 参数并主打 2 倍以上推理速度,可据此判断轻量模型在 RAG 与子智能体中的定位。

5月20日周三
5月19日周二
5月15日周五
9月12日周五
9月9日周二
7月16日周三
  1. Hugging Face Blog32

    Hugging Face 发布 Ettin Suite:同配方训练的 SoTA 配对编码器与解码器

    Hugging Face 推出 Ettin Suite,这是首个用相同数据(2T tokens)、架构和训练配方训练的 SoTA 配对编码器与解码器模型系列,参数规模覆盖 17M 至 1B。其编码器全面超越 ModernBERT,解码器则击败或持平 Llama 3.2 1B 与 SmolLM2。该系列首次实现两种架构的公平对比,结果显示编码器在分类与检索任务占优,解码器在生成任务领先。

7月10日周四
1月10日周五
7月16日周二
1月19日周五
5月4日周四
  1. Hugging Face Blog78

    BigCode 发布 StarCoder:15B 参数开源代码大模型

    Hugging Face 与 ServiceNow 联合主导的 BigCode 发布 StarCoder 与 StarCoderBase,两个代码大模型基于 GitHub 上许可宽松的数据训练,覆盖 80 多种编程语言,参数量约 15B、训练 1 万亿 token。

    推荐理由:官方给出 StarCoder 的参数量、训练数据与 HumanEval 对比表,可据此判断开源代码模型当时的位置。

3月28日周一