跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

263条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 81–100 条 · 共 263 条
2月4日周三
  1. Hugging Face Blog62

    Hugging Face 推出 Community Evals,让基准数据集托管排行榜

    Hugging Face 推出 Community Evals,基准数据集仓库现在可以注册为 benchmark 并托管排行榜,模型仓库通过 .eval_results/*.yaml 存储自己的评测分数,任何用户都能以 PR 形式提交结果。

    推荐理由:Hugging Face 把评测结果从黑箱榜单搬到 Hub 仓库,读者可据此理解社区化评测的运作方式。

1月29日周四
  1. Hugging Face Blog62

    Gradio 团队开源 Daggr:用 Python 串联应用并可视化检查

    Gradio 团队发布开源 Python 库 Daggr,用于把 Gradio 应用、ML 模型和自定义函数串成 AI 工作流,并自动生成可视化画布。画布可查看任意节点的中间输出、修改输入并单独重跑某一步,无需执行整条流水线,还支持状态持久化和备份节点替换。

    推荐理由:Gradio 团队开源 Daggr,用代码定义工作流并自动生成可视化画布,可单独重跑某一步,为多模型串联调试提供了新选择。

1月20日周二
  1. Hugging Face Blog71

    Overworld 发布 Waypoint-1 实时交互视频扩散模型

    Overworld 发布实时交互视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘控制,权重已上线 Hugging Face Hub,Waypoint-1-Small 为 2.3B,Medium 版本即将推出。

    推荐理由:原文给出模型规模、训练数据量与推理库性能数字,可据此判断实时交互视频生成在消费级硬件上的可行性。

1月14日周三
1月6日周二
1月5日周一
  1. Hugging Face Blog60

    TII 发布 Falcon-H1-Arabic:3B、7B、34B 混合 Mamba-Transformer 阿拉伯语模型

    TII 发布 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三个参数版本,采用在每个 block 内并行运行 Mamba 状态空间模型与 Transformer 注意力的 Falcon-H1 混合架构。

    推荐理由:原文给出三个参数规模的架构、上下文窗口与基准对比,可据此判断阿拉伯语模型的部署选型。

12月16日周二
  1. Google DeepMind60

    Google DeepMind 发布 Gemma Scope 2,为 Gemma 3 全系列提供可解释性工具

    Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具,结合稀疏自编码器(SAE)与 transcoder 查看模型内部计算。

    推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并提供 SAE 与 transcoder,读者可据此了解模型可解释性工具的开源进展。

12月11日周四
  1. Hugging Face Blog62

    llama.cpp server 新增 router 模式,支持动态加载与切换多个模型

    llama.cpp server 新增 router 模式,无需重启即可动态加载、卸载和切换多个模型,实现类似 Ollama 的模型管理。该模式采用多进程架构,每个模型独立运行,单个模型崩溃不影响其他模型;模型按需加载,超过 --models-max(默认 4)时按 LRU 策略卸载最久未用的模型。

    推荐理由:llama.cpp server 新增 router 模式,读者可据此了解本地多模型热切换与显存回收的具体做法。

12月9日周二
  1. Mistral AI80

    Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布新一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

    推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附与闭源模型的对比评测,可据此判断开源编码智能体的当前水位。

12月4日周四
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3 系列模型,含 675B 参数的 Mistral Large 3

    Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。

    推荐理由:Mistral 3 一次性开源从 3B 到 675B 的完整模型族,读者可据此了解开源模型在参数规模与部署形态上的最新覆盖范围。

12月1日周一
11月25日周二
11月21日周五
10月29日周三
  1. Hugging Face Blog62

    Hugging Face 长文分析全球算力格局如何向中国倾斜

    Hugging Face 发布长文分析全球 AI 算力格局的变化,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。

    推荐理由:梳理美国出口管制与中国国产芯片、开源模型之间的因果链,并给出从硬件到软件栈的替代进展时间线。

10月27日周一
  1. Hugging Face Blog62

    Hugging Face 改进 datasets 流式加载,请求数减少 100 倍

    Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 接口保持不变,启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多提升 2 倍。

    推荐理由:官方给出流式加载的请求数、解析时间和吞吐变化,读者可据此判断大规模训练的数据管线是否值得切换。

  2. Hugging Face Blog62

    Hugging Face 发布 huggingface_hub v1.0,改用 httpx 并重做 hf CLI

    Hugging Face 发布 huggingface_hub v1.0,这是该库五年来的首个大版本,带来破坏性变更。主要变化包括后端从 requests 迁移到 httpx、全新的 hf CLI 取代已弃用的 huggingface-cli、文件传输全面改用 hf_xet 替代 hf_transfer。

    推荐理由:官方梳理了五年演进与 v1.0 的破坏性变更,读者可据此判断升级成本与迁移路径。