跳到正文

开源生态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

263条精选相关主题模型发布Hugging FaceAI 编码

最新精选

第 121–140 条 · 共 263 条
6月19日周四
  1. Hugging Face Blog62

    在消费级硬件上用 QLoRA 微调 FLUX.1-dev

    Hugging Face 发布教程,介绍用 diffusers 库以 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。

    推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。

6月12日周四
6月10日周二
6月3日周二
  1. Hugging Face Blog71

    H Company 发布 GUI 自动化 VLM 系列 Holo1 与基准 WebClick

    H Company 发布 Holo1 系列 Action VLM 及多模态定位基准 WebClick,模型已开源在 Hugging Face。该系列包含 Holo1-3B 和 Holo1-7B,其中 7B 在常见 UI 定位基准上平均准确率达 76.2%,为小尺寸模型中最高。

    推荐理由:Holo1 开源了 GUI 定位模型与配套基准,读者可据此评估浏览器自动化在成本与精度上的取舍。

5月21日周三
  1. Mistral AI73

    Mistral AI 发布智能体编码模型 Devstral,Apache 2.0 开源

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SoTA 模型高出 6 个百分点以上。

    推荐理由:Mistral 与 All Hands AI 合作的智能体编码模型,给出 SWE-Bench Verified 成绩与本地部署门槛,便于判断开源编码模型的当前水平。

  2. Hugging Face Blog62

    Hugging Face 发布 nanoVLM:用纯 PyTorch 训练视觉语言模型的最简仓库

    Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,可在免费 Colab 上启动训练。其视觉骨干采用 Google 的 SigLIP 编码器,语言骨干沿用 Llama 3 架构,两者通过 Modality Projection 模块对齐,训练目标为视觉问答。

    推荐理由:官方给出 nanoVLM 的架构选择与训练流程,读者可据此在免费 Colab 上跑通一个 VLM。

5月15日周四
  1. Hugging Face Blog62

    Falcon-Edge 发布 1B 与 3B 三值量化语言模型系列

    Falcon-Edge 系列发布,基于 BitNet 架构,提供 1B 和 3B 两种规模,每种规模都有 base 与指令微调版本,权重以三值格式({-1, 0, 1})提供。

    推荐理由:Falcon-Edge 用一次预训练同时产出 bfloat16 与三值量化版本,并给出可直接微调的权重与工具包,读者可据此判断 1.58bit 模型的落地路径。

  2. Hugging Face Blog62

    Hugging Face 将 Transformers 定位为跨框架模型定义标准

    Hugging Face 宣布将 Transformers 打造为跨框架的模型定义中枢,模型架构只要被 Transformers 支持,就能在生态其他工具中获得支持。目前 Transformers 已支持 300+ 模型架构,平均每周新增约 3 个,并与 vLLM、SGLang、TGI 等推理引擎及 llama.cpp、MLX 打通互操作。官方还计划简化建模代码、弃用冗余组件,降低社区贡献门槛。

    推荐理由:Hugging Face 官方说明 Transformers 将作为跨框架的模型定义中枢,读者可据此理解模型一次贡献、多引擎复用的生态走向。

4月14日周一
4月5日周六
  1. Hugging Face Blog85

    Llama 4 Maverick 与 Scout 上线 Hugging Face

    Meta 发布 Llama 4 Maverick(约 400B 总参数)与 Llama 4 Scout(约 109B 总参数),两者均为 17B 激活参数的 MoE 模型,原生支持文本与图像输入,并已在 Hugging Face Hub 上线。

    推荐理由:Hugging Face 官方给出 Llama 4 两款 MoE 模型的架构细节与部署入口,可据此判断长上下文与多模态的落地条件。

3月27日周四
3月18日周二
3月12日周三
  1. Hugging Face Blog80

    Google 发布 Gemma 3 开源模型:多模态、多语言、128k 上下文

    Google 发布 Gemma 3 系列开放权重模型,提供 1B、4B、12B、27B 四种规模,含预训练与指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k,1B 版本为纯文本、32k 上下文。

    推荐理由:梳理 Gemma 3 的四种规模、多模态与 128k 上下文改动,并给出 transformers、MLX、llama.cpp 的落地路径。

3月11日周二
  1. Hugging Face Blog70

    Hugging Face 与 Yaak 发布 L2D:全球最大开源自动驾驶数据集

    Hugging Face 的 LeRobot 团队与 Yaak 联合发布 L2D(Learning to Drive),称其为全球最大的开源自动驾驶数据集,包含 90+ TB 多模态数据、5000+ 小时驾驶记录,来自德国 30 座城市的 60 辆驾校车辆。

    推荐理由:L2D 以 90TB 多模态驾驶数据补齐端到端自动驾驶训练集缺口,并直接接入 LeRobot 训练管线。

3月4日周二
2月25日周二
  1. Hugging Face Blog62

    Hugging Face 发布 FastRTC:面向 Python 的实时通信库

    Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的实时通信库。它内置自动语音检测与轮次切换、WebRTC 版 Gradio UI、WebSocket 支持,并可通过 fastphone() 获取免费电话号码接入音频流。库还提供语音转文字、文字转语音和停用词检测等工具,可挂载到任意 FastAPI 应用部署。

    推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。