跳到正文

全部动态

今日 4 条
10月28日周二
  1. Hugging Face Blog40

    Hugging Face 提出“语音同意门”:让声音克隆必须先获得本人同意

    Hugging Face 提出“语音同意门”机制,让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆。该方案用语言模型为每次授权生成一对全新句子,一句表达明确同意并包含模型名,另一句提供语音多样性,从而支持可追溯、可审计的授权流程。官方同时发布了示例 Space 和配套代码。

10月21日周二
10月16日周四
10月15日周三
10月2日周四
9月29日周一
9月23日周二
9月22日周一
9月11日周四
  1. Hugging Face Blog62

    Hugging Face 详解 transformers 为 gpt-oss 引入的六项优化技巧

    Hugging Face 发布博客,介绍为支持 OpenAI gpt-oss 系列而在 transformers 中引入的多项升级,包括可从 Hub 下载的零构建内核、MXFP4 量化、张量并行、专家并行、动态滑动窗口层与缓存、连续批处理与 Paged Attention,以及更快的模型加载。

    推荐理由:Hugging Face 官方拆解了为 gpt-oss 引入的六项 transformers 升级,读者可据此了解这些优化如何迁移到其他模型。

9月10日周三
9月2日周二
8月19日周二
8月18日周一
8月8日周五
8月7日周四
  1. Hugging Face Blog60

    TRL 为视觉语言模型加入 MPO、GRPO、GSPO 等对齐方法

    Hugging Face 的 TRL 新增面向视觉语言模型的对齐支持,包括混合偏好优化 MPO、多模态 GRPO 以及 Qwen 提出的 GSPO,并扩展 RLOO 和 Online DPO 到 VLM。

    推荐理由:TRL 把 MPO、GRPO、GSPO 等对齐方法扩展到视觉语言模型,并给出可直接运行的训练脚本,读者可据此判断多模态后训练的工具选择。

8月1日周五
7月31日周四
  1. Hugging Face Blog38

    用 Python 实现 MCP 服务器:基于 Gradio 的 AI 购物助手

    Hugging Face 博客演示了如何用 Gradio 的 MCP 集成在 Python 中搭建 AI 购物助手,将 Python 函数自动转换为 LLM 可调用的 MCP 工具。该助手结合 IDM-VTON 扩散模型实现虚拟试衣,并通过 VS Code AI Chat 接入 vton 与 playwright 两个 MCP 服务器,让 LLM 能浏览线上服装店并生成试穿效果图。

7月25日周五
7月23日周三
7月10日周四
  1. Hugging Face Blog40

    Hugging Face 详解异步机器人推理:解耦动作预测与执行

    Hugging Face 发布博客详解异步推理,将机器人动作预测与执行解耦为 PolicyServer 和 RobotClient 两个进程,通过 gRPC 通信(比 REST API 快约 5 倍),让机器人在计算下一段动作时持续执行当前动作。该方法在 SmolVLA 中引入,任务完成时间提速约 2 倍且成功率相当,适用于 ACT、OpenVLA、PI0 等输出动作块的策略。

7月9日周三
7月8日周二
7月1日周二
6月19日周四
  1. Hugging Face Blog62

    在消费级硬件上用 QLoRA 微调 FLUX.1-dev

    Hugging Face 发布教程,介绍用 diffusers 库以 QLoRA 在单张 GPU 上微调 FLUX.1-dev,峰值显存约 10GB 以下。在 RTX 4090 上,QLoRA 峰值显存约 9GB,标准 BF16 LoRA 需 26GB,700 步训练约 41 分钟。

    推荐理由:给出在单张消费级 GPU 上微调 FLUX.1-dev 的完整配置与显存对比,方法可直接复用。

6月12日周四
6月4日周三
6月3日周二
5月25日周日
5月23日周五
5月21日周三
  1. Hugging Face Blog62

    Hugging Face 发布 nanoVLM:用纯 PyTorch 训练视觉语言模型的最简仓库

    Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,可在免费 Colab 上启动训练。其视觉骨干采用 Google 的 SigLIP 编码器,语言骨干沿用 Llama 3 架构,两者通过 Modality Projection 模块对齐,训练目标为视觉问答。

    推荐理由:官方给出 nanoVLM 的架构选择与训练流程,读者可据此在免费 Colab 上跑通一个 VLM。

5月12日周一