跳到正文

全部动态

今日 4 条
5月23日周五
5月21日周三
  1. Hugging Face Blog62

    Hugging Face 发布 nanoVLM:用纯 PyTorch 训练视觉语言模型的最简仓库

    Hugging Face 发布 nanoVLM,一个用纯 PyTorch 训练视觉语言模型(VLM)的轻量工具包,可在免费 Colab 上启动训练。其视觉骨干采用 Google 的 SigLIP 编码器,语言骨干沿用 Llama 3 架构,两者通过 Modality Projection 模块对齐,训练目标为视觉问答。

    推荐理由:官方给出 nanoVLM 的架构选择与训练流程,读者可据此在免费 Colab 上跑通一个 VLM。

5月12日周一
5月11日周日
  1. Hugging Face Blog36

    LeRobot 社区数据集:机器人领域的“ImageNet”——何时实现、如何实现?

    Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。

4月30日周三
  1. Hugging Face Blog62

    如何用 Gradio 构建 MCP Server

    Gradio 官方教程介绍如何用几行 Python 把 Gradio 应用变成 MCP Server,只需在 launch() 中设置 mcp_server=True,函数即被自动转换为 LLM 可调用的工具,docstring 会生成工具描述和参数。

    推荐理由:Gradio 官方给出把任意 Python 函数变成 MCP 工具的最短路径,可据此判断自家应用接入 LLM 工具调用的成本。

4月29日周二
4月26日周六
4月25日周五
4月23日周三
  1. Hugging Face Blog35

    TNG 微调 olmOCR-7B-0225-preview,打造忠实还原页眉页脚的 OCR 引擎

    TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决了原模型为生成训练数据而忽略页眉页脚信息的问题。团队用 Qwen2.5-VL-72B-Instruct 生成 8000 份文档数据集,在 8xH100 节点上训练 2.5 个 epoch,使模型能完整提取发票等文档的页眉页脚内容并保留表格解析能力。微调模型已在 Hugging Face 开源。

4月16日周三
4月9日周三
4月4日周五
4月3日周四
4月2日周三
3月31日周一
  1. Hugging Face Blog22

    Hugging Face 如何用 Infisical 扩展 AI 基础设施的密钥管理

    Hugging Face 将密钥管理从 AWS 单云方案迁移至 Infisical,以支撑其 Hub 上超 400 万构建者的多云端(Azure、GCP)环境。团队通过 Infisical Kubernetes Operator 自动同步密钥更新,并借助 Okta 集成实现细粒度 RBAC,取代了不安全的本地 .env 文件。工程师仍偏好手动重新部署,以应对每分钟超 1000 万请求的高流量场景。

3月26日周三
3月20日周四
3月7日周五
3月4日周二
2月28日周五
2月13日周四
2月12日周三
1月31日周五
1月30日周四
1月27日周一
  1. Hugging Face Blog48

    Diffusers 中的开源视频生成模型现状

    Hugging Face 发文梳理开源视频生成模型现状,CogVideoX、Mochi-1、Hunyuan Video、Allegro、LTX Video 均已开放,而 Sora、Veo 2、Gen 3 Alpha、Kling、Pika 2.0、MiniMax 仍为闭源。文章指出开源模型受限于高算力成本、泛化能力不足和生成延迟,Diffusers 团队正从推理优化与微调两方面推进其规模化采用。

1月23日周四
1月16日周四
1月15日周三
12月24日周二
12月23日周一
12月17日周二
12月5日周四
  1. Hugging Face Blog27

    LLM 修复自身错误的能力如何?基于 Keras 与 TPU 的 chatbot arena 实验

    Hugging Face 用 Keras、JAX 和 TPU 搭建了一个 chatbot arena,让多个 LLM 同时处理同一段日历 API 调用对话,测试它们在用户用自然语言指出错误后能否修正代码。实验在 TPU v5e 2x4 上以 bfloat16 同时加载了 5 个约 8B 参数模型和 3 个约 2B 参数模型,共 7 个 LLM,通过 Gradio Spaces 界面并行对话。

12月3日周二
12月2日周一
11月25日周一
  1. Hugging Face Blog22

    如何一步步推导出 SOTA 位置编码 RoPE

    Hugging Face 博客通过逐步改进位置编码方案,最终推导出 Llama 3.2 及多数现代 Transformer 使用的 RoPE(旋转位置编码)。文章以 Llama 3.2 1B 为例演示:不加位置信息时,多头自注意力对同一 token 在不同位置的输出完全相同。作者提出位置编码应满足唯一性、线性关系、长度泛化、确定性生成和可扩展至多维等五项理想属性。

11月20日周三