超越 LoRA:能否击败最流行的微调技术?
Hugging Face 在 PEFT 库中对比了 LoRA 之外的多种参数高效微调技术,并指出仅凭论文结果难以判断哪种技术最优。其统计显示,Hugging Face Hub 上提及单一 PEFT 技术的 20,834 个模型卡中有 20,509 个(98.4%)提到 LoRA,外部站点 10,000 个图像生成 checkpoint 中 7,111 个为 LoRA。
Hugging Face 在 PEFT 库中对比了 LoRA 之外的多种参数高效微调技术,并指出仅凭论文结果难以判断哪种技术最优。其统计显示,Hugging Face Hub 上提及单一 PEFT 技术的 20,834 个模型卡中有 20,509 个(98.4%)提到 LoRA,外部站点 10,000 个图像生成 checkpoint 中 7,111 个为 LoRA。
AWS 开源的 Strands Robots SDK(Apache 2.0)把 LeRobot 栈封装成 AgentTools,让一个 Strands 智能体在单次循环里完成仿真录制演示、推送 LeRobotDataset 到 Hub、跑策略、再以改一个关键字参数的方式部署到实体 SO-101,并通过 Zenoh 对等网格广播指令到多台机器人。
推荐理由:AWS 团队给出从 Hub 数据集到实体机器人的五步流程,可看到仿真与真机共用同一数据集格式的工程取舍。
PyTorch 性能剖析系列第二部分用 nn.Linear(bias=True)替换手写的 matmul-add,并堆叠三层加激活构成 MLP,在 NVIDIA A100-SXM4-80GB 上分析 profiler trace。
作者让编码智能体调用两个 Hugging Face Space,先由 ideogram-ai/ideogram4 生成六张巴黎地标图像,再由 VAST-AI/TripoSplat 从单图重建 3D Gaussian splat,最终拼装成可交互的静态 Space 画廊。
推荐理由:作者用一次真实搭建演示了如何让编码智能体串联两个 Space 完成图像到 3D 的流水线,方法可直接复用。
Hugging Face 发布教程,介绍如何保留 GitHub Actions 调度、把 CI 任务放到 Hugging Face Jobs 上运行,通过 huggingface/jobs-actions 桥接把 GitHub Actions 任务变成 HF Job 内的临时自托管 runner。
DharmaOCR 团队将 Direct Preference Optimization(DPO)用于结构化 OCR 任务,以正确转录为 chosen、退化循环为 rejected 构建偏好数据,在 SFT 之后追加第二阶段训练,使所有测试模型家族的文本退化率平均下降 59.4%,最高降幅 87.6%(Nanonets-OCR2-3B 从 1.61% 降至 0.20%)。
Hugging Face 发布 PyTorch 性能分析系列第一篇,讲解如何用 torch.profiler 分析矩阵乘法加法运算。
Hugging Face 让 Reachy Mini 机器人实现完全本地语音对话,无需云端和 API key。
Hugging Face 发布 AI Agent 术语表,聚焦常被混用的 harness、scaffold、agent、context engineering 等概念,并给出 Agent = Model + Harness 的实用心智模型。
Hugging Face 发文解析连续批处理中的异步化,指出默认同步批处理下 CPU 与 GPU 轮流工作,用 8B 模型、batch size 32 生成 8K tokens 时总耗时 300.6 秒,其中 24.0% 时间 GPU 处于空闲等待 CPU。
Hugging Face 发布系列文章,分析 AWS 基础设施如何与开源软件栈配合支撑基础模型全生命周期。
PipelineRL 在 vLLM V0 到 V1 迁移中通过修复四项问题让 V1 与 V0 参考对齐:processed_logprobs 语义、V1 专属运行时默认值、inflight 权重更新路径,以及最终投影所用的 fp32 lm_head。
OpenAI 本周在 Hugging Face Hub 发布开源 PII 检测模型 Privacy Filter,可在单次 128k 上下文前向传播中标注八类个人信息,采用 Apache 2.0 许可,1.5B 参数、50M 激活参数,在 PII-Masking-300k 基准上达到 SOTA。
推荐理由:文章给出三个基于 Privacy Filter 的可运行应用与 gradio.Server 前后端分工写法,可迁移到自己的 PII 脱敏工具。
Hugging Face 发布教程,讲解如何在 Manifest V3 约束下用 Transformers.js 在 Chrome 扩展中运行本地 AI 功能,并以官方发布的 Gemma 4 浏览器助手扩展为参照。
Sentence Transformers 现已支持训练和微调多模态嵌入与重排序模型,作者以 Qwen/Qwen3-VL-Embedding-2B 微调视觉文档检索(VDR)为例,微调后 NDCG@10 从基座的 0.888 提升至 0.947,超过其测试的所有现有 VDR 模型,包括参数量达其 4 倍的模型。
Hugging Face 发布了一个 Skill 和配套测试工具,帮助贡献者把 transformers 中的语言模型移植到 mlx-lm,使模型加入 transformers 后能较快在 MLX 上可用。
推荐理由:Hugging Face 公开了把 transformers 模型移植到 mlx-lm 的 Skill 与测试工具,读者可了解其流程与对评审者的减负方式。
OpenAI 发布指南,介绍如何用 ChatGPT 探索数据集、生成洞察、创建可视化,并将发现转化为可执行的决策。
OpenAI 发布面向初学者的 AI 基础指南,解释 AI 是什么、如何运作,以及 ChatGPT 这类工具如何使用大语言模型。内容为入门级科普,未涉及具体模型版本、参数或性能数据。
OpenAI 发布面向财务团队的 ChatGPT 工作流学习内容,覆盖财务分析、报告、规划与决策沟通等实用场景。内容聚焦如何将 ChatGPT 应用于财务日常工作流程。
OpenAI 发布指南,介绍如何用 ChatGPT 做研究:收集来源、分析信息,并生成结构化、带引用的洞察。
OpenAI 介绍在 ChatGPT 中处理文件的实用方法,涵盖从查找信息到整理、转换文档,以及将文件用于工作流等场景。
OpenAI 发布提示词基础指南,讲解如何写出清晰有效的提示词,从而让 ChatGPT 给出更好、更有用的回答。内容面向希望提升提示词技巧的用户,聚焦提示词撰写的基本原则。
OpenAI 发布指南,介绍如何用 ChatGPT 进行写作,完成内容的起草、修改与润色,并保持清晰的结构、语气和意图。
OpenAI 介绍如何用 ChatGPT 进行头脑风暴,把粗略想法整理成结构化、可执行的计划。内容涵盖激发创意与梳理思路,属于使用指南而非新功能发布。
Anthropic 正限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 建议将 OpenClaw、Pi、Open Code 等智能体迁移到开源模型。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Mistral 基于其开源编码助手 Vibe 搭建了一个自动编写 Rails RSpec 测试的智能体,可读取源码、生成或改进测试、按风格规则与覆盖率目标校验,并在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 搭建自动写 RSpec 测试智能体的完整方案,包括 AGENTS.md、skills 与自定义工具的具体做法和实测数据。
Hugging Face 调研了 16 个围绕异步训练构建的开源 RL 库,并按编排原语、缓冲区设计、权重同步协议、staleness 管理、部分 rollout 处理、LoRA 支持、分布式训练后端 7 个维度进行对比。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成文本到图像扩散模型训练,并开源训练代码与实验框架。该方案采用 x-prediction 在像素空间直接训练、无需 VAE,并叠加 LPIPS 与 DINOv2 感知损失、TREAD token 路由、REPA 表征对齐和 Muon 优化器。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出从安装 Skill 到提交 HF Jobs 的完整命令与成本表,可据此估算小模型微调的实际开销。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
OpenAI 技术团队成员 Ryan Lopopolo 提出 Harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 Codex 构建工程实践,而非模型本身的能力。
Hugging Face 公布 PRX-1.2B 文本到图像模型的训练消融实验,在 100k 步、256×256 分辨率、全局 batch size 256 的 Flow Matching 基线上,系统对比表征对齐、训练目标、token 路由与稀疏化、数据四类技巧对收敛与效率的影响。
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。