OpenAI 分享面向销售团队的 ChatGPT 工作流
OpenAI 发布面向销售团队的 ChatGPT 实用工作流,覆盖客户调研、会议准备、外联沟通、销售管道复盘与销售执行等环节。
OpenAI 发布面向销售团队的 ChatGPT 实用工作流,覆盖客户调研、会议准备、外联沟通、销售管道复盘与销售执行等环节。
OpenAI 发布指南,介绍使用 ChatGPT 等工具时在安全、准确性和透明度方面的最佳实践,以帮助用户负责任地使用 AI。
Anthropic 正限制 Pro/Max 订阅者在开放智能体平台中访问 Claude 模型,Hugging Face 建议将 OpenClaw、Pi、Open Code 等智能体迁移到开源模型。
NVIDIA 发布教程,介绍用单张 GPU 在不到一天内把通用嵌入模型微调为领域专用模型,全程无需人工标注。流程基于 NeMo Data Designer 生成合成问答对、用难负样本挖掘做对比学习,微调 Llama-Nemotron-Embed-1B-v2,在 NVIDIA 公开文档数据集上 Recall@10 与 NDCG@10 提升超过 10%。
推荐理由:NVIDIA 公开了从合成数据生成到 NIM 部署的完整嵌入模型微调流程,并给出可复现的评测数字。
Mistral 基于其开源编码助手 Vibe 搭建了一个自动编写 Rails RSpec 测试的智能体,可读取源码、生成或改进测试、按风格规则与覆盖率目标校验,并在 CI/CD 中无人干预运行。
推荐理由:Mistral 公开了用 Vibe 搭建自动写 RSpec 测试智能体的完整方案,包括 AGENTS.md、skills 与自定义工具的具体做法和实测数据。
Hugging Face 调研了 16 个围绕异步训练构建的开源 RL 库,并按编排原语、缓冲区设计、权重同步协议、staleness 管理、部分 rollout 处理、LoRA 支持、分布式训练后端 7 个维度进行对比。
Snowflake AI Research 的 Ulysses 序列并行(属于 ALST 协议)通过注意力头并行把注意力计算分散到多张 GPU,支持百万级 token 上下文训练。
Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。
Hugging Face 博客发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成文本到图像扩散模型训练,并开源训练代码与实验框架。该方案采用 x-prediction 在像素空间直接训练、无需 VAE,并叠加 LPIPS 与 DINOv2 感知损失、TREAD token 路由、REPA 表征对齐和 Muon 优化器。
Hugging Face 发布博客,讲解 transformers 库为支持 MoE 稀疏架构所做的工程改造,涵盖权重加载重构、专家后端、专家并行和 MoE 训练四个方面。
推荐理由:Hugging Face 官方拆解 transformers 为 MoE 重做的权重加载、专家后端与并行方案,并给出 v4 与 v5 的加载耗时对比。
Hugging Face 发布教程,介绍如何通过 Claude Code、Codex 等编码智能体,用 Unsloth 和 Hugging Face Jobs 微调 LiquidAI/LFM2.5-1.2B-Instruct。
推荐理由:原文给出从安装 Skill 到提交 HF Jobs 的完整命令与成本表,可据此估算小模型微调的实际开销。
Hugging Face 构建了一个 agent skill,教编码智能体编写生产级 CUDA kernel,并用 Claude 和 Codex 在 diffusers 与 transformers 两个真实目标上端到端生成了可用的 kernel、PyTorch 绑定和基准测试。
推荐理由:Hugging Face 把 CUDA kernel 开发知识打包成 agent skill,并给出两个真实目标的端到端基准数据,可迁移到其他领域技能设计。
Meta 与 Hugging Face 联合推出的开源框架 OpenEnv 用于在真实系统而非模拟环境中评测 AI 智能体,Turing 为其贡献了生产级日历管理环境 Calendar Gym。
OpenAI 技术团队成员 Ryan Lopopolo 提出 Harness engineering,探讨在智能体优先的世界中如何利用 Codex。文章聚焦于围绕 Codex 构建工程实践,而非模型本身的能力。
Hugging Face 公布 PRX-1.2B 文本到图像模型的训练消融实验,在 100k 步、256×256 分辨率、全局 batch size 256 的 Flow Matching 基线上,系统对比表征对齐、训练目标、token 路由与稀疏化、数据四类技巧对收敛与效率的影响。
Hugging Face 发布新工具 upskill,用大模型生成并评测 agent skill,再交给小模型使用。
推荐理由:原文给出用大模型生成 Skill 再迁移到小模型的完整流程与评测命令,可迁移到其他专业任务。
Hugging Face 团队用 verl 框架对 GPT-OSS-20B 做智能体强化学习训练,发现 KL 散度和熵爆炸、奖励不升,根因是 MoE 架构下双前向传播导致新旧 log-prob 不匹配、破坏 PPO 的 on-policy 一致性。团队通过修复 attention sink 和 MoE log-prob 对齐解决该问题,该修复同样适用于 GPT-OSS-120B。
OpenAI 发布 Codex 智能体循环技术解析,说明 Codex CLI 如何借助 Responses API 编排模型、工具、提示词与性能。文章为技术深度剖析,未披露新版本号、参数规模或 benchmark 数据。
OpenAI 发文介绍其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。文中提到的主要手段包括副本、缓存、限流和工作负载隔离。
Mistral AI 团队在预生产测试中发现,Mistral Medium 3.1 在 vLLM 上启用图编译并采用 NIXL 的 Prefill/Decode 分离式部署时,系统内存以每分钟 400 MB 线性增长,数小时后触发 out of memory。
Netomi 借助 GPT-4.1 和 GPT-5.2 扩展企业级 AI 智能体,通过并发、治理与多步推理支撑可靠的生产工作流。该方案面向企业规模化部署场景,强调智能体系统在生产环境中的稳定性。
NVIDIA 在 CES 2026 发布博客,给出用 DGX Spark 加 Reachy Mini 复现黄仁勋主题演讲中桌面智能体的分步教程,源码已开源。
推荐理由:完整复现路径覆盖模型选型、路由与工具调用,可据此搭一套本地私有桌面智能体。
Hugging Face 在 Transformers v5 中重构了 tokenizer 设计,将 tokenizer 架构与训练好的词表分离,类似 PyTorch 将网络架构与学习权重分离。v5 提供更清晰的内部结构、干净的类层级和单一快速后端,让用户能检查、定制或从零训练模型专属 tokenizer,而非将其视为黑盒。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验:微调 Qwen3-0.6B、用 HumanEval 评测、生成训练报告并导出 GGUF。
推荐理由:以完整实验流程展示编码智能体如何端到端完成微调、评测与部署,可迁移到自己的训练任务。
Hugging Face 发布博客,从 attention 机制与 KV caching 出发,通过优化吞吐量推导出 continuous batching。该方法通过并行处理多个对话、完成即换出,来提升高负载场景下的推理性能。文中指出 attention 是 token 间唯一交互之处,其计算量随序列长度呈平方增长。
Hugging Face 分享构建 SOTA 深度研究智能体的经验:七个月前其首版架构因假设过于复杂,在新一代模型到来后成为瓶颈,被迫推倒重建。团队转向更简化的编排逻辑并依赖模型自主性,同时借助 Tavily Advanced Search 在工具侧完成上下文工程,只返回最相关内容块以降低幻觉与延迟。
OpenAI 发文阐述 evals 如何帮助企业定义、衡量并改进 AI 表现,从而降低风险、提升生产力并形成战略优势。
Hugging Face 的 kernels 库支持用 kernel-builder 构建并分享 ROCm 内核,可集成进 PyTorch 工作流。指南以 RadeonFlow GEMM 内核为例,该内核针对 AMD Instinct MI300X 优化,采用 FP8 e4m3fnuz 格式与分块缩放,曾获 AMD Developer Challenge 2025 大奖。
MiniMax M2 在 post-training 的智能体对齐阶段提出,智能体泛化不只是适配新工具,而是要在工具信息、系统提示词、用户提示词、环境和工具返回等全流程扰动下保持稳定。团队因此采用 Interleaved Thinking,让思考过程贯穿任务全程而非仅在开头,并构建了面向全轨迹泛化的数据管线。M2 用户需保留包含思考步骤的完整会话历史,否则会出现性能差距。
NVIDIA Isaac for Healthcare v0.4 发布基于 SO-ARM 的端到端入门工作流,开发者可用 LeRobot 采集数据、微调 GR00T N1.5、在 IsaacLab 评估后部署到真实硬件。
NVIDIA 发布 Isaac for Healthcare v0.4,提供基于 SO-ARM 的端到端入门工作流,覆盖数据采集、GR00T N1.5 后训练与真机部署。该流程中超过 93% 的训练数据由仿真合成生成,混合约 70 个仿真 episode 与 10-20 个真实 episode,可在单台 DGX Spark 上完成仿真、训练与部署。
Hugging Face 提出“语音同意门”机制,让模型只有在说话人明确说出同意语句并被 ASR 识别后才启动声音克隆。该方案用语言模型为每次授权生成一对全新句子,一句表达明确同意并包含模型名,另一句提供语音多样性,从而支持可追溯、可审计的授权流程。官方同时发布了示例 Space 和配套代码。
Hugging Face 发布指南,介绍如何用 Chandra、OlmOCR-2 等开源权重 OCR 模型搭建文档处理流水线,并给出各模型的 OlmOCR 评测分数。指南覆盖模型能力对比、微调与开箱即用的取舍、选型要点,以及用多模态检索和文档问答超越传统 OCR。
Intel 与 Hugging Face 联合在 Google Cloud C4 虚拟机(Intel Xeon 6 处理器)上对 OpenAI GPT OSS 大模型做文本生成基准测试,相比上一代 C3 实例实现 1.7 倍 TCO 提升,TPOT 吞吐/vCPU/美元提升 1.4 至 1.7 倍,每小时价格更低。
Hugging Face 博客给出在 Intel CPU 上本地运行视觉语言模型(VLM)的三步流程:用 Optimum Intel 与 OpenVINO 将 SmolVLM2-256M-Video-Instruct 转换为 OpenVINO IR,再通过仅权重量化(INT8)或静态量化压缩模型,最后执行推理,无需 GPU。
Hugging Face 发布三部分系列文章,讲解如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换到端侧运行,该模型在 OmniDocBench 上超越 Gemini 2.5 Pro。
Hugging Face 博客发布 VibeGame,一个基于 three.js、rapier 和 bitecs 构建的高层声明式游戏引擎,专为 AI 辅助游戏开发设计。
Hugging Face 用 OpenVINO.GenAI 在 Intel Core Ultra 上加速 Qwen3-8B,以 Qwen3-0.6B 为草稿模型做投机解码,生成速度提升约 1.3×;再对草稿模型剪掉 28 层中的 6 层并用 Qwen3-8B 生成的合成数据微调,加速比进一步升至约 1.4×。
Hugging Face 发布 Smol2Operator,以 SmolVLM2-2.2B-Instruct 为基线,通过两阶段训练让原本无 grounding 能力的视觉语言模型获得 GUI 操作与智能体推理能力。
Hugging Face 发布低代码/无代码框架 SyGra,用于为 LLM 和 SLM 生成、转换与对齐数据集。该框架以 Python 库形式提供,支持 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可覆盖 Q&A 生成、SFT 到 DPO 偏好对构建、推理增强、多语言转换及质量过滤等场景。