跳到正文

#部署/工程

今日 9 条
9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。

9月23日周三
9月22日周二
  1. NVIDIA Blog62

    NVIDIA 发布 Isaac ROS 5.0,推进智能体化开源机器人开发

    NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源并已在 GitHub 提供。

    推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并列出多家厂商的落地方式,可据此判断开源机器人栈的演进方向。

9月21日周一
9月17日周四
  1. GitHub Blog · AI & ML67

    GitHub 用 Copilot 把 Copilot 运行时迁移到 Rust

    GitHub 用 GitHub Copilot app 和 Copilot CLI 把 Copilot agent runtime 从 TypeScript 完全重写为超过 80 万行生产 Rust,代码主要由 AI 智能体编写,分布在 128 个合入 main 的 PR 中并逐步发布。

    推荐理由:作者以亲历者身份给出把 80 万行运行时迁到 Rust 的完整数据,可看到智能体协作与人工把关的实际分工。

9月16日周三
9月10日周四
9月8日周二
  1. Mistral AI67

    Mistral 完成 30 亿欧元 D 轮融资,估值超 210 亿欧元

    Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 与 PSG Equity 联合领投。公司称这是欧洲科技企业完成的最大规模股权融资,资金将用于扩展前沿研究、算力与商业增长。Mistral 目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。

    推荐理由:Mistral 完成欧洲最大股权融资,读者可了解其主权开源全栈路线与投资方结构。

9月5日周六
  1. GitHub Blog · AI & ML71

    GitHub 推出 Project HydraFusion:用多模型编排实现前沿质量

    GitHub 发布研究预览 Project HydraFusion,在 GitHub Copilot CLI 中通过运行时编排多个提供商的模型,自动选择 Single、Cascade、Critique 三种执行模式来平衡质量、成本与延迟。

    推荐理由:GitHub 官方给出 HydraFusion 的三种编排模式与三个基准上的质量成本对照,可据此判断多模型编排在编码任务中的取舍。

9月3日周四
9月1日周二
8月25日周二
  1. Hugging Face Blog66

    Gradio 推出 gr.Workflow,把 AI 流水线做成可拖拽画布并自动生成 API

    Gradio 内置的 gr.Workflow 把多步 AI 流水线描述为带类型节点的图,Gradio 会提供一个拖拽画布,每个节点可运行、每个中间结果可见。同一张图同时是 REST API,每个输出按标签生成独立端点,并支持一条命令部署到 Hugging Face Spaces。

    推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 拼接流程的改造成本。

8月21日周五
  1. Hugging Face Blog62

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升吞吐,GPU 上最高 3.18 倍、端侧最高 2.87 倍。

    推荐理由:Liquid AI 给出三个 LFM2.5 模型的 DSpark 草稿模型与 H100、MacBook 实测吞吐数据,可据此判断投机解码在端侧与 GPU 上的实际收益。

8月18日周二
8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先服务层,并接入第三方开源模型

    Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。

    推荐理由:Mistral 把区域推理、SLA 保障和第三方开源模型接入放进同一套基础设施,读者可据此判断企业级部署的合规与算力选项。

  2. Hugging Face Blog62

    NVIDIA 发布 Magpie TTS 多语言开源权重模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与 TTFA 实测数据,可据此判断自建语音链路的延迟与部署方式。

8月10日周一
  1. Hugging Face Blog44

    Hugging Face 提出离线 Top-K Logits 与融合分块 KL 损失,大幅降低 LLM 知识蒸馏成本

    Hugging Face 论文提出两项系统改动降低 LLM 知识蒸馏成本:离线缓存教师模型每位置的 top-100 logits,使教师无需与学生同时驻留显存;融合分块 KL 损失避免生成完整的词表×序列长度矩阵。以 gpt-oss-120b 为例,稠密 KL 峰值约 250GB,超过单张 H200 的 141GB,融合分块方案峰值约 128GB,使长上下文修复可在单 GPU 上完成。

8月6日周四
7月30日周四
  1. Hugging Face Blog22

    GPU 管理:为什么闲置 GPU 是新的停飞飞机

    Hugging Face 博客指出,AI 的下一个真正约束是 GPU 利用率而非智能本身。GPU 按日历小时计费,产出却只按计算小时累积,两家 GPU 预算相当的公司会因利用率差异而拉开差距。企业自购 GPU 本地部署可把按 token 线性增长的 API 成本换成固定资本支出,但集群上线后的问题变成如何让它们保持忙碌。

7月29日周三
7月27日周一
7月23日周四
7月16日周四
7月10日周五
7月9日周四
  1. Mistral AI38

    Mistral Studio 为 Prompts 和 Skills 提供版本管理系统

    Mistral Studio 现已上线 Prompts 和 Skills 管理功能,为每个提示词和技能提供版本记录、明确归属和可追溯性。每个版本不可篡改,支持对比、回滚和审计日志,并可通过标签区分 Production 与 Staging。资产可通过 MCP server 直接调用,确保生产环境运行的是受治理的同一版本,数据保留在企业边界内。

7月8日周三
  1. Hugging Face Blog62

    vLLM 的 transformers 建模后端实现原生推理速度

    Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上达到甚至超过 vLLM 手写原生实现的吞吐。该后端通过 torch.fx 做静态图分析、用 ast 重写源码,在运行时动态应用推理相关的层融合,从而匹配自定义实现的性能。

    推荐理由:原文给出 transformers 后端在 vLLM 中达到原生速度的实测对比与启用方式,读者可据此判断是否省去自定义移植。