跳到正文

#具身智能

今日 0 条
9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院发布针对物理 AI 机器人推理基础设施的系统性研究,指出把推理全部放在机载 GPU 上会限制机器人性能、续航与扩展性,卸载到边缘或云端 GPU 则有明显收益。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可同时改善任务成功率与续航。

9月22日周二
  1. NVIDIA Blog62

    NVIDIA 发布 Isaac ROS 5.0,推进智能体化开源机器人开发

    NVIDIA 在加拿大多伦多 ROSCon 大会上发布 Isaac ROS 5.0,这是一套基于 ROS 的 GPU 加速软件包集合,新增智能体工作流与平台支持,免费开源并已在 GitHub 提供。

    推荐理由:Isaac ROS 5.0 把智能体工作流引入机器人开发,并列出多家厂商的落地方式,可据此判断开源机器人栈的演进方向。

8月14日周五
7月30日周四
  1. Google DeepMind72

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,作为机器人的高层大脑,负责与人类对话、理解物理世界并规划多步任务,再把动作执行交给底层 VLA 模型,还可原生调用 Google Search 等工具。

    推荐理由:官方给出视频理解、任务编排与多机器人协作的能力变化和开放入口,可据此判断机器人在真实环境中的任务完成方式。

7月28日周二
7月27日周一
7月21日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Grabette 开源机器人操作数据采集系统

    Hugging Face 发布 Grabette,一套开源低成本的手持夹爪系统,用于记录机器人操作演示数据。它配备广角鱼眼相机和 RGBD 相机,分别负责策略视角与 6-DoF 轨迹追踪,硬件 BOM 成本约 490€,配套的机器人端夹爪 Gripette 约 120€。

    推荐理由:原文给出低成本手持夹爪的完整开源方案与浏览器处理流程,读者可据此判断机器人数据采集门槛的变化。

7月8日周三
  1. Mistral AI66

    Mistral AI 发布具身导航模型 Robostral Navigate

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点、比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:官方给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,可据此判断具身导航对传感器配置的要求。

7月7日周二
6月9日周二
4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6

    Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

    推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并首次开放仪表读数能力,可据此判断机器人高层推理的进展。

3月18日周三
3月9日周一
3月5日周四
  1. Hugging Face Blog34

    如何在嵌入式平台部署机器人 AI:数据集录制、VLA 微调与端侧优化

    Hugging Face 博客发布 NXP 的嵌入式机器人 AI 实践指南,涵盖机器人数据集录制、VLA 策略微调(ACT 与 SmolVLA)以及端侧优化。NXP 以"把茶包放进杯子"任务为例,用 3 个摄像头(顶部、夹爪、左侧)录制 120 个 episode,并指出异步推理需让端到端延迟短于动作执行时长。指南还介绍了 NXP i.MX 95 SoC 优化后的实时性能表现。

11月14日周五
11月13日周四
  1. Google DeepMind66

    Google DeepMind 发布 SIMA 2:可推理、对话并在 3D 虚拟世界中自我改进的智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型嵌入智能体核心,使其从指令跟随者升级为能思考目标、与用户对话并随时间自我改进的交互式游戏伙伴。

    推荐理由:SIMA 2 把 Gemini 的推理能力接入 3D 游戏智能体,读者可了解从指令跟随到自主推理与自我改进的路径。

10月29日周三
10月24日周五
9月16日周二
7月10日周四
  1. Hugging Face Blog40

    Hugging Face 详解异步机器人推理:解耦动作预测与执行

    Hugging Face 发布博客详解异步推理,将机器人动作预测与执行解耦为 PolicyServer 和 RobotClient 两个进程,通过 gRPC 通信(比 REST API 快约 5 倍),让机器人在计算下一段动作时持续执行当前动作。该方法在 SmolVLA 中引入,任务完成时间提速约 2 倍且成功率相当,适用于 ACT、OpenVLA、PI0 等输出动作块的策略。

7月9日周三
  1. Hugging Face Blog62

    Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,399 美元起

    Hugging Face 与 Pollen Robotics 发布开源机器人 Reachy Mini,Lite 版 399 美元、带板载计算与电池的无线版 499 美元,均需另付税费和运费,预计约 90 天发货。

    推荐理由:官方给出开源桌面机器人的两档配置、价格与 Python SDK,可据此判断入门机器人 AI 实验的成本与上手门槛。

6月12日周四
6月3日周二
5月11日周日
  1. Hugging Face Blog36

    LeRobot 社区数据集:机器人领域的“ImageNet”——何时实现、如何实现?

    Hugging Face 的 LeRobot 项目正推动社区共建机器人数据集,将其定位为机器人领域的“ImageNet”,目前 Hub 上的 lerobot 数据集数量快速增长,贡献主要集中在 So100 和 Koch 机械臂。项目通过简化录制流程、打通上传至 Hugging Face Hub、降低硬件成本来扩大数据多样性,并指出数据整理(curation)是下一阶段的核心挑战。

8月27日周二
  1. Hugging Face Blog34

    Hugging Face LeRobot 用视频编码扩展机器人数据集

    Hugging Face 的 LeRobot 项目提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,平均体积仅为原始版本的 14%,最佳情况下可低至 0.2%,同时保持完整训练能力。解码单帧耗时与加载压缩图片相当,连续多帧解码仅需其 25%-50%。该格式轻量、易分享,并原生集成 Hub,还提供可视化工具浏览数据集。

3月25日周一