具身智能

一句话

Embodied AI——让智能体通过与真实物理环境交互来学习,核心载体是 VLA 模型(视觉-语言-动作)与世界模型。

技术路线

  • VLA(Vision-Language-Action):视觉输入 + 语言指令 → 动作输出,把大模型的语言理解接到机器人执行层
  • 世界模型:先在内部模拟环境推演再执行,见 世界模型
  • Physical AI 练功房:仿真训练场,缩短真机试错成本

2026 关键事实:已进入万台级量产(补齐)

这是 2026 最重要的变化——具身智能从「技术验证」进入「量产阶段」:

厂商2026 现状
智元机器人(上海)2026-06-29 第 1.5 万台通用具身机器人下线,距第 1 万台不足 3 个月,刷新全球量产纪录
宇树科技2026-07 累计下线约 1.8 万台双足人形;2025 年出货超 5500 台;已 A 股上市,募资基地规划年产 7.5 万台人形
Google DeepMindGemini Robotics 2(VLA,可控全身从脚到指尖)+ Gemini Robotics ER 2(具身推理)
NVIDIAIsaac GR00T N1.6(开放 VLA 推理模型)、Cosmos 3 世界模型、Jetson Thor

相关笔记

相关日记