具身智能
一句话
Embodied AI——让智能体通过与真实物理环境交互来学习,核心载体是 VLA 模型(视觉-语言-动作)与世界模型。
技术路线
- VLA(Vision-Language-Action):视觉输入 + 语言指令 → 动作输出,把大模型的语言理解接到机器人执行层
- 世界模型:先在内部模拟环境推演再执行,见 世界模型
- Physical AI 练功房:仿真训练场,缩短真机试错成本
2026 关键事实:已进入万台级量产(补齐)
这是 2026 最重要的变化——具身智能从「技术验证」进入「量产阶段」:
| 厂商 | 2026 现状 |
|---|---|
| 智元机器人(上海) | 2026-06-29 第 1.5 万台通用具身机器人下线,距第 1 万台不足 3 个月,刷新全球量产纪录 |
| 宇树科技 | 2026-07 累计下线约 1.8 万台双足人形;2025 年出货超 5500 台;已 A 股上市,募资基地规划年产 7.5 万台人形 |
| Google DeepMind | Gemini Robotics 2(VLA,可控全身从脚到指尖)+ Gemini Robotics ER 2(具身推理) |
| NVIDIA | Isaac GR00T N1.6(开放 VLA 推理模型)、Cosmos 3 世界模型、Jetson Thor |
相关笔记
- 世界模型 · DeepMind · MoWorld-3D · Genie 3 · NVIDIA
相关日记
- 2026-09-12 - 具身智能概念建档