WAIC 2026观察:物理AI的终局,不在展台而在闭环
核心事件:2026年世界人工智能大会(WAIC)期间,京东发布JoyAI全系列模型及具身智能全链路布局,提出"建设全球最大物理世界运营中心"战略。
在2026年的WAIC展馆里,机器人已不再是稀缺物种。超过200家具身智能企业同台竞技,演示着跳舞、递水、整理货架等流畅动作。然而,对于AI从业者和开发者而言,展台的顺滑往往掩盖了行业真正的痛点:一旦货架位置改变、灯光调暗或任务时长增加,演示中的确定性便会迅速消失。
这场竞争的焦点已从单一的本体、关节性能,转向了更深层的命题——谁能构建"数据-模型-终端-场景"的持续迭代闭环。京东在此次大会上集中展示的"物理AI"布局,正是对这一难题的系统性回答。
一、 从"数字智能"到"物理AI"的技术跃迁
京东副总裁段楠在"AI进入物理世界"分论坛上提出了三阶技术路线:数字智能 → 附身智能 → 具身智能。
- 数字智能:构建语言、多模态与智能体基础能力。
- 附身智能:将能力嵌入手机、汽车、家电等终端。
- 具身智能:将模型部署至机器人,在真实环境中完成操作。
这一路线的核心在于打破感知、判断与执行之间的断点。物理世界的任务极少只涉及单一模态,例如整理货架需要同时处理视觉识别、空间定位、抓取顺序判断及动态调整。JoyAI系列模型的发布,旨在补齐从"看见"到"行动"的全链路能力。
二、 JoyAI矩阵:构建物理世界的认知与行动基座
京东此次亮相的JoyAI系列模型,并非孤立的功能模块,而是构成了一个完整的"感知-交互-执行"能力链:
-
空间理解底座(JoyAI-Image / Image-Edit):
重点强化空间关系建模。JoyAI-Image-Edit支持指令驱动的精确空间编辑(位移、旋转、视角变化),在保持主体特征和遮挡关系稳定的前提下,为VLA(视觉-语言-动作)系统补上关键的视觉底座。这对于机器人理解物体距离、位置及遮挡关系至关重要。 -
时空连续感知(JoyAI-Echo / Video-Edit):
针对物理世界的动态变化,JoyAI-Echo解决长时、多镜头音视频生成中的误差累积问题;JoyAI-Video-Edit则实现流式视频编辑,支持通过自然语言实时修改画面内容,体现了从"提交等待"向"实时交互"的转变。 -
实时交互闭环(JoyAI-VL-Interaction / Talker):
JoyAI-VL-Interaction具备持续处理视频流的能力,能自主判断何时回应、何时静默,对应AI在物理世界中"持续在线"的状态。JoyAI-Talker则推动交互进入全双工语音时代,在低延迟对话中融合情绪理解与共情反馈,适用于家庭终端和服务机器人。 -
动作执行末端(JoyAI-RA):
作为面向通用机器人自主操作的VLA模型,JoyAI-RA接收视觉观察与语言指令,直接将认知转化为可执行动作,标志着物理AI从感知到行动的关键链路闭合。
三、 数据壁垒:从"真机遥操作"到"第一视角规模化"
对于具身智能而言,数据不仅是数量问题,更是质量与采集成本的问题。传统互联网数据缺乏物理操作过程,而真机遥操作数据采集成本高、扩展慢。
京东选择了一条平衡路径:基于人类第一视角视频的数据采集体系。
- 硬件支撑:自研超高清采集终端JoyEgoCam,搭载双目RGB相机(宽视场)和IMU(200Hz测量频率),在不干扰双手操作的情况下记录自然行为。
- 开源成果:发布行业规模最大的第一人称视角数据集EgoLive。包含2000小时、60帧率的高保真双目视频,涵盖65866个任务片段,覆盖家庭、零售、物流等346项真实任务,并提供相机位姿、三维手部关键点、深度及语言描述等多维标注。
- 战略目标:2024年3月提出建设全球最大具身智能数据采集中心,目标两年内采集1000万小时高质量数据。
这套体系的价值在于将具身数据从"一次性采集"转为"持续生产"。真实场景产生新样本,模型能力提升反哺数据筛选效率,形成正向循环。
四、 端云协同:从实验室演示到规模化运营
模型和数据解决了"如何学会干活",而智能终端和云基础设施决定了能力能否"走出实验室"。
-
智能终端(JoyInside):
将感知、记忆、交互能力嵌入硬件,接入范围从机器人扩展至智能床垫、打印机等家电。目前JoyInside已与近200个品牌合作,预计今年内接入超1000万台智能设备。其探索方向是"AI空间",即多个终端围绕同一需求(如睡眠)协同工作。 -
云基础设施(京东云):
物理AI面临数据体量大、任务链条长、部署环境分散的挑战。京东云打通数据处理、训练调优、推理部署、版本迭代及运行监控的全链路,确保模型在真实环境中的稳定运行。
五、 启示:物理AI的终局是"持续运营"
WAIC展馆里的预设操作证明了单项能力的可行性,但物理AI的真正考验在于真实世界的不确定性。
京东提出的"建设全球最大物理世界运营中心"战略,其本质是将电商、物流、零售、工业等成熟业务网络转化为物理AI的训练场和验证场。每天流动的海量商品、人员与设备,构成了规模庞大的物理网络。
对于行业而言,这一布局揭示了物理AI发展的关键逻辑:
1. 闭环优于单点:单纯提升模型参数或机器人本体性能已不足以拉开差距,数据、模型、终端与场景的咬合程度才是护城河。
2. 现实即数据:能够低成本、规模化地将真实世界经验转化为训练材料的企业,将掌握物理AI进化的主动权。
3. 稳定性即价值:在变化环境中连续工作、兜住故障并越用越好的能力,是物理AI从演示走向落地的决定性因素。
物理世界的任务不会停止,只有那些真正打通"感知-决策-执行-反馈"闭环的玩家,才能拿到物理AI时代的入场券。
参考来源:2026 WAIC京东分论坛及相关公开材料
链接:https://mp.weixin.qq.com/s/nje4TPIljHb-qpbR4tqIpA