行家说机器人
9月底,AMD以82亿美元全股票收购李飞飞联合创办的 World Labs。这是AMD 史上第二大收购案,也让世界模型第一次以如此昂贵的方式进入产业视野。但价格只回答了一半:一家公司愿意为这个方向付多少钱,和这项技术能不能在工厂里干活,是两件事。
一家中国公司影身智能给出了不一样的答案:先让4D世界模型进制鞋车间。

01
从3D到4D:多出的这一维为什么值钱
当前,AI在数字世界里的成长与进化速度超乎想象,可是在真实物理世界,技术演进明显滞后。所谓原生4D世界模型,是在三维空间之上再叠加时间维度,并纳入力学与拓扑信息:它要捕捉的不只是物体长什么样,还有物体怎么形变、怎么相互作用、怎么随时间演化。
眼下多数路线卡在中间:2D视频生成有了画面,但没有真实深度;静态3D重建有了深度,却没有时间。少了这一维,推演里就会出现物体互相穿透、重力凭空失效这类违背物理常识的错误。
World Labs与影身智能几乎同时在2024年启程,对技术的判断也高度一致:AI要走向物理智能,先得建立对4D空间的理解。真正的区别在后面——World Labs 选择先构建一个虚拟世界,再把智能体放进去;影身智能选择先走进工厂。
这条路线能兑现什么?影身智能自研的4D基座世界模型“破界S1”给出了一组可量化的答案。它把渲染、仿真、规划放进同一套基座。统一表征换来的提升是可量化的:图像目标导航成功率从43%升到72%,语言目标导航达69%,推理速度比此前最优方法快约45%;九项动态操作任务上,平均成功率高出此前最优方法10个百分点以上。更值得注意的是样本效率——只需15条真实演示数据,模型就能接近峰值性能。
02
影身智能:从清华实验室到制鞋车间
影身智能成立于2024年,围绕原生4D数据、世界模型和具身智能展开,分设物理具身与数字文娱两个方向。技术栈是三层:4D数据采集、4D基座世界模型、垂域模型。目前这套体系已经在真实工业场景里跑起来,并拿到了订单。
多数做世界模型的团队只做算法。影身智能从组建起,就把科研、工程和商业放在同一张桌子上。
创始人兼CEO闵伟是清华大学工学博士、高级工程师,曾任阿里巴巴本地生活机器人团队技术负责人,拥有20余年AI与机器人研发及落地经验;首席科学家刘烨斌为清华大学自动化系长聘教授、国家自然科学基金杰出青年科学基金获得者,研究方向为三维视觉、3D与4D内容生成,数字人,多项成果已完成产业技术许可;特别科技顾问朱煜为清华机械工程系长聘教授。
学术背景让它跟得住前沿,工业经验让它知道现场有多少约束。这也是影身智能没走实验室路线、而选择real2real的原因:把4D世界模型变成能在产线上持续迭代的能力。
03
去互联网找数据,还是去产线找数据
李飞飞在7月底a16z的播客里提出过一个判断:卡住具身智能的不是算力,是“数据荒漠”,这也是公认最大的卡点。
World Labs的解法是Real2Sim2Real:把真实环境搬进仿真空间,让智能体在里面大量试错,再部署回现实世界。数据上混合互联网公开视频与自有素材,目的是用低成本把数据量做大。
闵伟的另一层判断是:在具身智能里,数据从来不是多少的问题,而是维度的问题。互联网视频记录的大多是标准、成功的操作,很少记录产线上频繁出现的失误、异常和物料形变。但工厂恰恰充满不确定性——正是这些“非标准”样本,才能真正教会机器人如何处理复杂工况。

影身智能创始人兼CEO闵伟
所以影身智能的核心是“数据演练>采集”,坚持real2real,直接在制鞋产线上7×24小时采集原生4D数据,把工位变成训练场,产线一边跑一边给4D基座模型回喂数据。
然而有个问题无法回避——高质量4D数据一直很贵。传统多视角动态采集方案依赖密集视点的相机阵列,整套设备动辄几百万元,4D数据因此很难铺开。要让它进入产业,采集端的成本必须先降下来。
影身智能的解法是自研的“影身360”多模态采集系统:仅需4至6个消费级RGB摄像头配普通显卡,就能做到25帧/秒的动态采集,实时产出毫米级精度的4D数据。相比传统方案,硬件综合成本下降超过90%。

“影身360”数采设备
04
从一台机器人到一条产线
硬件只是入口,数据要变成能力还得有训练场。今年9月,石景山区首钢园的具身智能训练中心揭牌,这是国内首个由4D世界模型驱动的具身智能数据与训练基础设施,影身智能是核心共建方,更是一期4D基座世界模型的主建方。该中心已从1.0迭代到2.0,构建了“采集-建模-训练-验证-回流”的数据飞轮,把真人、真机、4D、仿真四类互补数据整合在一起,以4D世界模型为统一底座打通数字智能、空间智能、物理智能三类智能,串联认知决策、场景重建到真机执行全链路。模型因此能持续吃到真实产线的一手数据。
飞轮转不转,最终要看产线。面向柔性制造,目前影身智能做了三款机器人:ShadowGlue涂胶、ShadowPress压底、ShadowBox打包。它们对准的是制鞋行业长期的“双柔性”难题——皮革布料受力就形变,这是材料柔性;款式快速迭代、来料不标准,这是任务柔性。也正是这两点,让传统刚性自动化设备的渗透率长期停在5%。
ShadowGlue涂胶机器人通过观看工人操作视频即可自主学习工艺逻辑,能实时感知胶水粘稠度的变化,在0.1秒内完成动作补偿,把物料浪费率压到1%以内;ShadowPress压底机器人靠视觉算法动态补偿做到亚毫米级精准对位,末端精度要求降低10倍,它的良品率稳定在99.9%以上,可以7×24小时无人化作业。

ShadowPress压底机器人
ShadowBox打包机器人在2026第23届中国—东盟博览会展台以及第五届京西地区发展论坛上成功展出,靠4D世界模型实时识别纸盒形态和位姿变化,用双机械臂协同完成柔性纸盒折叠。
2026年上半年,影身智能和宝龙鞋业、顺斐鞋业、越韩鞋业等多家越南头部制鞋企业达成合作,计划交付数百台ShadowGlue涂胶机器人与ShadowPress压底机器人,订单规模数千万元人民币。截至东博会落幕,影身智能具身产品累计签约订单已达数亿元,东盟区域的业务还在扩张。
这些数字背后是更难复制的一层。影身智能的壁垒不在某一个算法,而在三件事叠在一起:4至6个摄像头就能开工的采集成本,让数据规模不再受制于设备预算;产线上7×24小时回喂的真实数据,让模型拿到真实物理世界的样本;以及石景山大数据训练中心那条从采集到回流的通路。三层合起来才转得动飞轮,缺任何一层,4D世界模型都只能停在演示里。
写在最后
资本给技术方向定价,工厂按降本和回报给技术打分。影身智能的意义,远不止是做“中国版World Labs”。
真正的考验在于:这套从4D数据、4D世界模型到机器人执行的完整链路,能不能延伸到更多工厂、更多任务场景。
这场大考,才刚刚开始。
END
📚 往期精彩
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!