从10万小时人类数据到光模块产线:灵初的技术闭环跑通了 | 前沿在线

今年WAIC 2026 和上海天气一样火热逛完一圈最大的感受是:具身圈终于不整活了。

前两年逛展,大家看见机器人叠个积木、冲杯咖啡,就围得里三层外三层喊厉害。

今年不一样了,产业人凑过来,问的全是最实在的问题:精度多少?良率多少?多久能回本?新场景多久能部署?

这不是哪一家公司突然想通了,是整个行业用真金白银投出来的共识。2026年被业内叫具身智能的”实干元年”,今年工业企业采购具身机器人的金额,同比增长了2.3倍。

真金白银进场了,没人再为花活买单。

很多人觉得具身的突破会在实验室里发生,但今年WAIC看完你会明白:真正的突破,从来都不在实验室里,都在工厂里。

这背后其实是两条路线的分野:是在实验室里堆参数做通用模型,还是扎进真场景,从落地反推模型迭代?

今年WAIC你能明显感觉到,越来越多中国公司,在走后一条路。

去年WAIC,灵初智能的展台最受关注的还是打麻将的机器人,30分钟不停翻牌、抓牌、理牌,当时已经让不少业内人眼前一亮。

才过了一年,他们直接把机器人从牌桌拉到了光模块产线上,这种落地速度,在整个具身行业里都是一梯队的。

这次他们在WAIC上展示的五个Demo,加上和长飞集团的光模块合作,为什么值得讲?

不是因为动作有多花哨,是你站在展台前,能把他们从底层模型到数据再到落地的整个逻辑,看得明明白白。

这不是五个零散的表演。

这是我们今年在WAIC上,第一次看到一家具身大模型公司,把自己从数据到模型、再到场景的整个技术栈和商业闭环,完完整整摆在台面上。

五个Demo,不是五个花活,是一整套能力

很多人逛展有个误区:看机器人做了个什么动作,就觉得这个公司只会做这个。

但你仔细看这五个Demo就会发现,他们根本不是在秀”我能做这个”,是在系统展示五个维度的核心能力。

第一个Demo:手机盒装配,展示的是随机位姿下的长程泛化操作能力。

你看到的是机器人把手机装盒,背后的技术含量远不止于此。

机器人正在演示随机位置下的手机盒装配

手机、内托、外盒全是随机摆放在台上的,位置任意,角度任意,有时候盒子都是歪的。

不需要工装定位,不需要人把东西摆得整整齐齐,机器人自己识别位置,自己规划抓取顺序,用类人侧捏的姿势拿起光滑的手机,手腕微调着顺着狭窄的盒口滑进去,最后把外盒扣好按实。

这和传统自动化最大的区别是什么?

传统设备必须把所有东西放在精确位置,差一毫米都不行。

但具身智能要解决的,本来就是真实世界里的非结构化问题——东西不会永远摆得整整齐齐,环境不会永远一成不变。

能在物品随机摆放的情况下,稳定完成十几步的长程任务,这才是”通用操作”真正的含义。

第二个Demo,也是全场互动性最强的环节:World Model做桥梁,实时转换人类动作与机器人数据。

你戴上他们自研的外骨骼数据手套,随便做动作——抓东西、拧瓶盖、比手势,屏幕里的机器人立刻就能做出一模一样的动作,不需要针对每个动作单独训练,也不用写一行代码。

这不是简单的动作映射。

背后是Psi-W0世界模型在做实时动力学转换它能理解人的动作意图,然后把人类的运动轨迹,转换成符合机器人动力学特性的可执行动作。

看起来是个好玩的互动,其实是整个技术体系最核心的一环——它解决的是数据从哪来的问题,后面我们会详细讲。

后面三个Demo连在一起,是一整条完整的光模块检测包装产线:插拔检测、真空封装、装盒装箱。

这三个展示的是工业级精密操作能力,以及多机协同能力。

光模块有多小?

比你大拇指指甲盖大不了多少,金手指引脚细得像头发丝,稍微碰歪一点就直接报废。

据现场工作人员介绍,插拔检测这一步,这套系统能做到亚毫米级定位精度、亚牛顿级力控——简单说,就是比人手更稳,比人眼更准。

现场看这个动作确实很震撼:插拔的时候它知道用多大的力,遇到阻力会微调角度,不会硬插把引脚弄弯;检测的时候能准确判断模块好坏,坏的直接挑出来;真空封装的时候知道怎么拿防静电袋不会掉落,封口的时候不会烫坏器件;最后装盒的时候,能稳稳当当地把模块码进托盘,一个都不会错。

旁边站着几个从苏州过来的光模块厂技术负责人,举着手机拍了二十多分钟,边拍边说“这个力控是真的调到位了”。

更值得关注的是多机协同能力。

三个机器人在一个工位上无缝衔接,检测完直接传给封装的机器人,封装完直接传给装盒的机器人,中间不需要人工转运,不需要人工干预,7×24小时连续作业。

这已经不是单个机器人做演示了。这是一整套拉到工厂就能直接上线的无人工作站。

机器人正在演示光模块插拔检测

逛完今年WAIC上百个机器人展台你就会发现,绝大多数展示还停留在单工位动作演示阶段,能像这样多机协同跑完一整个工业流程的方案,并不多见。

五个Demo看下来就会发现,它们刚好对应了具身智能落地需要的五个核心能力:随机位姿下的泛化操作、跨本体的数据转换、亚毫米级精密力控、长程任务规划、多机器人协同作业

这不是五个零散的技能点,这是一整套可以支撑规模化落地的技术能力体系。

Demo是给观众看的,能力是给客户用的。

光模块落地:当具身大模型真正走进高端制造产线

和五个Demo同步官宣的,是灵初智能和长飞集团、长智具身智能的合作灵初智能的具身大模型方案,正式落地光模块检测与包装场景。

很多人可能没意识到这个合作的分量。

光模块是什么?

是AI算力网络的核心器件,800G、1.6T这些高速光模块,就是数据中心里交换机和服务器之间传输数据的”高速公路”。

随着AI算力需求爆发,高速光模块的产能缺口有多大?

2025年全球800G以上光模块出货量还不到2000万只,2026年预计直接突破1亿只,一年翻5倍。

但这个产能缺口,靠传统生产方式是根本填不上的。

光模块制造是出了名的难。

第一,精度要求极高,耦合对准精度要求亚微米级,比头发丝的千分之一还细;

第二,良率要求极严,高速光模块必须100%全检,不能抽检,一个坏件流到客户那里就是重大事故;

第三,高度依赖人工,传统产线人工操作占比高达85%-90%,尤其是检测、包装这些后道工序,基本全靠工人在显微镜下操作。

我去过好几次光模块工厂,做检测的都是20岁左右的年轻人,穿着全套防静电服,在显微镜底下一坐就是八个小时,眼睛都不眨一下。时间长了,视力下降、颈椎病都是职业病。

更麻烦的是人不是机器,状态有好有坏,疲劳了手一抖,几百块的模块就报废了;熟练工人要培训半年,春节后返工率连一半都不到,工厂老板天天都在招人。

传统自动化不是没尝试过,但确实搞不定。

传统机械臂就像只会背标准答案的学生,题换个数字就不会做了:必须做精密工装夹具,必须把东西放在固定位置,必须示教编程,一个动作要调半个月,换个型号就要重新来

没有力控能力,要么抓不住,要么用力太大把引脚碰弯;只能做单一动作,检测完了要封装,就得再加一台机械臂,整条线成本极高,调试周期极长。

这就是为什么这次合作这么有标志性意义——他们用大模型的方式,解决了传统自动化解决不了的问题。

搭载Psi-R2大模型的作业机器人,不需要精密工装,东西随便放它自己能找到;亚毫米级视觉加亚牛顿级力控,比人手更稳更准;从插拔检测、良品判断,到真空封装、装盒装箱,整个流程多台机器人协同完成,不需要人工干预。

从现场公布的测试数据来看,这套方案可以把生产损耗降低约10%——别小看这10%,一个年产几千万只光模块的工厂,这就是几个亿的成本节约。

光模块真空封装环节演示

更重要的是,这不是实验室里的Demo。这是真的要拉进工厂、上产线、7×24小时运行的方案。

工业客户的验收标准有多严格?

他们不看你发布会上讲什么,会把你的机器人拉到产线上连续运行一个月,算MTBF(平均无故障时间),算良率,算节拍,算每一个环节的成本,算多久能回本。能通过这种级别的验证,才叫真正的落地。

展台展示的是模型能力,长飞合作验证的是模型能不能解决真实生产问题。

具身大模型正在从”会做动作”,真正走向”解决生产问题”这一步。

灵初智能也是今年WAIC上,少有的能拿出经过工业级验证的完整产线方案的公司,走在整个行业落地的第一梯队。

现在看具身公司,别数他发了多少篇论文、开了多少场发布会,去数他的机器人在产线上连跑了多少天。真金白银的订单,比一百个漂亮Demo都有说服力。

大家都在等通用大模型成熟了再落地,但真相是:通用能力不是等出来的,是在一个个具体场景里磨出来的。

为什么一家大模型公司,要亲自下场做数据采集?

从灵初智能成立到现在,总有人问同一个问题:你们说自己是大模型公司,为什么天天在做数据手套、采数据?看着更像硬件公司在做的事啊?

这次他们发布的官方技术博客,其实把这个问题讲透了:真正做模型的人,才最知道模型需要什么样的数据。这不是业务分散,这本身就是大模型技术路线的一部分。

整个技术体系,是建立在Psi-R2和Psi-W0双模型架构之上的:

Psi-R2是世界行动模型(WAM),同时也是视觉-语言-动作模型(VLA)。它以图像和语言指令为输入,输出未来视觉帧预测和机器人可以直接执行的控制动作,是真正直接控制机器人作业的”大脑”。

Psi-W0是动作条件世界模型(AC-WM)。它不直接控制机器人作业,核心做两件事:一是训练的时候做策略评估,验证Psi-R2是不是真的学会了人类操作的知识;二是更核心的,做人类数据到机器人数据的转换——它能在世界模型里做强化学习,把人类的动作轨迹,转换成符合机器人动力学特性的可执行轨迹,真正解决”本体差异”这个行业难题。

讲明白了双模型架构,你就能理解为什么他们要花这么大精力做数据。大模型的竞争,到最后本质上就是数据的竞争。

和大语言模型不一样,具身智能没有现成的公开数据可以用。

人类有了文字之后,语言模态就被系统记录下来了,才有了后来的大语言模型;有了相机、有了互联网图片之后,视觉模态也有了海量数据。

但人类的操作模态——开一瓶水用哪几根手指、用多大的力、碰到东西是什么触感、遇到阻力怎么调整——这个模态从人类诞生起就存在,但从来没有被系统记录过。

互联网上有海量的文字、图片,但没有机器人需要的”怎么动”的数据,这些东西你爬遍全网也找不到

而且具身数据有个天然的冷启动难题:你不能等落地了再慢慢积累数据,因为没有好数据就训不出好模型,没有好模型就落不了地,这是个死循环。

这里有个行业很少有人讲透的本质区别:智驾为什么能跑起来?因为有存量市场——用户买了车,在开的过程中自然就把数据回传了,相当于用户花钱帮你采数据。

但具身智能没有这个条件。

现在全行业硬件出货量也就几万台,靠机器人自己跑数据冷启动,要等很久。

所以必须从人类数据切入——人类每天都在做各种操作,工厂里的工人、超市的收银员、家里的普通人,他们的每一个动作都是高质量的训练数据,只是从来没有人把这些数据系统记录下来。

灵初智能选了一条看起来最笨,但长期壁垒最高的路:自己做数据采集设备,自己建数据采集体系,自己定义数据标准。

自研的外骨骼数据手套,采集成本是传统遥操作设备的十分之一,效率却能提升5倍,采集精度达到亚毫米级。

更重要的是这套设备可以规模化部署,工人正常工作的时候戴着就能采集,不需要专门的遥操作员,采集到的就是真实产线上的SOP(标准作业流程)数据,节拍能达到机械臂的物理上限——这是传统遥操作根本做不到的。

自研外骨骼数采手套,成本仅为传统遥操作的1/10

说句实在话,现在全行业建了几十个数据采集场,但真正能跑出高质量可用数据、能用来训模型的,十个里挑不出一个。

原因特别简单:只有真刀真枪在训模型的公司,才知道什么数据是金子,什么是垃圾。

没有模型在前面牵引,盲目采集的数据最后就是占硬盘的垃圾,一点用都没有。而灵初智能是行业里少数真正跑通了从数据采集到模型训练再到落地全链路闭环的公司。

现在行业里有几个大家都在踩的坑:

第一个是唯时长论,张口闭口我有十万小时、百万小时数据,好像小时数堆够了模型自然就成了。但数据从来不是按重量算的,任务多样性 > 物体多样性 > 场景多样性,你重复采集10万小时同一个拧螺丝的动作,除了占硬盘,对泛化能力没有任何帮助。

第二个是把遥操作当标准答案,觉得隔着屏幕控制机器人采数据就是最优解。但遥操作天生有生理延迟,人隔着屏幕操作的速度、自然度、临场反应,和在现场直接动手差很多,采出来的数据质量从根上就有天花板

还有更偷懒的,拿单RGB视频就敢训模型,3D关节角、触觉这些核心维度全没有,最后就是实验室里看起来丝滑得不行,一拉到真实工厂就时灵时不灵,也就是大家常说的PoC墙。

行业里有个很形象的说法:现在上岗的机器人都是”带薪水实习生”,核心目的不是替代人,是跑数据、磨模型。

等全行业的有效物理数据突破亿小时级别,具身智能才会迎来真正的ChatGPT时刻——而人类原生数据,是跨过冷启动门槛的唯一钥匙。

他们甚至打破了行业只存成功样本的惯例,主动在训练集里加入30%的失败案例,让模型学习什么情况会出错、遇到错误怎么修正——毕竟人在真实世界里操作也会犯错,会纠错才是真正的智能。

数据不是越多越好,信噪比才是核心:3D关节角的精度 > 触觉 > 2D图像特征,纯第一人称视频看起来量很大,但缺少精确的手部运动轨迹,根本训不出能做亚毫米级精密操作的模型。

这也是为什么他们坚持做多模态数据采集——除了视觉,还要有关节角、触觉,这些才是让模型真正学会操作的关键。

在数据处理上,他们信奉AI领域那个著名的”Bitter Lesson(苦涩的教训)”:Raw Data In, Raw Data Out。

他们试过很多复杂的人工处理方法——图像修复、关键点辅助、跨空间对齐等等,最后发现当数据量足够大的时候,所有人工设计的模块都会成为性能瓶颈。所以最后选择了最”简单”的方式:只做最基础的输入输出维度对齐,不做人造特征,让模型自己从海量原始数据里学习

结果证明,数据量过了阈值之后,这种最简单的方式反而能带来最好的泛化能力、最长的长程执行能力、最高的操作精度上限。

据我们了解,目前团队已经积累了近10万小时的人类操作数据他们在Hugging Face上开源的1000小时SynData数据集,下载量位居具身智能类数据集第一

这个数据量看起来还不算特别大,但要知道,现在整个行业公开的高质量具身操作数据加起来,也就几万小时。

现场技术人员透露预训练完成后,新场景只需要不到100条真机轨迹就能完成微调部署——这个效率,是传统遥操作微调方式的几十倍。

观众正在体验人类数据站,戴数据手套贡献训练数据

这就形成了一个完整的正向循环:模型定义数据标准,高质量数据反哺模型迭代,模型能力在真实场景中得到验证,场景落地又带回更多高质量数据。这也是我们今年在WAIC上看到的,最完整的一个具身大模型商业逻辑。

做具身最忌讳捷径思维——所有看起来绕远的路,最后都是最近的路;所有看起来的捷径,最后都是死胡同。

数据不是公司的护城河,能持续产出高质量数据的体系,才是真正的护城河。

具身智能的下半场,拼的是闭环能力

今年WAIC逛下来,一个越来越清晰的感受是:具身智能这个行业,正在快速分化。

前两年大家都在拼”能做什么”,拼谁的动作多,拼谁的Demo炫;今年开始,大家开始拼”能做成什么”,拼谁能真的进工厂,拼谁能真的解决问题,拼谁的账能算得过来。

这个过程中,你会发现很多之前声音很大的公司,慢慢没了声音。因为Demo好做,落地难。在展会上做十次成功八次,大家就会觉得你很厉害;但在产线上,做一万次错一次,可能就会给客户造成很大的损失。从”能做”到”能用”,中间差着十万八千里。

最后能跑出来的公司,一定是有完整闭环能力的公司:有自己的模型,有自己的数据采集体系,有落地场景的验证能力,能自己把雪球滚起来。单点技术的优势是暂时的,只有闭环的能力才是真正的护城河。

说实话,今年看了这么多展台,能把”模型-数据-落地”这个闭环真正讲通、跑通的公司,并不多。

灵初智能这次在WAIC上展示的,恰恰就是这样一个完整的闭环:底层是Psi-R2和Psi-W0双模型架构,中间是近10万小时人类数据积累出来的数据飞轮,上层是在光模块这种高端制造场景的真实落地

你在展台上看到的是五个Demo,但Demo背后,是一整套从数据到模型再到场景的完整体系。

现在全行业都在说具身智能风口来了,今明两年就是商业化爆发元年。但说句掏心窝子的话,真正在这个行业里深耕的人都知道,这是一场7年左右的长跑,现在才刚鸣枪,中间会有好几轮淘汰赛。

第一轮比谁能真正把模型做出来,第二轮比谁能把数据飞轮转顺,第三轮才比谁能真正在场景里赚到钱——现在不少公司,连第一轮的门槛都还没摸到。

工业客户的决策周期是2-3年,不是签个PoC就算落地了,更不是展会上做几个漂亮Demo,人家就敢批量采购。对创业公司来说,

数据飞轮转起来,比估值飞轮重要得多。

估值吹得再高,数据飞轮转不起来,最后都是空中楼阁,风一吹就散了。

很多公司死在什么地方?死在把钱都花在了让别人看见的地方,而不是让自己变强的地方。

行业里有个共识:上一波做传统自动化集成的公司,很难在这波浪潮里拿到船票。不是他们不努力,是这根本就是两套完全不同的逻辑——上一波靠写规则,把单个场景做到最优;

这一波靠喂数据,用通用模型解决一类问题,飞轮越转越快。就像当年功能机的王者做不出智能手机一样,不是能力问题,是创新者的窘境,旧时代的物种,很难打赢新时代的战争。

很多人问,中国的具身智能能不能跑出来?

其实答案不在论文里,不在发布会上,就在一个个工厂的产线上。我们有全球最完整的制造业链条,有最多的高精密制造场景,有最迫切的产业升级需求——这些都是别人没有的土壤。

上一波工业自动化,我们是跟跑者,买国外的设备、用国外的系统。但这一波AI驱动的具身智能,我们从第一天就和世界站在同一起跑线上。甚至因为离场景最近、离客户最近、离真数据最近,我们有机会跑出属于自己的路径。而灵初智能这样的公司,正在这条路上蹚出自己的步子。

上一波工业革命我们是跟跑者,这一波AI工业革命,我们离工厂最近、离客户最近、离真数据最近——这三个最近,就是我们换道超车的底气。

很多人在等具身智能的”ChatGPT时刻”,等着某一天一个模型横空出世,突然什么都能做。但真正在这个行业里的人都知道,没有这样突然的拐点。

这个行业最后赢的,不是Demo做的最快的,是数据飞轮转的最久的。

真正的技术革命,从来都不是敲锣打鼓来的。

它是在你看不见的工厂里,在24小时不停转的机械臂上,在一笔笔算得过来的账里,静悄悄地发生。

等所有人都看见它的时候,它已经把旧世界甩在身后了。

– END –

Frontiers
Frontiers
文章: 405