文章正文

一吻定情

人形机器人不缺身体,想找一份工作_我的网站

圆月弯刀

一 |     今年WAIC,不少企业的展台都展示了机器人“能干嘛”,想给自家“娃”找个班上。         机器人大讲堂注意到,节卡给出的答案有些不同:别急着给人形机器人找一个标准答案,先按工作分分“人”。

二 |     今年WAIC(世界人工智能大会)期间,许多人都在谈论世界模型,但说的未必是同一件事。         双臂能扛50公斤重活的JAKA K1-25,像工厂里的“重装工”;能移动、装配、锁螺丝的JAKA Kargo,是穿梭于产线之间的“产业工人”;1.22米高的π仔,则更像一个面向开发者、高校和商业场景的“实习生”。         7月19日,在上海西岸国际会展中心,同一场论坛上,两种不同的声音先后登台。

三 |          更重要的是,其中一些机器人已经不只是站在展台上等待被围观,而是在华域等全球头部工业企业的产线上被真正“排进班表”。         这或许代表着人形机器人产业正在发生的一次变化。中国科学院院士、南京大学副校长周志华讲述了决策层世界模型依然面临的现实:推演误差和交互试错的高昂成本。

四 |                    过去两年,行业最热衷讨论的是一个终极问题:怎样造出一个像人一样、什么都会干的通用机器人?但当机器人真正准备进入工厂,问题迅速变得具体:你能搬多重?能不能连续工作?换一种零件还能不能干?部署需要多久?ROI是多少?          AGI是终点,但工程化不会从终点开始。他的团队最近有些许进展,但这仍是他口中“正在探索的方向”之一,而非已经解决的问题。         昆仑万维董事长兼CEO(首席执行官)方汉则给出一种判断。因为在真正的通用机器人出现之前,产业可能必须先解决一个个具体的问题。

五 | 而节卡此次给出的答案,是先让机器人学会“分工”。

六 |          01.          人形机器人开始按工作“长身体”          过去两年,人形机器人交出的“简历”高度相似。身高一米六左右,两条腿、两只手、几十个自由度,会走、会跑、会跳,再完成几个抓取动作。如果把LOGO遮住,不少机器人甚至很难被普通观众一眼分辨出来。“2026年是‘世界模型元年’。         这并不奇怪。AI不再只停留在生成内容,而是开始理解世界怎么运行,预判行动会带来什么结果。”          一个“探索中”,一个“元年”。在产业早期,企业首先需要证明的是“能不能做到”。双足行走、全身运动控制、灵巧操作,都是最直观的技术能力证明。产业已经在抢跑,但世界模型的地基还没打完。         但进入工厂之后,评价体系完全变了。

七 | 工厂不会因为一个机器人后空翻做得漂亮,就给它安排一个工位。

八 | 它只关心:能不能干、干得稳不稳,以及算下来划不划算。         于是,机器人的身体开始被工作重新定义。         同一个世界模型,公司各自“解题”          每家公司对世界模型的界定,几乎都精准卡在自己正在做的事情上。         节卡此次推出的JAKA K1-25就是一个典型例子。         腾讯不做硬件本体,只承担具身大脑平台的角色。腾讯首席科学家、Robotics X实验室主任、福田实验室主任张正友认为,机器人行业就像iOS与安卓、Mac与Windows,也会分化出“全栈自研”和“平台+生态”两条路,腾讯选的是后者。         在模型上,他认为VLA(视觉语言动作模型)短板明确,没有预测能力,而世界模型可以基于行动后果做预测。它没有把资源集中在跑得更快、动作更像人上,而是首先解决了一个极其朴素的问题——力气。         K1-25双臂协同额定负载达到50公斤,重复定位精度达到±0.1毫米。世界模型下一个有价值的方向,在于模型同时传递语言和图像信息,能推理,也具备想象力。

九 | 展会现场,它最直接的展示不是跳舞,而是双臂分别举起25公斤的哑铃。

十 |                    这个动作看起来没有那么“灵动”,但放进工厂,意义完全不同。         智象未来创始人兼CEO梅涛认为,一个真正的世界模型有三个要素:表达、推演、构造世界。         在汽车制造、重型装备、金属加工等场景中,大量零部件本身就超过10公斤甚至20公斤。

十一 | 不少人形机器人已经可以完成抓取和操作,但真正来到这些工位,遇到的第一个问题甚至不是“不够智能”,而是“搬不动”。实现这些的关键在于,让模型真正建立起对物理世界统一的认知。这也就是智象未来坚持原生全模态大模型的初衷:不是做一个更大的拼接模型,而是在最底层把“世界的运行规律”刻进模型的DNA里,以统一的方式理解视觉、语言、动作和空间关系。         梅涛认为,如果我们仅仅是把世界进行复现,本质上只是在做现有知识的压缩、拟合与复刻。         为此,节卡自研了APEX系列JX9-120大扭矩行星关节,并重新设计双支撑轻量化机身结构,让单臂自重不足25公斤,实现25公斤额定负载,极限负载可达30公斤。在这样的范式下,人类五千年文明积累的信息量上限,就是AI的能力上限。         换句话说,K1-25并不是为了更像“人”设计的。它首先要更像一个能干重活的“工人”。

十二 |          但他也坦言,现在包括视频、多模态、具身、3D在内的各种世界模型,离真正的世界模型还比较遥远。         生数科技同样基于视频数据训练世界模型,强调对物理世界的理解。同样的逻辑也出现在JAKA Kargo上。         需要跨越楼梯和复杂地形,双足有自己的价值;但如果机器人主要在平整的工厂中高频移动,轮式底盘可能更加稳定和高效。生数科技CEO骆怡航认为,世界模型必须同时具备感知理解、预测想象、行动三个维度:“世界模型一定要刻画整个人与世界的交互规律,同时能驱动人与数字、物理世界打交道,这个定义应该具备很强的Foundation(基础)属性。         于是,轮子负责跑,两只手负责干。这或许没有双足机器人那么科幻,却可能更接近现阶段工厂对具身机器人的真实需求。”          作为PhysX物理引擎奠基人之一的张立华,同时也是复旦大学长聘特聘教授、飞捷科思创始人、中国人工智能学会人机融合智能专委会主任,他的判断标准落在是否符合物理规律上。         他认为,现有的主流世界模型基本还是数据驱动的视觉模型,难以把物理规律准确地嵌入模型里。“虽然你看了很多图像、视频等数据,形成了一定的物理直觉的能力,但这个能力也存在限制,就像人的物理直觉一样,虽然能够在某些条件下给出相对准确的趋势判断,但并不能保证所有情况下判断的准确性和真实性。         当机器人开始进入真实世界,“像不像人”就不再是唯一尺度,“适不适合工作”开始变得更重要。

十三 |          机器人身体的设计逻辑,也开始从复刻人类,走向服务生产力。虽然你看了很多,但不等于你抓住了这些表象背后的物理机制。         02.          比造一个“人”更难的,是找到一个工位          过去几年,机器人行业最不缺的是Demo。第一次叠衣服、第一次完成复杂抓取、第一次连续行走数小时,都足以成为一次技术突破。         但制造业有一套完全不同的评价体系。”          世界模型定义还存在争议,但不影响各大公司卡位。

十四 |          昆仑万维不再局限于视频(SkyReels)、音乐( Mureka )等AI生成内容的业务线,开始向世界模型、机器人模型等物理AI叙事框架转变。生数科技并不瞄准单一场景,而是希望做好通用能力,用同一个模型驱动不同本体去做不同的任务,半天到一天内就能适配部署。

十五 | 飞捷科思则发起“物理智能创新联合体”,联合32家单位,定位成国产世界模型的操作系统底座。         谁能先抓住“世界模型”这顶帽子,谁就先占住了故事的入口。

十六 |          完成一次任务没有那么重要。一位投资人曾透露,他年初见过一家具身智能公司,能讲出非常好的应用场景,时隔三个月后便开始讲世界模型的故事,“这是很现实的问题”。         模型存短板,不能完全信任          世界模型对物理世界的理解,还存在欠缺。         破壳机器人创始人许华哲提到,即便现在的模型已经能做到不错的像素级预测,也不能完全信任它。真正重要的是,第一千次还能不能完成;零件位置偏了怎么办;产品换型怎么办;两台机器人如何协同;出现异常之后,系统能不能继续稳定运行。“只要是模型生成出来的东西,就一定带着模型自己的特性,如果在这样的仿真器里学策略,很容易拟合到模型的特性,而不是真实世界的特性。”          要补上这个缺口,模型需要两个方向:一是让模型本身更懂物理规律,二是让模型学习的环境足够真实。

十七 |          前一个方向,是视频生成厂商正在做的事,押注的是底层算法架构和高质量数据实现跃升后,模型自己能把物理规律“悟”出来。

十八 |          智象未来选择视频、全模态到世界模型这条路径,因为“互联网视频数据非常多,这些数据已经包含许多物理规律、因果关系在内”。         机器人从实验室进入工厂,本质上不是把一个Demo搬到产线上。

十九 | 并自研了UiT(Unified Transformer)架构,在数据端则涵盖了20万小时版权数据,覆盖超70%华语电影资源的行业多模态语料库。         生数科技则用MoT架构(可以理解为是一种稀疏、多模态Transformer架构)把理解、生成和行动整合在一起,而非“先理解、再规划、再动作”的分步路线。         模型“悟”出规律,还得放到仿真环境里训练和验证。而是把一个“偶尔成功的智能”,变成一套“长期稳定的生产系统”。                   这也是此次WAIC上,节卡展示中更值得关注的一条线。

|          在“模登时代·伙伴之城”的智造坊里,两台轮式人形机器人组成了一条小型协同产线。它们干的是一份非常具体的工作:装新能源电机。         从电机外壳转运、物料交接,到组件装配、精密螺丝锁付,再到成品入库,两台机器人分工协作。

| 如果仿真环境本身的物理规律不够真,模型学到的东西再像,也经不起真机上的检验。这就是飞捷科思在做的事,给模型提供可信的训练地基。         一切源于张立华团队的踩坑经历。他的复旦实验室团队,早年也用过其他商用具身仿真平台做仿真训练,“仿真的时候机器人表现得非常完美,但我们把实机都造出来后,再一验证就发现不行”。其中最细的一颗螺丝牙纹只有0.5毫米,单颗锁付时间约10秒。         更重要的是,这套系统并不是为了WAIC临时搭建的展品,而是此前已经在华域电动百万级电机量产产线上进行实景打磨和验证。后来团队排查发现,其底层的物理引擎动量并不守恒,仿真训练了很久,但因为模拟的物理规律并不符合现实世界的物理规律,导致训练好的算法不能在真机上复现。         经历这一教训后,团队没有急于继续扩大模型训练,而是转向自研底层物理引擎和仿真训练平台,目的就是要提升物理引擎和仿真训练平台的精度和能力。

| 进一步,他们做出了全新一代物理世界模型Fysiverse,其架构是创新的“显式物理模拟器+生成式渲染器”双驱动,让生成模型继续发挥视觉表达优势,用物理引擎补因果建模的短板。                   系统融合YOLO视觉分割、多模态感知和AI Agent,零部件识别准确率达到99%,目标是让机器人能够面对多品类混线生产,而不是永远重复一套提前写死的动作。         张立华认为,现在绝大部分模型还是以端到端为主,很少体现推理能力,但一个真正通用、有泛化性的模型,未来一定要具备推理能力。         这件事真正值得讨论的,不只是“两台机器人会装电机”。“遇到物体位置突然变化这类情况,机器人应该可以像人一样及时做出判断并调整策略,而不是只靠预训练学到的反应去执行。而是工业机器人正在尝试从“执行动作”,向“完成任务”迈进一步。”而这种推理能力的训练,同样需要物理真实的仿真环境来支撑。

|          第一人称视角数据缺失,补法却不一样          模型要学好,除了要有对的架构和环境,还需要足够多的数据。

|          传统设备擅长解决的是确定性生产问题。人类告诉它到A点抓取,再移动到B点放下,只要环境不发生变化,它就可以高速、精准地重复千万次。具身智能下一步,需要大量第一人称视角的操作数据,也就是以人的视角拍到的、真实操作物体时的视频。         但现实中的柔性生产并不会永远停留在A点和B点之间。零件会偏,订单会变,生产线会换型,任务也会临时调整。

|          于是,机器人不仅需要一副更灵活的身体,也需要理解“我要完成什么”。         在节卡的技术体系中,大模型负责语义理解和全局规划,技能模型负责精确执行,视觉系统负责感知环境变化,再由机器人完成任务拆解和动作规划。         视频生成厂商正在把自己的生成能力延伸向用于模型训练的数据供给。这背后是世界模型对高质量数据的渴求。         这意味着,具身智能给工业带来的价值,不只是增加一种新的机器人形态。

| 梅涛提到,目前容易获取的数据基本已经被拿得差不多了,但真正高质量、有私域价值的数据反而越来越难拿到。

|          梅涛谈到智象未来与一家机器人公司的合作:对方提供人类带着夹爪操作的仿真数据,每个关节点精度大概在毫米级;智象未来反过来生成一份不带夹爪的真人第一人称实操视频,和原始数据一一对齐。它真正试图改变的是自动化的部署逻辑。         过去,为了让机器人工作,人们要尽可能把工厂改造成机器人熟悉的样子;未来,机器人则要开始学习适应不断变化的工厂。

| 这可能才是具身智能进入制造业真正困难、也真正有价值的地方。

| “用这样的视频可以做增广,一份高精度、带夹爪的视频,能生成出上百到上千份不同背景、肤色、形态的版本,同样保持高精度。”          C端的数据采集,目前还停留在比较原始的阶段。许华哲提到,现在主要是靠58同城、猎聘这类公司,派人带着采集设备上门去拍;下一步可能是把采集设备直接寄到普通人家里,让人边带娃或边做自媒体,边采数据赚点钱。

|          究竟需要多少量级的数据,行业还在探索。                   03.          不只是给机器人造身体,还要降低“教它工作”的成本          如果说K1-25和Kargo解决的是“什么样的机器人适合干什么活”,那么节卡此次展示的另一条技术线,解决的是另一个问题:怎样让机器人更容易学会干活?          在WAIC现场,节卡还展示了一套基于JAKA Studio Pro与CoboΠ EI的智能化协作应用。以手机包装为例,传统自动化方案面对工件换型、托盘布局变化时,往往需要工程师重新编程和调试。启明创投给出一个参照:头部机器人公司的有效数据,会从2025年的“万小时级”,跃升到2027年的“百万小时级”,其中人类第一视角数据将占绝对主导。

|          而数据恰恰是行业难以共享的东西。而在新的方案中,工件拍照后可以通过AI生成3D模型,操作人员再通过语音或文字描述任务,由AI生成机器人运动序列,经过仿真验证后直接下发真机执行。         按照节卡提供的方案,图生3D可以将传统数天级的建模过程压缩到分钟级,轨迹实现秒级生成。

| 许华哲提到,数据是具身智能里最核心的资产,几乎没人会真正把它开源出来,网上很多号称开源一万小时的数据集,点开可能只有五十小时。机器人编程正在从“工程师告诉机器人每一步怎么走”,向“人告诉机器人最终要做什么”演进。                   这与人形机器人的“分工”实际上是同一件事的两面。         一边,是给不同工作造更合适的身体;另一边,是降低教机器人工作的成本。         π仔则补上了另一个环节。它身高1.22米,拥有27个自由度,单臂负载3公斤,配套VR全身遥操和动作捕捉系统。人在现实中抬手、转身,机器人可以同步完成动作,同时记录关节运动、视觉感知和反馈数据。         这意味着,一次遥操作不仅是一次控制,也可以成为一次数据生产。         当行业有人喊出“元年”时,学界在解理论“死结”,厂商在用同一个词争不同的定义。         对于高校、实验室和开发者而言,一台更小、更容易部署的人形机器人,价值未必是承担重工业生产,而是成为具身智能时代的“开发机”:降低开发门槛、积累真实世界数据,同时培养更多机器人开发者。模型在往前跑,地基在往下打,中间还缺数据。         至此,节卡此次展示的几种机器人开始形成清晰的分工。         K1-25解决“能不能干重活”,Kargo解决“能不能进入工厂移动作业”,π仔解决开发、训练与数据问题;CoboΠ EI和JAKA Studio Pro,则试图让机器人更容易被部署和使用。世界模型在还没被讲清楚前,就已经被相信了。         新京报贝壳财经记者 韦英姿          编辑 王进雨          校对 穆祥桐。         看起来是不同产品,背后实际上指向同一个问题:怎样让机器人真正开始工作。                   04.          节卡不是在押一种机器人形态          理解这一点,也就更容易理解节卡为什么会同时做出这些看起来差异巨大的产品。         节卡首先是一家从工厂里长出来的机器人公司。其机器人全球出货超过3万台,覆盖近百个国家和地区,客户包括丰田、施耐德、中国中车、立讯精密、上汽集团等企业。

|          所以,它进入具身智能的起点,与很多从AI或者人形本体起家的创业公司并不完全相同。         节卡面对的问题首先是:传统工业机器人还有哪些事情干不了?          不能自由移动,换产成本高,编程门槛高,面对非结构化环境能力有限,大型零部件需要双臂协同,生产线变化之后又需要重新调试。                   具身智能和AI,恰好提供了一套新的技术工具。从这个角度看,节卡从协作机器人向具身智能延伸,并不是简单换一条赛道,而是在不断补齐工业机器人的能力边界。         这也解释了为什么节卡没有把所有筹码押在一种所谓的“终极形态”上。         轻型机器人干轻活,重载机器人干重活,轮式机器人负责移动作业,小型人形承担开发、教育和商业互动;往下,是APEX关节模组和运动控制系统,往上,是CoboΠ EI、JAKA EVO和Agent能力,最终进入汽车、3C、仓储物流等具体场景。

|          这是一条与“先造出一个通用人形机器人,再给它寻找应用”不同的路径。不是先造一个“人”,再给它找工作;而是先看有哪些工作,再给工作匹配合适的机器人。

|          这并不意味着通用机器人不重要。

|          恰恰相反,真正的通用智能依然可能是整个产业共同追逐的终局。但至少在今天,“通用”仍然意味着更高的硬件、模型、数据和可靠性成本。         而商业化不会等待终极答案。工厂里的料箱今天就需要搬,螺丝今天就需要拧,企业今天就需要降低换产和部署成本。         因此,真正让具身智能产业开始转动的,未必是第一台什么都会的机器人。更可能是第一批在某一份具体工作上,已经真正创造价值的机器人。

|                    05.          下一场竞争,是“抢工位”          人形机器人行业正在进入一个更现实的阶段。         一家企业拥有多强的模型、一台机器人能完成多炫酷的动作,依然重要。但当产品真正走向商业化,行业最终必须面对一个更加残酷的问题:          你的机器人,到底在哪里上班?          一台真正进入工厂的机器人,需要解决的远不只是运动控制和模型能力。         它需要供应链、可靠性、售后和系统集成,需要理解生产工艺,甚至需要知道一颗螺丝应该用多大的力矩拧进去。         这些事情没有机器人跑步、跳舞那么吸睛,却决定了一台机器人究竟是一件科技展品,还是一种真正的生产资料。         这也是此次节卡WAIC展示背后更值得关注的变化。

|                    关节进入机器人,机器人进入工厂,工厂产生数据,数据再回到模型,模型重新提升机器人的能力。

| 如果这个闭环能够真正转起来,机器人行业的竞争也会从单点技术竞争,逐渐进入真实世界能力的竞争。

|          未来真正有价值的企业,未必只是拥有最强模型或者最酷机器人的公司。

|          更重要的可能是,谁能够持续把机器人送进真实世界,让它们在那里工作、产生数据、迭代能力,然后进入更多工位。         因为具身智能最终不能只存在于论文、模型和Demo里。

| 它必须拥有一副身体,找到一份工作,然后真正创造价值。         AGI是远方,但机器人产业不能等到远方抵达之后才开始商业化。         所以,人形机器人下一阶段真正值得看的,或许不再只是“谁更像人”。         而是谁先找到工作。又是谁,能真正抢到工位。

Current article:http://o48.rangzhuanhoujuedu.cyou/news/20260826_8759.html

Published on:13:46:56


|