王兴兴最新发声,人形机器人产业的下一个十年

来源:半导纵横发布时间:2026-08-20 16:36
宇树科技
人形机器人
生成海报
人形机器人产业发展速度将超出王兴兴的预期。

8月19日,宇树科技成功在上交所科创板上市,发行价为150.80元/股,开盘价每股1100元,开盘大涨629%,开盘总市值达4449亿。8月20日,宇树科技创始人、董事长王兴兴在2026世界机器人大会上阐述了人形机器人产业的下一个十年。

王兴兴提到,快则2-3年,慢则5-10年,人形机器人有望实现场景能力质变:可在任意陌生环境、家庭场景中自主完成约80%的任务。他认为,这一阶段将实现具身智能的 “ChatGPT 时刻”,这也是人形机器人产业规模化爆发的关键临界点。

当前行业迈向产业临界点的核心瓶颈是什么?在他看来,是AI模型的输入输出与真实物理世界适配度不足。现阶段机器人依托大模型,能够完成移动、装配、物体搬运等基础任务,整体执行逻辑基本无误。但在厘米级、毫米级的精细操作环节,与现实环境存在偏差,难以精准修正细微动作误差。

当下AI技术迎来爆发式发展,人形机器人产业受到全球高度关注。在此行业变革窗口期,机器人整体迭代进化速度大幅提速。王兴兴表示,产业整体发展节奏将超出他的预期,行业正式迈入全新发展起点。

以下为王兴兴演讲实录全文:

首先回顾一下我们公司的情况,公司2016年8月成立,到现在将近8月差不多十年整的时间。我们公司做四足机器人,最近几年做人形机器人。最近几年做的比较成功的一款机器人是2024年推出G1,这款机器人推出以后其基本上成为全球标杆性的产品,所以目前大家在看到我们公司绝大部分的机器人产品或者全球大家在用的机器人产品,基本上都是跟它同一款产品或者跟它长的非常类似的产品。

今年年初比较代表性的是武BOT,我们融合了中国非常经典的传统功夫文化,我们把几十个中国功夫动作提前采集做AI训练,把精彩的动作放到舞台上。这个节目最大的亮点是结合了当前全世界最顶尖的人形机器人技术以及中国传统的功夫武术文化,这个视频尤其在海外的传播非常好,在海外有几百亿次的播放量,大家都非常喜欢,我觉得是非常好的科技和文化交融的例子。

我们2月份在天坛上有一个简单的演示,现场大概有49台机器人,也是全自动进行表演非常震撼。天坛有几百年的文化和历史,当时机器人在现场有一种穿越时空的感觉,过去中国几百年的文化和当前最新的技术交融在一起,穿越时空的感觉非常强烈、非常震撼。

我们公司在过去几年一直在推动机器人真正走进生活去工厂干活这件事情,2024年我们跟汽车工厂合作做汽车工厂现在的落地应用,我们自己也在自己的工厂部署机器人做简单测试和落地应用。我们在公司里绝大部分AI团队都在做机器人在家庭或者在工厂里干活,为什么现在没有大规模推广呢?其最主要原因是目前的效率和泛用性能力不够提高。简单来说,虽然目前机器人能做一些简单的装配,但它的效率跟人比起来还是比人低一些。另外,每次有一些新的任务过来时要重新进行训练,再到效率相对更低一点。我们希望把技术做到泛化能力更好的情况再进行大规模推广,这是目前全球共同大的瓶颈。

我们今年4月份刷新了一个记录是人形机器人当时奔跑的最快记录,超越了10米/秒的奔跑速度。这款机器人是我们在2023年第一代人形机器人改制的,我们后面可以在上面装轮子这样更加灵活一些。

大家也知道,目前机器人都是AI驱动的,AI基本是数据驱动的,有多少数据尤其有多少高质量的数据就有多少AI。我们在自己采集或者和第三方公司合作采集更多数据给大家用也给我们自己用,所以这部分的数据驱动是非常重要的事情。

目前,我个人感觉真正的AI机器人训练数据还是海量的真人数据或者互联网数据为主要的预训练数据,再加上部分珍惜数据,这是非常刚需的两部分数据。如果从量的角度来说,还是真人的数据会更加多和更加重要一些。实际数据也非常重要,我们需要把机器人跟物理世界进行匹配。

我们今年5月份比较经典的是发布了全球第一款量产级的载人机架,这款机器人身高有3米多高,载人以后重量大概500千克左右。某种意义上大家会好奇这款机器人的应用,这款机器人有点像越野车,并不是给你在家庭或者城市里使用,很多情况下你出去户外徒步或者有一些非常复杂环境下的运输就可以使用它去做。另外比较有趣的一点是可以变形成四条腿的模式,这样它的稳定性会更好一些。这也是我们为什么要把它拿出来真正的预售这个机器人,因为四条腿模式下它的稳定性是相对比较好的,而且越障能力也比较好,简单来说是一个越野车的比喻。

这里有前几个月演示基于多模态端到端自动AI动作生成,大家也知道,像我们做很多常规的动作演示都是提前训练好的,而这部分它的动作是基于实时的语义生成。正因为基于实时语义生成所以中间有点延迟,每句话说好以后语义识别,识别后上传云端,云端做AI动作生成,动作生成后做动作验证,验证好没有问题再下发给机器人,所以整个过程需要几秒钟的延迟。我们一直希望未来真正的机器人应用落地时它的动作是完全实时生成,而不是提前做编程的,因为有语义处理的过程所以有点延迟。

这种自动生成的方式有一个不太好的地方,因为它自动生成时每次动作有点差异性,你跟它说同一句话它可能今天和明天做的动作有略微差异。

我们也在推动机器人在会议室里真正干活,这是非常重要的一件事情。像我们公司自己有时候会议室乱糟糟的,在会议室整理也是非常刚需的一件事情,因为每一个公司都有很多会议室,如果会议室比较糟糕是比较麻烦的。我们在这里采集和训练了一个会议室,如果把它任意打乱后都可以恢复到干净整洁的状态。因为完全是端到端实现的,所以运动效率目前相对慢一些。而且是多任务的,我们在这个场景里大概布置了7—8个不同的任务,而且用一个模型不同切换不同任务可以完全实现,并且是抗干扰的。

正因为是AI实时生成和识别的,所以大家可以看到它动作没有那么流畅,因为它每走一步动作会进行推理,所以动作丝滑性会差一些。而且这个视频本身是一镜到底实现的,没有做过剪辑。刚刚也提到,最主要是可以突出一下如果有干扰也可以实现。时间关系不多放了,如果大家有兴趣可以去我们的官方网站看一下有更详细的。

这个功能是我们最近一直在开发的,我们希望一台机器人,像会议室整理相对有实用价值,并且难度不是特别大的场景,我觉得还是非常易做的一件事情。

这是我们在刚才语义自动生成基础上重新做的,刚才动作生成是不带交互或者不带干活能力的只是动作,这部分在语音驱动情况下它的动作是可以干活的,本身搭载了多模态模型。也是可以抗干扰的,并不是固定动作。

我们前段时间发布了最新一代轮足As2—W这款机器人,这款机器人比较轻量化,自重只有20千克,但它的负载能力和续航非常强劲,基本上是防雨水的,室内和室外都可以使用。相对比较轻量级,轻量级在日常生活中使用或者一些工业场景中使用都会非常方便。而且本身把人形机器人的技术重新放到四足机器人上,让四足机器人的灵活性有提升,并且它的负载能力非常强劲。我们非常希望把这款机器人真正落地应用到户外徒步场景。

我们前段时间升级了去年那款小的As2机器人的灵活性,这款机器人目前性价比非常高,在京东淘宝上就有预售或者零售,大家有兴趣可以关注一下。我们前段时间预览了一款新的机器人,这款机器人开发时间比较短,我们到现在只花了3个多月的时间,到目前为止是预览产品不是正式发布,它的速度达到12.65米/秒,已经超越全世界历史上以来最快的人类奔跑速度,它的跳高速度已经超越了人类历史上最高的跳跃高度。

2025年我本人包括我们公司产品包括我们公司都登上了《时代杂志》的榜单。

另外回顾一下最近几年目前具身智能AI模型的发展,最主要的流派主要是VLA模型和世界模型,今年大家听到主要是世界模型这个方向。我们公司对AI模型投入一直非常大,是我们公司目前资金和人力投入最大的方向。我们公司在2024年初开始做基于视频生成的世界模型方向,但当时在2024年底做的效果不是特别理想,中间稍微搁置了一段时间,但在去年我们又大力发展了基于视频生成世界模型的方向。

最典型一个问题是很多人会好奇,真正通用的机器人,无论是人形机器人也好或者半人形机器人也好,什么时候真正走进生活走进家庭,全世界目前最大的瓶颈是具身智能泛化能力不太够,目前很多AI模型全世界范围内固定场景做足够的采集、训练它的成功率可以做到接近100%,如果操作物品或者是环境稍微换一下,它的成功率下降是非常严重的一件事情。

我希望未来快的话2—3年,慢的话5年或者10年的时间,如果大家能看到把一台机器人带到任意陌生环境带到家庭,基本可以实现80%左右的任务,我觉得就差不多已经实现了具身智能ChatGPT时刻,这就是未来真正产业临界爆发点。

这个评价指标也非常简单,刚才有提到你带一个机器人到80%左右陌生场景,通过语音和语言指令可以实现80%的任务,这是一个非常重要的临界点。

为什么要达到这个点呢?目前要达到这个时刻最大瓶颈是什么?最大瓶颈是目前的AI模型输入和输出跟机器人对齐程度不够。目前机器人的模型如果你让它丰富它,让它移动,或者把什么东西装配在一起,或者把一个物体搬到哪儿的问题,整个趋势是没有问题的,大差不差能执行你的任务,但是最后几个厘米或者最后几个毫米的成功率或者偏差没办法很好的跟真实世界匹配,我去拿这个东西的时候,我看到已经快要拿住了,最后一点点触觉或者误差没办法很好的修正它,最终误差没办法很好修正导致成功率暴跌的很严重,这是目前全世界具身智能最大的瓶颈,就是AI模型输入和输出跟真实世界有偏差。

为什么机器人上会有这个问题?一般的语言模型或者多模态模型上没有这个问题呢,语言模型它完全是数字编码的,一个文字输入是什么输出是什么在严格限制在向量空间里,基本不会有大的偏差。简单来说没有损失,它输入输出再把它倒回来输入输出没有任何损失。对于机器人来说,它每输入输出一次都有偏差和都有损失,导致目前全世界的模型,真正的泛化能力和成功率稍微差一些的原因。在未来几年这是必然可以解决的问题,需要一些时间的问题。

另外我这里介绍一下昨天刚刚提出的或者公司正在预言做的一件事情。过去很多年大家用AI做编程或者AI开发,但对于AI真正的使用在机器人领域的开发上是相对比较欠缺的。我们公司最近一段时间在推出的一件事情是直接让物理AI机器人模型自进化,让使用最前沿的顶尖AI大模型来驱动,我们自己定一些规则、定一些经验、定一些约束和工具,让它自己去网上搜索最新的论文、最好的研究成果、各种开源方案,让它自己编程生成自己的机器人控制代码,控制代码生成后可以在仿真环境里运行,或者是去调用一些大模型状态控制实物机器人。

如果我们在实物机器人做部署测试进行评价和打分,评价和打分一部分是机器人自己实现,也可以人肉去参与评价和打分,人的经验非常重要,人非常容易判断出这是好的和坏的,这是非常重要的。这套逻辑运行起来整个机器人开发效率会高很多,而且迭代速度也会非常快,一旦流程运行一段时间真正可以实现机器人自我进化能力的提升。

这里有一个简单的示例,左下角是Copilot的智能体,机器人可以编程Copilot代码。大家可以试一下,目前很多深度强化学习算法让很多Copilot程序自动编程的效果不错了,把这些编程效果放到仿真环境里用训练和验证,训练后再放到实物机器人上做测试,测试好我们做AI模型包括人肉打分评价确定这个效果怎么样,再反馈给编程智能体,形成一个正向循环。

这里是简单示例,真正使用时会比这个更加复杂了,这是未来当下以及未来几年全球非常值得做的一件事情,大家有兴趣可以关注一下。

为什么要这么做呢?有几个简单的原因。第一随着每个月、每年基础模型能力的提升,自进化训练本身能力就会进一步提升,它是非常良性以及某种意义上可以达到跟随全球AI技术进步的。第二,可以使用多源的数据,人肉使用数据效率是非常低的,使用自循环可以把各种数据,训练数据包括真实世界、包括人的数据都使用起来,这样使用效率会更高一些,而且可以有更多的真机部署。随着真机部署越来越多,有更多测试数据和评价指标在里面,这样整个数据利用率和增长率是可以保证的,能达到数据的规模化。我们每天每个月可以累加一些技能,不是今天开发了一个技能明天把这个技能浪费掉了,这是非常重要的一件事情,让真正使用AI,把机器人开发效率和机器人进化效率大幅提升,未来是非常值得做的一件事情。这可以开启物理AI自进化新的纪元,这个方向是未来很多人都会推动的。

过去十年的时间,我们公司最早是2017年和2018年第一次参加世界机器人大会,感受也是非常深刻。未来十年,在当下新的期间,尤其是AI大爆发,全球关注度非常高的时间,整个机器人进化速度大幅提升,未来发展速度比我预估的还会更快一点,我觉得是全新的起点、全新的开始。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论