逐际动力张巍:人形机器人大脑已达GPT-3阶段,2026年成PoC验证元年
2026世界人工智能大会期间,人形机器人何时能真正走出展厅、成为解决现实问题的工具,成为现场最受关注的问题。7月19日,逐际动力创始人、南方科技大学长聘教授张巍在演讲中给出了一个反共识的判断:当前以人形机器人为代表的具身智能正处于指数增长曲线上,而整个机器人大脑系统已经走到了GPT-3左右的阶段。
逐际动力成立于2022年,张巍将其定位为"产品型、有大脑能力的主机厂"。公司融资节奏清晰,资本认可度持续攀升:2023年10月完成近2亿元天使轮与Pre-A轮融资,投资方包括峰瑞资本、绿洲资本、联想创投等;2024年7月获阿里巴巴战略领投A轮融资,这也是阿里首次下注具身智能领域;2025年半年内累计完成5亿元A轮系列融资,后续又获京东战略领投;2026年1月完成2亿美元B轮融资;今年7月再完成近2亿美元Pre-IPO融资,引入磊石资本、意大利财团、蓝思科技、IDG资本等投资方。
张巍认为,很多人因机器人目前"笨笨的"状态而习惯用线性方式预判其未来,但行业正经历的是指数变革。他以比尔·盖茨投入数十年未能解决语言交互问题为例——若在大模型出现前询问解决时间,答案可能是十年二十年,而技术范式一变,半年内大量问题便迎刃而解。
一个可能令人意外的看法是,张巍认为人形机器人"比较好造",零部件数量仅约汽车的十分之一,比光刻机、飞机甚至汽车都更容易制造。当前瓶颈不在本体制造,而在AI——尤其是来自物理世界的数据。物理AI的数据不来自互联网,而来自真实物理生活,这使其成为AI最具挑战的应用类别。其终极形态"人形物理AI",本质上是在模仿人的大脑。
张巍将大脑系统划分为三层结构:最上层为"System2",类似人的前额叶,是以大语言模型、视觉语言模型乃至未来世界模型为引擎的思考引擎,负责记忆管理、指令收集、信息理解、任务规划与决策,"只负责想";中间层是视觉运动皮层,接收上层决策、观察环境并做运动规划;最下层是小脑和运动控制系统,"只动不想"。他强调,行业真正的挑战不是将某一层做到极致,而是将三层在毫秒级实时系统里协同起来,并与硬件联合优化——逐际动力称之为"大小脑融合技术",也是公司最重要的投入方向之一。
关于GPT时刻的类比,张巍判断整个机器人大脑系统已到GPT-3左右的初级阶段,这与"还非常早"的主流认知截然不同。但他提醒,机器人大脑并非单一模型,而是由大语言模型、视觉语言模型、世界模型、记忆管理、任务规划、运动控制共同构成的agentic系统,逐际动力这套系统名为COSA。"如果System2由LLM驱动,就像躺在病床上不能动但能思考的残疾人;由VLM驱动,就是有眼睛能看见世界的残疾人;若再加上世界模型,则相当于学了物理的霍金。"具身智能要做的,正是让这个聪明的System2指引行动,"像让残疾人做康复训练一样,通过数据和练习长出下面的技能。"
在技能学习方面,张巍同样抛出反共识观点:技能不需要非常通用才叫有脑,技能的泛化性并不代表智能水平。他举例称,跳舞这类不需要实时和环境交互的技能相对简单,而上楼梯这类需要实时交互的则难得多——逐际动力的机器人Ollie上楼梯就是实时大小脑融合技术的体现。收拾桌子则必须依赖真机数据。
据介绍,COSA系统能够接收人的指令,通过System2做任务规划,再调度导航定位、执行具体任务。最近该系统完成重要升级,实现全自主、实时推理的长程任务:在家庭环境中靠一个模型、一个技能直接推理完成全身移动与操作,没有遥操作、没有遥控器,整个模型纯数据驱动、不需要专家规则。张巍表示,除Figure外,能完成这种长程移动操作通用任务的公司非常少,而把全身移动和操作联合起来的系统尤为稀缺。
商业化方面,张巍将人形机器人的底层逻辑概括为"通用本体加APP"。他认为单一技能价值有限,但不改变机器人构型、持续叠加不同技能与应用,最终会出现"吸星大法拐点"。逐际动力的口号是"serve people, not process"——两条腿的人形机器人应服务于人而非生产流程,因此优先在人类环境里做接待、公共服务,而非工业场景。他总结:商业化的关键在于,构建一个技能的数据成本要小于该技能所创造的价值。
张巍特别提醒,具身智能不应复刻大模型行业"先做通用模型、再找落地场景"的路径。由于物理世界数据天然稀缺且昂贵,不同技能间数据差异大,更合理的路径是具备一定通用能力后尽早进入具体场景,通过专业数据反哺模型,形成场景与模型的数据飞轮。他也判断行业未来不会一枝独秀,而是百花齐放,因此需要推动开源生态与产业生态建设。逐际动力已提供开源训练架构,开发者可用自然语言训练VLA模型,也能使用其机器人和开源设备。
张巍最后判断,2026年会是具身智能PoC验证的元年,明年有望看到一些规模化发展,人形机器人正在进入从"会动"到"能用"的关键节点。