AI的“物理化”元年:具身智能正在撕碎科技圈的旧剧本

当大模型的热潮从云端算力蔓延到冰冷金属躯干,2025年一季度,科技圈最性感的叙事不再是“ChatGPT又写了首诗”,而是“机器人学会了拧螺丝”。从波士顿动力Atlas换上电动关节,到国内宇树科技H1人形机器人以每秒3.3米的速度奔跑,再到Figure AI与OpenAI分道扬镳后自研VLA模型——一个残酷而兴奋的信号已经明确:AI的下一场战争,不在服务器里,而在物理世界的每一个转角。
具身智能(Embodied AI)不再是学术论文里的概念玩具。过去三个月,全球至少有四家头部机器人公司宣布放弃“遥控+预编程”的旧路线,全面转向端到端神经网络控制。所谓端到端,就是让机器人像人类婴儿一样,通过摄像头和触觉传感器直接学习“看-想-动”的映射关系,不再需要工程师为每一个抓取动作编写代码。这背后是算力成本的断崖式下跌和Transformer架构在非文本数据上的成功迁移。业界共识是,2025年将成为具身智能从实验室走向工厂流水线的“iPhone时刻”。
资本市场的反应最为诚实。高盛在3月发布的研报中将人形机器人市场规模预测上调至2035年的380亿美元,理由是“AI大模型解决了机器人泛化能力的最后一块短板”。与此同时,国内一级市场出现了罕见的“抢份额”局面:一家仅成立18个月的具身智能初创公司,估值已飙升至12亿美元,而它的产品至今只交付了20台原型机。投资者赌的不是当下的出货量,而是“数据飞轮”的复利效应——每一台部署在真实场景的机器人都在产生高质量操作数据,这些数据反过来训练下一代模型,形成对手难以追赶的护城河。
但光鲜的融资新闻背后,行业正在经历一场痛苦的范式重构。曾几何时,机器人公司的核心竞争力是精密减速器、伺服电机这些硬件专利。如今,硬件供应链在珠三角已经高度成熟,一台人形机器人的BOM(物料清单)成本在两年内从80万元降至35万元。真正的分水岭变成了“大脑”——也就是模型对物理世界常识的理解能力。一个尴尬的现实是,当前绝大多数VLA模型(视觉-语言-动作模型)仍然在“幻觉”中挣扎:机器人能识别一杯咖啡,却不知道咖啡洒了之后应该先擦桌子而不是继续往前走。这种“物理常识缺失”导致目前的具身智能只能在高度结构化的场景(如汽车总装线、快递分拣中心)落地,而距离家庭保姆的终极愿景仍差三个数量级的泛化能力。

AI大模型进入“价格战”下半场:行业洗牌加速,谁在裸泳谁在深耕

另一股暗流是巨头与创业者的生态位争夺。OpenAI在去年解散机器人团队后,今年初悄然投资了挪威的1X Technologies,并明确表示“只做大脑,不做身体”。而特斯拉的Optimus则坚持软硬一体,马斯克在财报电话会上透露,Optimus已经在其得州工厂完成了超过5000个真实的零部件搬运任务,并计划在2026年对外销售。这种路线分歧本质上是商业模式的赌注:卖“大脑”的想复制安卓模式,收授权费;做整机的想复刻苹果模式,赚硬件溢价。在中国,华为和小米也分别以“鸿蒙OS+盘古大模型”和“铁大机器人”切入,但至今未公布明确的商业化时间表,显示出对这一赛道的谨慎乐观。
对普通用户而言,最直观的变化或许来自物流和餐饮行业。京东物流已在三个亚洲一号仓库部署了超过200台具备“抓取-分拣-装箱”全流程能力的双臂机器人,效率较传统自动化设备提升40%。而在深圳的几家连锁咖啡店,机械臂已经能完成从磨豆到拉花的全套动作,且出品稳定性超过人类员工——尽管遇到顾客临时加冰的要求时,它仍会茫然地等待指令。这正是当前具身智能的真实写照:在规则清晰的领域,它已超越人类;在需要临场应变的瞬间,它依然是个笨拙的学徒。

AI投资降温背后:企业开始算清三笔账,行业迎来真正拐点

展望未来十八个月,行业将迎来三个关键节点:一是VLA模型的开源生态是否成熟(目前谷歌RT-2和智元AgiBot GO已开放部分权重);二是5G-A与边缘计算能否将机器人决策时延压缩到20毫秒以内;三是国家层面是否会在工业场景推出“机器人用工补贴”政策。如果这三个变量同时向好,我们或许真的能在2026年底,看到第一批进入家庭做保洁和陪伴的人形机器人——它们可能仍然会对打翻的水杯不知所措,但至少,它们已经敢于尝试推开那扇通往物理世界的大门。
#具身智能 #人形机器人 #AI大模型 #端到端控制 #机器人商业化

发表评论