具身智能的大规模落地仍处于早期阶段

近两年,具身智能无疑是最热门的赛道之一。据中国信息通信研究院副总工程师许志远介绍,当前,具身智能已经取得认知智能与物理智能的双线突破,但模型路线、数据范式以及最佳机器人形态仍未定型,大规模落地仍处于早期阶段,其未来方向仍在持续竞争与快速演化中。

(喜乐)近两年,具身智能无疑是最热门的赛道之一。据中国信息通信研究院副总工程师许志远介绍,当前,具身智能已经取得认知智能与物理智能的双线突破,但模型路线、数据范式以及最佳机器人形态仍未定型,大规模落地仍处于早期阶段,其未来方向仍在持续竞争与快速演化中。

一方面,机器人的“认知智能”实现明显跃升(即“大脑”能力),大模型使机器人能够完成传统机器人难以处理的复杂任务,具备“可感知、可思考、可交互”的智能特征。另一方面,“物理智能”加速突破:基于强化学习,人形机器人在复杂地形行走、高难度舞蹈等动态任务上表现显著提升;基于模仿学习与大模型范式,上肢操作能力快速增强,已能执行切黄瓜、倒水、叠衣服等精细操作。

尽管技术突破不断,具身智能的大规模落地仍处于早期阶段。当前行业仍面临三个核心焦点问题。一是模型路线之争;二是数据训练范式之争;三是形态路线之争。

与此同时,许志远指出,目前,利用大模型提升机器人的泛化能力已成为业界共识,但如何有效地将大模型应用于机器人系统,仍存在多条技术路径,行业也在持续探索中。

第一条路径是采用大语言模型(LLM)对人类指令进行语义理解与任务分解,这是赋予机器人高层智能的关键能力,谷歌的 SayCan 是早期代表性工作。

第二条路径是在 LLM 的基础上引入视觉,使模型具备语言与视觉跨模态融合能力,通过视觉语言模型(VLM)进行机器人控制。借助视觉信息,模型不仅能分析环境的空间关系和物体属性,也能更好支撑高层任务规划。谷歌的 PaLM-E 展示了跨模态推理在机器人控制中的潜力。

第三条路径是在 VLM 的基础上进一步加入动作生成能力,形成视觉-语言-动作模型(VLA)。这类模型以视觉图像和语言指令为输入,直接输出机器人控制指令。VLA 路线自 2024 年底以来受到高度关注。各家厂商在模型架构、模块设计和动作生成方式上不断优化,例如美国的 Figure AI、PI,以及国内的智元、银河通用等均聚焦于这一方向。

许志远强调,目前,许多 VLA 模型采用 MoE 架构,以 VLM 作为骨干网络,动作层常使用自回归预测、扩散模型或流匹配等生成方式。同时,在 VLM 与动作预测之间通常加入隐向量用于信息传递,以兼顾复杂任务推理与实时控制需求。VLA 在复杂、多步骤、多样化任务上展示出一定适应性。“然而,我们也观察到,尽管 VLA 在结构上不断演进,其实际落地效果仍未达到预期。原因在于物理世界具有高度多样性与不确定性,而当前可获取的机器人数据量级有限、覆盖场景不足,使得 VLA 难以充分学习并泛化到真实环境中。”

展望未来,在 VLA 的基础上引入 世界模型(World Model),借助其对物理世界的理解、预测与推演能力,有望成为进一步提升机器人大模型能力的重要发展路径。

来源:飞象网
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐

  • 对话姚卯青:数据不是非黑即白,具身智能不会简单复制自动驾驶

    9月23日消息(报道:王佩)觅蜂派全球发布会于上海绿发JW万豪侯爵酒店举办。发布会结束后,觅蜂科技董事长兼CEO姚卯青、觅蜂科技生态发展副总裁殷哲、觅蜂科技觅蜂派业务副总裁张智富接受了机器人茶馆等多家媒体联合群访,围绕觅蜂派众包模式逻辑、数据质量与隐私保护、行业门槛与未来格局、供需匹配、技术路线演进等行业热点问题...

    2026-09-25
  • 当机器开始理解真实世界,我们在2026外滩大会寻求具身智能的几个未解之问

    过去两年,具身智能从实验室议题跃升为产业叙事:机器人进厂实训,资金密集涌入,创业公司排队走向资本市场。但热闹之下几个问题始终悬着:机器人到底需要多少数据?仿真里练出的能力能否搬到真实世界?技能演示已能做长程任务,为什么真正落到产线上的还是少数? 带着这些疑问,「机器人茶馆」在2026外滩大会期间采访了苏度科技联合创始人...

    2026-09-12
  • 银河通用王鹤:期待具身智能与人形机器人的核心突破时刻

    在2026世界机器人大会的主题论坛上,银河通用机器人股份有限公司创始人、首席技术官王鹤就道出了大家的心声。他在题为“推动具身智能与人形机器人的核心突破时刻”的演讲中,既分享了具身智能的前沿科技进展,也阐释了具身智能行业从实验室迈向规模化商业闭环的关键路径。

    2026-08-30
  • 中国信通院:全国已建成启用超 70 家具身智能训练场,覆盖过半省级行政区

    8 月 20 日消息,据新华社今天(20 日)报道,中国信息通信研究院日前发布的《具身智能训练场研究报告(2026 年)》显示,近两年,在政策支持和产业需求的牵引下,我国具身智能训练场建设加速推进。据不完全统计,截至今年 6 月底,全国建成启用超 70 家训练场,在建或规划中的训练场为 46 家。

    2026-08-23
  • 十年宇树,一个新起点:王兴兴谈具身智能的瓶颈、破局与新纪元

    8月20日,在2026世界机器人大会上,宇树科技创始人、董事长王兴兴再次带来更多不一样的东西。而就在昨天,宇树科技正式登陆科创板。发行价150.8元,对应的市值是610亿元,打新有 980万人在抢,中签率低到万分之0.18,创下科创板开板以来的最低纪录。

    2026-08-22
  • 墨宝Mobo亮相2026世界机器人大会:家庭具身智能有了“新伙伴”

    伴随着现场轻快的“啦啦啦啦”背景音乐,墨甲首款家庭陪伴人形机器人墨宝Mobo舒展肢体、灵动起舞,鲜活轻快的舞姿瞬间聚拢现场人气。众多国内外小朋友纷纷围拢上前,跟随节奏一同舞动,2026世界机器人大(WRC2026)展馆内,一场氛围感十足的人机共舞派对火热上演。 8月19日,2026世界机器人大会正式拉开帷幕。身形小巧、...

    2026-08-22
  • 王兴兴:具身智能“ChatGPT时刻”最快2-3年到来

    8月20日消息,在2026世界机器人大会主论坛上,宇树科技创始人、董事长王兴兴发表主题演讲,对具身智能产业拐点给出明确预判。他提出,具身智能的“ChatGPT时刻”快则2到3年、慢则5到10年有望到来。 王兴兴为具身智能的“ChatGPT时刻”设定了一个可量化的判断标准:当一台机器人被带入任意陌生的家庭环境,仅靠...

    2026-08-20
  • 宇树向左,智元向右:具身智能两种商业范式的资本测验

    2026年8月,具身智能历史上或许会记住这个月份。 一级市场沉淀数年、承载了无数"AI终局"想象的具身智能赛道,终于迎来了与二级市场正面碰撞的时刻。一边是宇树科技科创板IPO进入发行程序,将于8月5日开启询价、8月10日迎来申购,拟募集资金42.02亿元;另一边,智元创新也被证实正式启动赴港上市流程,如果按照8月IPO...

    2026-08-04
  • 刘耀东离任虚拟动点,业内预判其将入局具身智能创业

    上海WAIC期间获悉,虚拟动点CEO刘耀东已正式卸任,同步退出利亚德集团相关管理岗位。业界普遍认为,依托多年空间计算与机器人产业积淀,刘耀东大概率将投身具身智能创业。 据了解,刘耀东深耕AI、空间计算赛道多年,执掌虚拟动点期间,刘耀东带队打磨OptiTrack光学定位、无标记动作识别核心技术,还携手北大...

    2026-07-30
  • 面壁智能联合创始人刘知远:具身智能拒绝“爬树登月”,端侧AI要走“先通后专”与“高密度”之路

    在2026年世界人工智能大会(WAIC)期间,端侧AI独角兽面壁智能联合OpenBMB正式发布并开源了其首个具身智能技术成果——MiniCPM-Robot系列模型。包括基于MiniCPM-V 4.6训练的通用VLA模型MiniCPM-RobotManip(参数仅1.5B,性能比肩3-4B模型,流式推理成本减半,并支持1...

    2026-07-21