当机器开始理解真实世界,我们在2026外滩大会寻求具身智能的几个未解之问

过去两年,具身智能从实验室议题跃升为产业叙事:机器人进厂实训,资金密集涌入,创业公司排队走向资本市场。但热闹之下几个问题始终悬着:机器人到底需要多少数据?仿真里练出的能力能否搬到真实世界?技能演示已能做长程任务,为什么真正落到产线上的还是少数? 带着这些疑问,「机器人茶馆」在2026外滩大会期间采访了苏度科技联合创始人...

过去两年,具身智能从实验室议题跃升为产业叙事:机器人进厂实训,资金密集涌入,创业公司排队走向资本市场。但热闹之下几个问题始终悬着:机器人到底需要多少数据?仿真里练出的能力能否搬到真实世界?技能演示已能做长程任务,为什么真正落到产线上的还是少数?

带着这些疑问,「机器人茶馆」在2026外滩大会期间采访了苏度科技联合创始人、CEO 韩铮与破壳机器人创始人、清华大学交叉信息研究院助理教授许华哲,试图寻找到一些答案。一位走仿真数据与工业落地路线,一位押注家庭场景与具身原生模型,技术选择不同,判断却相当重合。

数据越多越好“小时数”正在被高估

众所周知,具身数据的来源大致分三条:真人遥操、同构手持设备采集、仿真合成。前两者质量高、成本高,后者边际成本低,却存在“仿真到真机”(Sim2Real)的迁移落差,触觉、柔性物体与光照噪声最难还原。数据规模因此长期被当作最直观的竞争力指标。

许华哲认为行业对具身智能数据的追求被严重高估了。在他看来,“小时数”之所以被反复比较,是因为它“非常显化、非常可比较”,创业者很容易数出“我有一百万小时数据,比十万小时的多一个量级”;但最近发布的几个模型里,并没看到数字越高效果越好。

他强调自己“非常非常相信 scaling 这件事本身”,主张“边扩边找,边找边扩”,不能为数字放弃质量要求。他告诉「机器人茶馆」,一小时数据在市面上卖几百元人民币,一百万小时就是几个亿的量级,如果最后证明这个数据没用,那对整个社会来讲都是巨大的浪费。

韩铮给出的数据标准是结构化、多样、高质量。关于数据总需求,他给出不同口径:苏度自算约十万亿美金,英伟达分析师受访时提的是一百万亿美金。他解释这与许华哲并不矛盾,做某一类任务未必需要百万小时以上。

仿真能替代真机吗?模改与原生之争没有定论

VLA(Vision-Language-Action)模型在视觉语言模型基础上增加动作输出,是当前主流架构。业界由此分成两派:在通用多模态大模型上微调出动作能力的“模改”派,与从数据采集到模型架构都为机器人操作重做的“具身原生”派。

在“仿真还是真机”上,韩铮的答案不是二选一。他澄清苏度以仿真数据为核心的一部分,部分任务也用到遥操与第一、三人称视角的真实数据。他划出的边界是:4 月的 R1 版本做通用刚体抓取,几乎不需要补真机数据;而电池组装这类必须遵守规则的任务,以及叠衣服这类柔性操作,要在真实世界当中给出一些指引。

模型架构上两人更一致。许华哲表示自己非常支持具身原生模型:模改模型用过的数据虽丰富,却混入不少反物理内容,“比如超人能飞,但是人是很难飞起来的”;而原生数据足够多时,模型的 In-context Learning 能力更强。

韩铮的补充更尖锐。他发现,把动态大模型与真实数据组合后,一旦要控制机器人实操就会变得很蠢,原来理解的那些拆解步骤几乎全忘了,把两个模型直接混到一起,绝对不是一个好的搞法。

泛化真的来了吗长程任务正在改写能力边界

OOD(Out-of-Distribution)泛化指模型在训练分布之外的物体、场景或任务上的表现,是衡量通用性的核心指标。长程任务考验单步成功率在时间维度上的累积:若单步成功率为 90%,连续十步的端到端成功率仅约 35%。

“能力变化还是非常大的。”许华哲判断今年会批量看到“真正意义上的泛化”,虽不能覆盖所有任务,但可以在不同地方用同一个模型做一系列任务,而这在过去三年里是没有看到的。此外长程任务能力也在变强,任务时长已从几分钟延伸到一小时甚至更长,这依赖模型的泛化能力、稳定的可靠性与足够准确的场景 SOP。

对于“两到三年能看到泛化”,他给出的依据是实测:OpenAI 的 Astra 模型在破壳内部做过尝试,可以泛化地做一些事情;破壳自己的模型在见过的物体上成功率 98.1%,没见过的物体约 80%,且不是单一动作。

被追问这是否是在类比大语言模型,许华哲认为具身智能的发展速度会逐渐接近大语言模型,但不会达到。他解释,此前速度被硬件极大影响,整个世界找不到一台真正好用的轮臂机器人,而硬件问题总会触发。

技能能演示了,产线为什么还落不下去?

硬件产品从原型机到小批量试产再到量产,需经历可靠性验证、供应链爬坡与成本下降三个阶段,新能源汽车行业走完用了十余年。工业产线对可靠性的衡量标准是连续运行时长与一致性,容错空间远小于演示场景。

把机器人放上产线,卡点不只在模型。韩铮在采访中对「机器人茶馆」表示,工业场景完全不允许精度打折。他更强调供应链与可靠性检测:具身智能公司拿到的基础元器件,还没有一家公司经过上万小时连续运行的检验。他举例说,两台一模一样的机器可能出现 0.1 度的末端差别,同一台机器今天和明天上电时的信号也不一样,算法必须把这些考虑进去。

被追问能否靠模型补足硬件精度不足,他回答两方面都得要:零部件和传感器不能太离谱,要保有一定一致性;但也不能指望 100% 一致,算法要对个体差异做感知与交互闭环的适配。进度上,苏度梳理出的工业组装任务梳理出可能有一两百项,已有两到三项开始批量验证部署,展出的技能接近 10 项。

460 亿之后,具身智能的泡沫会被填实还是戳破?

2025 年以来,具身智能是一级市场最拥挤的赛道之一,也出现传统制造业资本跨界入局的现象,这通常被视为赛道过热的信号。产业链公司加快登陆资本市场,首家上市企业承载了超出自身业务边界的行业预期。

面对“泡沫大还是机会多”,许华哲先承认泡沫存在。在他看来,机会多的地方泡沫一定大,而泡沫就是预期与实际中间的差距,追得够快就会被填实。今年上半年约 460 亿元的资金投入被他视作起点而非结果,并不是投进去立刻变钱了。他预计两三年后这个泡沫会被行业整体实力追上。

韩铮则从市场预期角度补充。他表示,第一家上市的公司承载了大家对整个行业所有的希望,但各家擅长的领域有区别,公众希望它把各种任务都完成,“早期肯定会有一点点心理预期差”,随着市场了解加深,估值会回归合理区间。他同时提示,物体操作比本体控制更难。

关于梯队,许华哲认为按估值划分合理但不是唯一标准,最终要看两条:能不能干一年一次不坏,模型是不是扔在任何地方都能用。韩铮则把这一阶段的胜负手归结为组织,认为这与造飞机、造两弹一星一样,是“系统工程”。

“世界模型元年”,行业究竟在说什么?

世界模型并非新概念。机器人领域数十年前就用它指代对物理世界的理解、感知与推演,视频预测模型与 Yann LeCun 提出的 JEPA 是两条重要源头;2024 年 Sora 发布后,“世界模拟器”的说法一度流行,也引发争议。

对“世界模型元年”,许华哲认为,今年被叫做元年,是因为它对未来预测、对物理理解的能力逐渐开始显露出来。在他看来,世界模型还可能预测并调度工厂里的各类设备,但这不是破壳的目标。

韩铮更强调这个词的泛化性质。他梳理说,机器人领域早就有这个概念,Sora 之后一度被叫做 world prediction model,后来又被拿了下来;到今年为止,它是一个非常泛泛的概念,涵盖 3D 生成、视频生成等一整批方向,并不是特指某一种技术。

后记

可以看到,具身智能正从“讲故事”转向“算细账”。许华哲对数据小时数的质疑,指向一种正在失效的估值逻辑。当扩量变成只要有预算就能做到的事,它就不再是壁垒。按几百元一小时的成本结构,为凑数字采集的数据一旦被证伪,代价不只由一家公司承担,这也解释了低质量数据工厂为何先于技术路线出清。

韩铮强调的元器件、一致性与上万小时检验,是另一重提醒:模型能力可以先跑到 demo,但产线只认可靠性,微小的硬件漂移会被放大成系统性问题,不是算法单方面能补的。两人在模型架构上也罕见地一致,都认为通用大模型与操作能力的简单拼接会出现能力坍缩。

至于泡沫,「机器人茶馆」更愿意把它理解为一个倒计时:460 亿元已经入场,兑现窗口是两到三年,届时被检验的不是估值梯队,而是“能不能干一年不坏”。

(文/李楠)

来源:速途网
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐