在刚刚结束的2026世界机器人大会上,一个显著的变化吸引了众多目光:展示“干活”能力的机器人数量明显增多,而单纯表演舞蹈的场景则大幅减少。宇树科技、优必选、银河通用等知名企业的展厅内,机器人正模拟着产线拧螺丝、分拣货品、叠衣服、制作早餐等真实作业场景,具身智能正从学术概念逐步迈向产业化大门。
然而,具身智能从实验室走向工厂车间、家庭客厅的进程,远比预期中更为艰难。在火山引擎举办的具身智能技术与应用论坛上,火山引擎具身智能产品线负责人王运凯坦言,尽管公众常被展厅中灵动的机器人展示所吸引,但若以自动驾驶的L1-L5等级来类比,具身智能目前仍处于初级阶段。他解释称,当前大多数机器人在完成炒菜、取物等复杂任务时,动作衔接和导航切换仍依赖大量手写规则代码,而非端到端的VLA模型。
火山引擎副总裁、具身智能工程院院长杨立伟则从数据层面进一步印证了这一观点。他指出,行业普遍使用EGO数据来提升模型能力,不少企业拥有千万小时级别的海量数据,但数据规模并未带来模型能力的同步提升。核心问题在于数据质量参差不齐,多模态、跨模态的数据表征统一存在难点,且数据真实性难以保障。过往依赖测试场和仿真环境构建的场景库数据,与真实世界存在差距,导致训练出的模型在实际环境中难以稳定运行。
如何解决这一难题?火山引擎给出了自己的答案:构建覆盖底层基建、数据生产、数据治理、仿真扩增、人机交互的全链条具身智能赋能体系。在交互侧,豆包大模型的多模态能力成为关键突破。王运凯现场展示了一段视频,显示搭载全双工语音大模型Seeduplex的机器人,能根据环境视觉变化和用户语音实时调整回应,展现出强大的环境感知和交互能力。
他特别提到,特斯拉在中国选择豆包大模型而非Grok,正是看中了其在端到端实时语音和视觉-语音联合理解上的优势。未来,火山引擎还将融入更多模态,探索可交互的世界模型,让机器人具备主动感知与共情能力,而不仅仅是“移动音箱”。
在数据生产侧,火山引擎的解决方案同样引人注目。杨立伟透露,目前国内估值TOP 20的具身智能公司中,已有15家与火山引擎深度合作,利用豆包模型进行数据切片、自动打标和语义理解。由于EGO和UMI采集的数据长度陡增且无预标注,传统人工方式完全失效,而豆包系列模型能以帧级精度切分动作并生成全局检测标签,每月处理数十万级数据已成为常态。
火山引擎的Seedance视频生成模型则被用于数据增广。例如,将第一视角采样的主视觉数据合成为稀缺的第三视角或腕部视角,解决遮挡问题;还可将裸手替换为不同构型的机械臂,低成本扩充训练集。基于Seed 3D生成的仿真资产会附带物理属性和语义标签,确保尺寸、交互逻辑与现实一致。
宇树科技高级副总裁、创始合伙人张阳光在谈及与Seedance的合作时表示,宇树科技联合Seedance打造的便捷动捕方案,有效规避了传统技术短板,实现了机器人动作生成的轻量化、高效化落地,并已完成简单、复杂多场景动作验证。他特别指出,Seedance方案最核心的优势是省去了数据打标分类成本,通过提示词生成动作数据,提示词本身即为数据天然标签,可直接跳过数据预处理环节,大幅节省了人力成本与研发时间。
在底层架构上,火山引擎提供了专为具身多模态数据设计的列式存储方案和湖仓一体平台,内置视频理解、动作切分等功能,让企业能够快速托管、检索和预处理PB级异构数据。杨立伟强调,火山工程院自身也在主动下场“趟路”,通过后训练和强化学习在真实场景中打磨闭环,并将积累的难题反哺给基模团队,形成“真实场景采集、模型迭代、更高成功率”的数据飞轮。






















