在2026世界人工智能大会(WAIC)期间,“世界模型”成为科技界与产业界共同关注的焦点。当多数视频生成技术仍聚焦于影视内容创作时,前沿领域已将目光投向更具突破性的方向——通过引入物理交互信号,让用户能够以物理输入方式与虚拟模型实时互动。这种创新理念源于一个核心认知:真实世界与虚拟视频的本质区别在于前者具备可交互的物理属性,因此构建可交互的虚拟环境等同于创造“世界模型”。
世界模型的产业价值正随着现实需求激增而凸显。制造业、自动驾驶、智慧城市等领域迫切需要AI系统理解重力、摩擦、碰撞等物理规律,但传统实体环境中的试错成本高昂且风险不可控。虚拟仿真技术通过将训练过程转移至数字空间,显著降低了技术落地门槛。除工业应用外,该技术在游戏开发、影视制作、地理测绘等领域也展现出广阔前景,成为推动多行业数字化转型的关键基础设施。
7月16日,国家人工智能应用中试基地(具身智能)联合华为与魔芯科技在杭州发布全球首个全栈昇腾NPU架构的交互式三维世界模型——MoWorld-3D。这款突破性产品将走出实验室,作为公共技术平台向全行业开放,为空间智能应用提供即插即用的底层支撑。其核心功能允许用户通过图像或文本输入生成符合物理逻辑的高清3D场景,并支持通过相机六自由度运动实现虚拟空间中的自由行走与多角度观察,确保建筑结构、道路布局等空间要素严格遵循真实世界规律。
魔芯科技的技术演进轨迹印证了中国AI企业的创新实力。这家成立于2021年的企业始终专注于4D动态世界基座模型研发,以全国产算力为基础构建空间智能技术体系,产品已覆盖自动驾驶、工业数字孪生等多个领域。2025年12月,该团队与华为合作推出交互式视频世界模型原型,完成技术可行性验证;2026年7月发布的MoWorld基座模型,通过架构升级实现了从实验室原型到规模化应用的跨越。此次发布的MoWorld-3D在场景生成效率、多卡协同能力等方面取得重大突破,标志着国产技术正式跻身世界前列。
技术参数显示,MoWorld-3D采用280亿参数的MoE混合专家架构,依托昇腾NPU集群实现稳定运行,其推理成本仅为同等规模进口GPU方案的30%。这种成本优势与实时性能的结合,为具身智能训练开辟了新范式。研发团队通过深度优化多NPU协同调度、注意力计算轻量化等关键技术,将场景解码与主干生成任务拆分至多卡并行执行,有效减少了显存冗余与无效计算,最终达成每秒生成数十帧高清场景的突破性性能。
在机器人训练领域,MoWorld-3D的虚拟仿真环境正在引发变革。传统工业机器人需要在实际产线中完成数千次抓取、避障等动作测试,不仅造成设备损耗与时间成本高昂,更存在碰撞伤人等安全隐患。而基于该模型构建的数字训练场可完全模拟真实物理环境,允许机器人在虚拟空间中进行无限次安全演练,所有碰撞与失误仅产生数据层面的“虚拟损耗”,支持高频迭代优化训练策略。
随着全球AI产业从语言智能向空间智能加速转型,MoWorld-3D的全栈自研突破具有战略意义。该模型不仅为具身智能、自动驾驶等领域提供了自主可控的技术底座,更通过昇腾算力与国产软件的深度协同,探索出空间智能产业自主化发展的可行路径。其开放架构设计将吸引更多开发者参与生态建设,推动三维虚拟世界技术向更多垂直领域渗透。





















