在2026世界人工智能大会(WAIC)“语料筑基、智生时代”论坛上,人工智能领域的数据议题迎来新风向。与会专家指出,随着大模型向具身智能和智能体方向演进,数据形态正经历深刻变革,互联网公开数据已难以满足新阶段的训练需求,真实世界交互数据、科学数据、长程任务数据等成为核心关注点。
国家数据局在论坛上披露,截至今年6月,全国已建成12万个高质量数据集,总量超1565PB,七个数据标注试点城市标注规模达119PB,支撑了425个大模型研发。局长刘烈宏宣布,下一步将实施强基扩容、标注攻坚等六大行动,构建服务人工智能的高质量数据供给体系。论坛同步发布语料数据标准、科学数据服务倡议,启动跨领域语料征集和MinerU数据竞赛,并发布语料风云榜,标志着高质量语料建设从企业探索转向产业协同。
复旦大学副校长姜育刚提出,人工智能正从数字空间向物理世界渗透。他以互联网发展为例,指出从BBS时代到Web2.0,数据规模与多样性持续推动AI进步,但具身智能时代需要新的数据体系。他构建了三层数据模型:顶层为机器人真机操作数据,中层为结构化人类施教数据,底层为互联网、仿真和合成数据。未来数据建设将呈现四大趋势:操作精细化、感知完整化、视角第一人称化,以及重视失败案例学习。
上海人工智能实验室领军科学家乔宇用“冰山理论”阐释数据核心地位:模型与算力决定智能发展速度,而数据决定智能上限。他指出,互联网文本数据已接近枯竭,未来竞争焦点在于高知识密度、交互性和长程性数据。实验室研发的MinerU智能文档解析引擎,可将复杂科学文献转化为AI可用数据,已在GitHub获7万星标,并与华为昇腾等平台适配。其建设的OpenDataLab平台汇聚180TB数据,覆盖40余模态和50多个场景。
乔宇强调“数据进化”理念,主张建立可验证、可持续演化的数据体系,避免用AI生成数据训练AI的恶性循环。他提出“数据—模型—数据”飞轮效应:更强模型产生更优数据,更优数据推动模型升级,形成持续迭代闭环。目前实验室已通过该理念在金融、医疗等领域实现应用突破。
上海市信息投资副总裁山栋明从产业视角指出,人工智能时代企业竞争逻辑正在重构。过去依赖流量和平台的模式,将让位于数据驱动的新范式。他预测,随着Agent成为主要交互载体,企业数字化架构将从“烟囱式”转向“厚底座、薄应用”的AI原生模式,以算法、算力和数据构建统一底座,快速生成面向不同场景的智能体。产业竞争正从算法和算力转向数据质量,长程任务和多轮交互数据将成为关键基础设施。
这场论坛凝聚了行业共识:当人工智能迈向具身智能和任务执行新阶段,数据已超越训练原材料的定位,成为推动智能持续进化的核心动力。从科学数据到物理世界交互数据,从知识学习到任务执行,数据形态的演变正重塑人工智能的发展轨迹。





















