字节押注十万亿参数大模型:张一鸣以长期主义,破局大模型竞争困局

   发布时间:2026-08-08 03:34 作者:沈瑾瑜

在近期The Information的报道中,字节跳动创始人张一鸣在公司内部Seed模型全员会上明确表态,拒绝通过蒸馏技术追赶大语言模型前沿。他强调,字节跳动需为长远目标牺牲短期利益,这一决策引发行业广泛关注。

当前全球大模型竞争格局中,中国厂商表现亮眼。Artificial Analysis最新榜单显示,月之暗面Kimi K3 Max位列第二,阿里Qwen 3.8 Max位居第四,智谱GLM 5.2 Max与DeepSeek V4 Flash分列第七、第八。相比之下,字节Seed 2.1 Pro仅排第21位,与国内同行存在显著差距。尽管字节跳动在资金、人才、算力和数据方面具备优势——年利润规模居互联网企业前列,团队汇聚顶尖算法人才,全国布局数万张GPU的智算中心,且拥有抖音、TikTok等全球最大原生内容池,但其大模型发展仍落后于竞争对手。

据内部人士透露,字节跳动拒绝蒸馏技术是其大模型发展滞后的重要原因之一。蒸馏技术通过利用其他大模型的输出训练自身模型,被视为快速提升性能的捷径。例如,2025年1月DeepSeek-R1发布后,Seed团队曾提议跟进蒸馏,但被张一鸣拒绝。他坚持Seed模型应像人类一样“学习思考”,而非模仿他人风格。同年英伟达Blackwell芯片部署后,算力差距扩大,内部再次提出蒸馏方案,张一鸣仍选择增资2000亿元扩建智算中心。面对Kimi K3等模型带来的竞争压力,他始终认为榜单排名是虚的,商业主权才是核心。

字节跳动的坚持源于对技术路径的深度判断。随着大模型竞争进入深水区,蒸馏技术的争议日益凸显。2026年以来,Anthropic多次指控中国厂商蒸馏其模型,但自身也被曝使用类似手段。张一鸣认为,在数据见顶、算力受限的背景下,蒸馏只能让模型追随他人,无法实现突破性创新。

从技术层面看,字节跳动的选择基于四个核心逻辑:首先,拒绝合成数据导致的“近亲繁殖”陷阱。牛津、剑桥等机构研究证实,反复使用AI生成数据训练会导致模型能力退化,尾部信息丢失将限制模型处理未知问题的上限。而字节跳动拥有抖音、头条等平台产生的海量原生数据,能够保留现实世界的完整分布。其次,掌握词表技术主权。词表决定模型对语言的切分方式,使用他人词表会限制模型对中文成语、网络热梗等长尾信息的理解,尤其在多模态领域,自主定义词表是视频生成、音画同步等技术的基础。第三,构建硬件限制下的工程能力。受美国芯片出口管制影响,字节跳动只能使用性能受限的H20芯片,被迫通过扩大集群规模、优化工程体系弥补差距。其训练集群已覆盖内蒙古、山西、河北等多地,2026年资本开支超2000亿元,形成支撑超大规模训练的全栈能力。最后,培养自主奖励模型。蒸馏模型会继承他人价值观偏好,而字节跳动需要模型深度对齐自身业务逻辑,如抖音的完播率、电商的转化效率等,这要求从预训练到RLHF全链路自主控制。

字节跳动的长期目标已浮出水面。据《金融时报》报道,公司正在讨论训练参数规模达10万亿的大模型,远超阿里Qwen 3.8-Max的2.4万亿和月之暗面K3的2.8万亿。该项目由Seed Foundation负责人项亮主导,若成功实施,将成为国内参数规模最大的模型。这一选择体现了字节跳动的战略考量:通过规模跃迁跳过中间竞争阶段,直接冲击下一梯队门槛。尽管面临数据供给、算力稳定性、推理成本等挑战,但全链路自研模型可避免知识产权争议,为全球化布局和技术竞争奠定基础。

当前,大模型技术范式窗口期正在收窄,头部厂商的技术路线选择将决定未来竞争格局。蒸馏技术虽能带来短期收益,但可能丧失定义技术终点的资格。张一鸣的决策,折射出字节跳动对技术主权和长期竞争力的追求。

 
 
更多>同类内容
全站最新
热门内容
 
智快科技微信账号
微信群

微信扫一扫
加微信拉群
电动汽车群
科技数码群