突破“内存墙”桎梏:以存储革新解锁AI算力,推动算力平权时代到来

   发布时间:2026-07-24 18:48 作者:朱天宇

在Token经济主导的当下,AI价值的衡量标准正经历深刻变革,从单纯聚焦模型能力转向重视Token生产效率。这一转变使AI从传统工具升级为关键生产要素,存储也随之从基础资源供给演变为支撑Token高效生产的核心系统能力。

过去数年,AI行业形成"算力至上"的思维定式:通过堆砌更多、更昂贵的GPU来提升算力。然而这种模式对中小企业和开发者极不友好,高昂的硬件成本形成难以逾越的门槛。更值得关注的是,行业数据显示GPU有效算力利用率普遍处于30%-60%区间,大量计算资源处于闲置等待状态。

2026年Dell World大会上,NVidia首席执行官黄仁勋向彭博社指出:"存储才是当前AI产业的最大制约因素"。他解释称,GPU在运算过程中70%的时间都在等待数据传输。随着大模型推理从算力驱动转向效能驱动,数据存储系统正成为新一代AI基础设施的核心组件。

芯展速产品副总裁许玮在接受采访时表示:"AI竞争的本质是算力效率的竞争。"当前推理成本优化已从单纯堆叠算力转向"存算协同"的系统级效率提升。通过优化数据流动路径和存储架构,可以在现有硬件条件下最大化释放GPU潜能,实现算力资源的普惠化。

内存墙问题正成为制约AI发展的关键瓶颈。过去二十年GPU算力提升约6万倍,而显存容量仅增长几十倍。这种计算与存储能力的失衡导致数据供应速度严重滞后于计算需求,形成阻碍算力释放的"内存墙"。许玮透露,即便是最新款GPU,在实际推理场景中的有效利用率也仅30%-70%。

AI推理过程涉及复杂的数据流动:模型参数需要持续读取,KV Cache需要动态更新,数据在GPU、显存、CPU和存储系统间频繁交换。当模型参数规模扩大、上下文窗口延长时,KV Cache占用显存急剧增加,系统不得不频繁进行跨设备数据交换,导致推理延迟增加和GPU利用率下降。

消费级GPU用户面临双重困境:多卡并行时数据需经CPU中转导致通信延迟,传统KV Cache管理方式显存利用率不足40%。这些问题在处理超长文本时尤为突出,8K以上token容易触发内存溢出,严重限制长文档处理能力。

行业开始探索突破内存墙的新路径。芯展速在WAIC 2026展会上推出的AI90解决方案,通过智能P2P互联技术实现GPU直连,消除CPU中转环节,使4卡5090集群的推理吞吐量从120 tk/s提升至610 tk/s。该方案构建的"HBM+DRAM+SSD"三级存储体系,将KV Cache卸载至高性能SSD,使上下文支持长度从8K扩展至128K+。

测试数据显示,AI90解决方案使64K上下文首Token延迟从27.99秒降至0.564秒,显存利用率提升至85%-95%。这种通过存储优化释放算力潜能的模式,为中小企业和开发者使用消费级GPU部署本地AI提供了可行方案,显著降低对昂贵数据中心资源的依赖。

要实现真正的算力平权仍需产业链协同努力。当前解决方案在异构GPU架构适配和生态支持方面仍有提升空间。许玮强调:"这不是简单的技术竞争,而是要让每单位算力投资产生更多价值,让AI技术真正惠及所有用户。"通过存储系统创新突破内存墙,正在推动AI基础设施向普惠化方向演进。

 
 
更多>同类内容
全站最新
热门内容
 
智快科技微信账号
微信群

微信扫一扫
加微信拉群
电动汽车群
科技数码群