AI推论瓶颈的突围:从算力瓶颈转向储存阶层的革新
摘要
随著LLM与长文本KV Cache持续膨胀,运算瓶颈由算力转向记忆体架构。高频宽快闪记忆体(HBF)可望透过开放运算计画(OCP)与UCIe标准化加速普及,透过模型架构创新结合HBF高容量与平行读取的能力,填补高频宽记忆体(HBM)与固态硬碟之间的落差;与此同时,记忆体厂商藉由先进封装环节,试图重组AI运算架构中的产业阶序,但「软体定义硬体」的生态也由运算延伸至储存与I/O层与之抗衡。
一. 推理时代下记忆体的位阶转变与HBF标准化
二. HBF的通用性设计与AI推论之记忆体需求
三. 拓墣观点
图一 软体与架构层优化说明
图二 单次推理资料流示意
图三 大模型对HBM的影响说明
图四 Google的CAG商业模式说明
图五 「Storage-Next计画」与「cuFile+ SCADA框架」说明
表一 HBF技术标准说明
表二 Samsung次世代3D记忆体技术蓝图
表三 RAG与CAG差异对照说明
表四 Engram、CAG、RAG模型架构比较说明
