← 返回首页
科技

KIOXIA AiSAQ™厉害在什么地方?

KIOXIA铠侠中国社|鱼传观闻编辑整理
KIOXIA AiSAQ™厉害在什么地方?

当大模型把算力需求推向新高,存储、先进封装与代工制造的瓶颈也日益凸显。事实上,如何让GPU更进一步的发挥出应有实力,而不是停留在不过50%的利用率也同。KIOXIA AiSAQ™厉害在什么地方?所释放的信号,不仅是一家企业的技术进展,更映射出全球半导体格局重塑的微妙走向。鱼传观闻将核心内容整理如下,以飨读者。

提到提升AI算力通常会联想到使用更强、更多的GPU实现。事实上,如何让GPU更进一步的发挥出应有实力,而不是停留在不过50%的利用率也同样重要。在这个过程中,存储设备对AI记忆起到了非常关键的要素,从数据撷取、模型训练、推理到检索增强生成(RAG),只要帮助GPU记住更多内容,AI的运行效率自然会得到显著提升,行业内积极推动KV Cache技术就是其重要的原因之一。

RAG是什么?

对于企业用户而言,如果只依赖于互联网服务所提供的通用AI训练数据回答问题,并不能很好的解决企业内部非公开或者专属信息的处理方案,毕竟再强大的通用AI,也不可能了解企业内部不公开的信息和人员配置。解决这个问题的核心思想也很简单,即使让大语言模型(LLM)在回答问题时,先去查资料,再组织语言作答,而不是仅凭训练时的"死记硬背"来回答。这套方案我们称其为检索增强生成(RAG),全称是Retrieval-Augmented Generation。

这是由于传统LLM存在诸多局限性。比如只能回答训练截止日期之前的信息,无法获取最新动态;对陌生问题会"一本正经地胡说八道",编造不存在的事实;对企业内部的私有数据、专有知识库完全不了解。换而言之,检索增强生成(RAG)的作用,是在不重新训练整个大模型的前提下,让AI能够实时、准确地利用外部知识。

RAG系统通常分为两大阶段,分别是离线准备阶段(Indexing)和在线推理阶段(Retrieval + Generation)。离线准备阶段需要把知识"向量化"存入数据库,通过数据摄取,将企业文档、网页、数据库等原始资料进行清洗和切片(Chunking),切成适合处理的小段文本。然后通过向量化,利用Embedding模型将每段文本转化为高维数学向量。语义相近的文本在向量空间中距离更近。最后是索引构建,将这些向量连同原始文本一起存入向量数据库(Vector Database),并建立高效的近似最近邻搜索(ANNS)索引结构。

接下来是推理阶段。当用户提出问题时,系统会执行以下步骤。查询向量化,将用户的问题也通过同样的Embedding模型转化为向量。相似性检索,在向量数据库中搜索与问题向量最相似的Top-K文档片段,这就是近似最近邻搜索(ANNS)的核心作用。上下文增强,将检索到的相关片段作为"参考资料"填充到Prompt中,构成一个结构化的上下文。生成回答,LLM基于这个增强后的上下文,结合自身的语言能力,生成准确、连贯的最终回答。

最近邻搜索(ANNS)在其中变得尤为重要,因为当数据规模达到十亿级向量时,传统的精确搜索完全不可行,此时必须依赖ANNS实现精度与效率之间的权衡,通过构建特殊的索引结构,降低搜索复杂度,同时允许牺牲极少量精度,换取成百上千倍的检索速度提升。这正是铠侠AiSAQ™技术切入的领域,它是一套专为SSD优化的开源ANNS算法,让大规模向量索引无需全部驻留在昂贵的DRAM中,而是可以直接在SSD上完成高效搜索。

用KIOXIA AiSAQ™构建向量搜索的存储底座

RAG系统很理想,同时现实也很骨感。RAG系统的核心瓶颈在于向量数据库的索引存储,当向量规模达到企业级RAG中常见的十亿级时,索引数据量极其庞大。传统ANNS会要求将索引结构全部加载到DRAM中才能高速检索。但是DRAM容量是有限且昂贵的,一台服务器插满内存也可能装不下十亿级向量的索引,导致RAG系统成本失控、规模受限。

KIOXIA AiSAQ™(All-in-Storage ANNS with Product Quantization)做了几个关键的事情。首先是索引直接存放在SSD,无需加载到DRAM。这时候SSD容量决定了向量上限,确保了RAG规模可扩展数十倍。更重要的是,SSD相对DRAM成本更低,容量更大。不仅如此,依靠铠侠BiCS FLASH的高性能表现,这套方式还能在UFS中部署,让端侧AI成为可能。

简单的说,AiSAQ™通过优化的乘积量化(PQ)和存储层级感知算法,让ANNS搜索过程可以直接在SSD上完成,只把极少量的热数据缓存到DRAM。随着版本的不断升级,AiSAQ™已经允许在搜索性能(QPS)与向量数量之间灵活调优,无需硬件改动。

随着铠侠前瞻性的推出了UFS 5.0产品,AiSAQ™在端侧AI应用层面也更为广泛。这是因为UFS 5.0的高速传输使得在移动端部署更大规模的LLM和RAG专用数据库成为可能。目前铠侠已完成将AiSAQ™运用于智能手机端的技术验证,RAG数据库可直接配置于UFS中,更进一步节省了端侧AI的DRAM空间。

AI系统新理念

KIOXIA AiSAQ™其实带来了一套系统层级的新理念,即将AI的GPU推理与知识存储分离,GPU负责思考,闪存负责存储知识。这样可减少运算量、降低GPU功耗,也为采用低功耗AI加速器拓宽了选择范围。

人类的个性由记忆和经验形成。未来,即使基于相同的LLM,也能通过添加RAG专用数据库这样的外部记忆与经验,让不同的AI呈现出不同且更具个性的形态。承载这些塑造AI个性记忆与经验的载体,正是铠侠当下所打招的一系列技术,KIOXIA AiSAQ™,UFS 5.0,以及高性能的eSSD产品,为AI时代的存储与记忆提供了更多可能。

KIOXIA AiSAQ 是铠侠株式会社的商标。

其他公司名称、产品名称和服务名称可能是第三方公司的商标。

#铠侠 #KIOXIA #AiSAQ #SSD #企业级固态硬盘 #存储 #闪存 #RAG #AI #DRAM #UFS5.0

更多有趣内容

来源:KIOXIA铠侠中国社|鱼传观闻编辑整理