科技日报记者 刘霞
跟着ChatGPT横空出世避世,推理人工智能(AI)局限的芯片新轮竞争进进白热化。英伟达公司的激起高端图形措置单位(GPU)芯片“一飞冲天” ,遭到各除夜科技公司追捧。独霸与此同时 ,立异也有一些草创公司另辟路途 ,推理专注于研制此外一种芯片——AI推理芯片 ,芯片新轮为AI产品的激起畅旺展开和独霸注进全新动力 。
据物理学家构造网不日报导,独霸这些AI推理芯片旨不才出世成式AI所需的立异昂扬筹算成本,更贴合AI对象的推理往常运转请求。此类芯片成本的芯片新轮不竭下探和功用的延续汲引,有看掀起新一轮AI独霸立异海潮,激起让更多宏壮且壮除夜的独霸AI独霸走进千家万户。
推理筹算需求水长船高
操练与推理 ,立异是AI除夜言语模型两除夜中心身手的刚毅基石。
在独霸过程中,经由操练的ChatGPT等生成式AI对象会吸纳新信息,从中举办推理并生成回应,如撰写文档、生成图象等。这类AI对象可独霸于医疗诊断 、主动驾驶、天然言语邃晓等局限。
跟着AI模型的普及独霸 ,需求举办推理筹算的硬件日趋增多,对推理芯片的需求也将“水长船高” 。国际数据公司(IDC)的陈述展示 ,将来几年,推理端的AI处事器占比将延续爬升 。估计到2027年 ,用于推理的工作负载将占据七成以上 。
科技公司竞推新产品
Cerebras、Groq和d-Matrix等草创公司,和超威半导体公司(AMD)和英特尔等传统巨擘,纷纷推出了AI推理芯片 。这些公司活络捕获到了AI推理芯片“除夜显身手”的契机 。
据Cerebras公司官网报导 ,2024年8月28日 ,该公司推出了同名AI推理芯片。这款芯片在Llama 3.1-8B模型上完成了1800token/秒的推理速度;在Llama 3.1 70B上完成了450token/秒的推理速度,约是英伟达GPU推理速度的20倍 。Token指AI措置文本的最小单位或根本元素,如一个单词、一个字符等。
Cerebras公司诠释说 ,这一超卓默示得益于其立异的AI芯片筹划筹划 。其晶圆级引擎(WSE)似乎一座重除夜的“筹算工厂”,最除夜特点是尺寸惊人——单个芯片几近占据了一整块晶圆的面积。在这个超除夜芯片上,筹算单位和内存单位高度集成,构成一个鳞集的网格筹划 。多么的筹划,让数据能在极短距离内 ,于筹算单位和存储单位之间传输 ,从根柢凹凸降了数据挪动成本,措置了GPU推理没法阻拦的内存带宽瓶颈 。此类除夜芯片能更快措信赖息,从而在更短时额定给出谜底。
早在旧年2月,Groq公司就宣布了本身的AI推理芯片GroqCloud。它在Llama 3.1 70B模型上完成了250token/秒的推理处事,速度比GPU几近汲引了一个量级。
