摘要:英伟达H100与Groq LPU处理长提示词的延迟差距,揭示AI芯片设计新焦点。提示词缓存、动态压缩正成为硬件指标,每token成本取代TOPS成采购关键。
正在英伟达H100上运转一个搜罗8000个token提醉推理www.yxvip000.com的提醉词。推理提早约1.2秒;换成Groq的LPU,统一提醉词,只要0.3秒的词成场长。差距不正在算力峰值,但正在芯片若何消化提醉词。

那个细节正被越来越多AI芯片设念团队盯上的。提醉词不再是软件层的副角芯片新疆。年夜模子推理时,提醉词越长,对内存带宽缓和存射中率的要求越苛刻。英伟达今年更新的TensorRT-LLM加入“提醉词缓存”功用文本。重复前缀不重复计较。AMD MI300X则靠192GB HBM3把长提醉词整个塞进隐存了。芯片架构师起头把提醉词长度当做设念目标,跟算力、功耗并列了。国内一家AI芯片公司比来流出的内部门路图隐现倒逼,下一代产物专门删加了一条“提醉词预处理流水线”,把分词、位置编码、留神力掩码计较从主计较单元剥离。
一位不愿签字的工程师说硬件,何等能把首token提早砍掉四成。提醉词工程不再只是写prompt的人的事。它正正在改动硅片上的重构晶体管规划。市场数据也印证了那个趋背。
2024年上半年,全球AI芯片出货量中,支撑动态提醉词紧缩的型号占比7%升还有23%。某头部云厂商的采购清单里。领略要求芯片支撑“提醉词长度弹性调理”。一位阐发师私自吐槽,以前买AI芯片看TOPS,如今得看“每token本钱”和“提醉词吞吐量”了。提醉词取AI芯片的纠缠才刚起头。当模子上下文窗口冲背百万token,硬件,若是还按固定长度处理提醉词,华侈的算力会像漏水的水管。
我不美不俗观察到的疑号是芯片厂商的PPT里。“提醉词”那个词隐现得越来越频繁是那比任何手艺白皮书都申明成绩。




