AI自我提升算力!Kimi K3创新「超级算子」,推理速度提高三倍

2026-10-02 6310

最近,AI领域有了新的进展,vLLM团队建立的Inferact发布了一套开源的TPU Megakernels(超级算子),显著提升了模型的推理速度。通过将Kimi K3的92个MoE层整合在同一个程序中,并在16颗谷歌TPU v7上运行,单用户的输出速度达到709 tokens/s,而在同样配置下的英伟达GB200则为452 tokens/s。在关闭投机解码的情况下,其速度在1到8的并发下也达到GB200的1.4到2倍。尽管TPU v7的显存带宽低于GB200,但优势在于编写的方式。

此外,在AICC2026上,浪潮信息推出了元脑SD200 Ultra超节点AI服务器,利用128颗本土AI芯片,K3的Token生成延迟压缩至5.85毫秒。这两项技术在算子处理上都寻求突破。值得注意的是,浪潮信息的超级算子部分是由K3自主生成的。

很多人认为大模型的推理速度缓慢是因为算力不足,实际上,芯片在许多时间段内处于闲置等待数据。在生成每个token时,模型需要将参数从显存中转移。推理速度往往受到显存带宽的制约,尤其在传统推理框架中,需要依次启动多个算子,每个算子都需要重复数据搬运和计算。这就像老旧火车在途中频繁停靠,浪费了运行时间。 龙8国际登录

为了解决这个问题,Inferact采取了将所有92层整合到一个kernel中的方法,程序能够根据不同层任务自主调配资源,极大程度地减少了数据搬运的时间。这得益于TPU v7设计中提供的64MiB片上高速内存,完全由程序控制数据的存放和释放。

关于为何编译速度如此快,Inferact指出,工程师们现在可以迅速确定操作的顺序和重叠,而这一过程此前需要编译器反复尝试。写这种巨型算子的技术门槛极高,作者都是顶尖的推理工程师,他们还表示未来会有更多由AI编写的算子涌现出来。

AI在算子编写领域的接管已成趋势。DeepSeek的算子工程师刘胜在告别“手写算子”的同时表示,他预计AI将在不久的将来能够超过人工作的水平。随着AI工具越来越强大,算子优化也成为整体超节点系统的一部分,国内的浪潮信息同样在进行算子融合,旨在减少数据搬运的开销。两者的不同在于对算子融合的粒度安排:Inferact将整个解码过程融合,而浪潮信息则相对细分围绕特定机制进行。 龙8国际登录

推荐产品