资讯

Heterogeneous Memory Chiplets Accelerate Multi-Request LLM Inference (NUS)

SemiEngineering·2026/9/11 21:56:01🔗 原文

📋总体概括

新加坡国立大学研究团队发表论文CHIPSMORE,提出一种多模式、多请求LLM推理加速器,通过在互连和存储中集成计算(compute-in-interconnect与CIM)的异构存储Chiplet方案,同时支持基础模型推理和LoRA低秩适配推理,应对多样化工作负载。该研究瞄准大模型推理服务中多请求并发的算力与内存带宽瓶颈,属于Chiplet+存算一体前沿探索,但目前仍停留在学术论文阶段,尚未见工程化和产业落地信息。

关键信息

  • 新加坡国立大学团队发布CHIPSMORE论文,面向多模式、多请求LLM推理加速
  • 核心架构整合互连内计算与存算一体(CIM),采用异构存储Chiplet设计
  • 方案同时支持基础模型推理与LoRA低秩适配推理,适配多样化工作负载
  • 目标直击大模型服务多请求并发下的算力与内存带宽瓶颈
  • 目前为学术研究成果,尚无产业化和量产信息

🔥犀利点评

学界在Chiplet+CIM上卷得飞起,但请注意:多请求LLM推理的真瓶颈从来不只是带宽,还有调度、KV Cache管理和成本。NUS这篇的思路方向没错——把计算搬到数据旁边——可LoRA多租户推理的商用市场早已被GPU厂商和推理框架软件优化吃掉大半,专用架构要证明的不是论文里的性能倍数,而是面对持续迭代的模型结构时,这种高度定制化硬件会不会三个月就过时。学术演示到可用产品之间,隔着的是整个工具链和生态。

本文由本站自动聚合,以下为原始来源:前往 SemiEngineering 阅读全文