其最关键的技术创新是
“专家流式加载(Expert Streaming)”:对于 MoE 模型,运行时只把共享专家(shared expert)、注意力权重、路由器(router)和 KV Cache 常驻内存(约 1.35 GB),而把 256 个路由专家(routed experts)按需从 SSD 流式读取,每层维护一个 16 槽位的 LFU 专家缓存。这种设计把”模型大小”和”内存占用”解耦,使得大模型可以在小内存设备上运行。
【AI 推理】在 Rockchip NPU 上实现 MoE 大模型流式推理的技术方案
未经允许不得转载:小狮博客 » 【AI 推理】在 Rockchip NPU 上实现 MoE 大模型流式推理的技术方案
小狮博客