论文《A Year in LLM Serving: Workload Evolution,Caching and Load-Balancing》分析了一份覆盖一年的真实生产 LLM Serving Trace,包含 61.2 亿次请求、31.5 万用户、9174 个模型以及约 87.6 万个服务实例。
61 亿次请求背后:LLM Serving 的 Cache 与调度难题
未经允许不得转载:小狮博客 » 61 亿次请求背后:LLM Serving 的 Cache 与调度难题
论文《A Year in LLM Serving: Workload Evolution,Caching and Load-Balancing》分析了一份覆盖一年的真实生产 LLM Serving Trace,包含 61.2 亿次请求、31.5 万用户、9174 个模型以及约 87.6 万个服务实例。