这两种体验都叫“慢”,但在模型推理服务中,它们对应着两个不同阶段。第一个叫 Prefill,就是模型先把你的输入读完;第二个叫 Decode,是模型开始逐步生成回答。
理解 Prefill Decode:AI 回答慢,慢在输入还是输出?
未经允许不得转载:小狮博客 » 理解 Prefill Decode:AI 回答慢,慢在输入还是输出?
这两种体验都叫“慢”,但在模型推理服务中,它们对应着两个不同阶段。第一个叫 Prefill,就是模型先把你的输入读完;第二个叫 Decode,是模型开始逐步生成回答。