理解 Prefill Decode:AI 回答慢,慢在输入还是输出?

这两种体验都叫“慢”,但在模型推理服务中,它们对应着两个不同阶段。第一个叫 Prefill,就是模型先把你的输入读完;第二个叫 Decode,是模型开始逐步生成回答。

赞(0)
未经允许不得转载:小狮博客 » 理解 Prefill Decode:AI 回答慢,慢在输入还是输出?
分享到: 更多 (0)

联系我们