跟以往的博客内容不一样,这里我首先是建议大家评估自己的本地环境和硬件条件,确认最适合自己本地的模型。尤其是当GPU显卡不多,或者是配置不太给力的情况下,为了确保模型的可用性,建议还是往小了选型,优先保障性能。常规的tokens速度如果只有个十几二十的,体验会很差。我这里使用一张5090D,运行BF16的Qwen3-Code-Next,在长对话里大约是40 tokens/s的速率,这个已经是略显缓慢了。
基于Qwen3-Code-Next+KTransformer的本地Vibe Coding
未经允许不得转载:小狮博客 » 基于Qwen3-Code-Next+KTransformer的本地Vibe Coding
小狮博客