不少人都有这种感觉,刚开始用大模型的时候回答又快又顺,连着聊几轮之后,它就跟卡顿了一样,半天蹦不出一个字。其实这不是你的网慢,而是大模型本身的工作方式决定的。
简单说,大模型每生成一个字,都要把之前聊过的所有内容从头到尾重新算一遍。你聊得越久,它要翻的旧账就越厚,计算量自然跟着往上走。这跟人读书差不多,前面读得越快,后面要记的东西越多,反应也就慢下来了。
那有没有办法让它一直保持速度呢?有的。聊到一个阶段,可以让它先把重点总结一下,新开一个话题重新开始;或者干脆把旧的对话删掉,只留最关键的几句话。这样它每次要算的东西少了,速度自然就回来了。
所以下次觉得它变慢,别急着骂服务器,多半是聊天记录太长了。清清对话,往往立刻就流畅。
