大模型流式卡顿:先分清是首 Token 慢还是网络抖

演示的时候在笔记本上聊得挺顺,可一接到后台,偶发三十秒没响应,前端界面先转起圈来。有人立刻提议换模型,可日志里明明写着:客户端 10 秒超时、上游还在生成、用户重试了、两次调用都在计费——换模型解决不了三层时钟对不齐这个根本问题。时钟对不齐的时候,群里往往会说一句模型很慢,可真相可能是网关把流式响应攒成了一整块才发出。