1. 为什么需要流式输出
第八篇文章分析过对话管线的延迟,其中 LLM 生成通常会占总耗时的 70-80%。一段中等长度的完整回复需要等待 500-2000ms,如果 AI 伴侣要生成约 200 字的安慰内容,等待时间还可能超过 3 秒。
LLM 并不是先生成完整答案,再一次性返回。它会逐 token 生成内容,每隔几十毫秒产生一个 token,直到遇到结束标记。第一个 token 可能在 200ms 内就已经可用,如果服务端仍然等待全部内容生成完毕,用户就会额外等待 1-2 秒。
流式输出会在 token 生成后立即传给客户端,让用户从等待完整回复,变成直接看到文字逐步出现。
从首字节时间来看,两种模式存在明显差异:
| 模式 | 首字节时间 | 用户感知 |
|---|---|---|
| 非流式(等完整回复) | 1500-3000ms | "它在想什么?卡了吗?" |
| 流式(逐 token 推送) | 200-500ms | "它在说话了" |
对于实时对话产品,流式输出不是额外的视觉效果,而是控制用户感知延迟的基础能力。
人的阅读速度大约是每秒 5-8 个汉字,而 LLM 通常每秒可以生成 30-80 个 token,约合 15-40 个汉字。生成速度高于阅读速度时,持续追加文字可以明显减轻等待感,也更接近自然的打字过程。
订阅后可阅读剩余内容
AI 电子伴侣企业级项目实战
已发布234节计划发布120节目标已完成195%