AI 电子伴侣
创建时间: 2026-03-24最后更新: 2026-07-29

1. 为什么需要流式输出

第八篇文章分析过对话管线的延迟,其中 LLM 生成通常会占总耗时的 70-80%。一段中等长度的完整回复需要等待 500-2000ms,如果 AI 伴侣要生成约 200 字的安慰内容,等待时间还可能超过 3 秒。

LLM 并不是先生成完整答案,再一次性返回。它会逐 token 生成内容,每隔几十毫秒产生一个 token,直到遇到结束标记。第一个 token 可能在 200ms 内就已经可用,如果服务端仍然等待全部内容生成完毕,用户就会额外等待 1-2 秒。

流式输出会在 token 生成后立即传给客户端,让用户从等待完整回复,变成直接看到文字逐步出现。

从首字节时间来看,两种模式存在明显差异:

模式首字节时间用户感知
非流式(等完整回复)1500-3000ms"它在想什么?卡了吗?"
流式(逐 token 推送)200-500ms"它在说话了"

对于实时对话产品,流式输出不是额外的视觉效果,而是控制用户感知延迟的基础能力。

人的阅读速度大约是每秒 5-8 个汉字,而 LLM 通常每秒可以生成 30-80 个 token,约合 15-40 个汉字。生成速度高于阅读速度时,持续追加文字可以明显减轻等待感,也更接近自然的打字过程。

订阅后可阅读剩余内容
AI 电子伴侣企业级项目实战
已发布234计划发布120目标已完成195%