Chatbox 中文文档 下载 App

对话太长被截断:上下文窗口与自动压缩

聊着聊着 AI 忘了开头说过什么,或者直接报上下文超长——这是所有 AI 对话工具的共性约束,这页讲怎么在客户端里管理它。

为什么会"失忆"

模型一次能处理的文本总量有上限,称为上下文窗口。对话进行时,客户端把历史消息作为上下文一起发给模型;历史越长,越接近窗口上限,超了就报错或被动截断。

三个管理手段

手段一:限制发送的历史条数

设置里的「最大上下文消息数」决定每次带多少条历史给模型:

手段二:开启自动压缩

设置里有「上下文自动压缩」开关和压缩阈值。开启后,对话超过阈值时客户端会把较早内容收成摘要,给近期内容腾位置,让对话理论上可以一直续下去。压缩是自动的,不需要手动触发。

手段三:手动开新对话

话题切换时主动新建对话,是最省 Token 也最不易出错的办法。重要背景可以复制粘贴到新对话开头,或者干脆沉淀成知识库(见知识库概念),让 AI 随用随查。

报错后的处理

已经弹出上下文超长报错的对话,两条路:

  1. 调低「最大上下文消息数」后继续
  2. 新开对话,把关键信息手动带过去

完整排查步骤见上下文超长报错。

与 Token 消耗的关系

上下文越长,每轮请求携带的输入 Token 越多,费用(订阅点数或 API 账单)也随之上涨。省钱的具体技巧清单见读懂 Token 消耗。