行业资讯

【Agent开发第三期】短期记忆history,让模型“记住“上一句

发布时间:2026/8/2 3:26:46
【Agent开发第三期】短期记忆history,让模型“记住“上一句 文章目录一、前言二、概念对齐:为什么回灌能让模型记住2.1 回顾:模型为什么失忆2.2 回灌历史:从一句话到完整历史2.3 一张表看清三期演进2.4 本期的组装公式三、动手做:从金鱼记忆到短期记忆3.1 维护一个 messages 列表3.2 上下文长度限制:历史不能无限长3.3 reset 和 history 命令3.4 自动演示:对比第 02 期的金鱼记忆四、跑起来:短期记忆的实际体验4.1 为什么回灌历史能让模型记住?4.2 token 增长可视化4.3 调用流程(与前两期一致)五、执行脚本六、总结一、前言第 02 期你跑通了循环对话,但模型有金鱼记忆——你上一句说我叫张三,下一句问我姓什么,它答不上来。明明刚说过,转头就忘。根本原因:每次调用messages里只传当前这一句,模型看不到历史。这不是模型笨,是你没把历史喂给它。这一期我们就动手维护一份messages列表,每次调用把完整对话历史回灌进去,让模型真正记住上一句。同时引入上下文长度限制——历史不能无限长,这是个新问题。看完你就能:用 messages 列表维护完整对话历史理解回灌历史为什么能让模型记住用 token 计数直观看到上下文在增长加一个最简单的上下文长度限制,防止历史无限膨胀本文是 Agent 教学系列第 03 期的实战笔记,干货为主,偶尔自嘲,各位看官将就着看。二、概念对齐:为什么回灌能让模型记住2.1 回顾:模型为什么失忆上一期讲过,模型 API 是无状态的——每次请求都被当成全新对话,服务器不保存任何上下文。所以连续对话的幻觉,是客户端伪造出来的:你自己维护一份历史,每次请求把整段历史一起发过去。但第 02 期我们故意没这么做——messages里永远只有当前这一句,专门让你踩一脚金鱼记忆。这一期补上。2.2 回灌历史:从一句话到完整历史核心改动就一处:把chat()的入参从一句话变成完整 messages 列表。defchat(messages:list[dict])-tuple[str,int,int]:responseclient.chat.completions.create(modelMODEL,messagesmessages,# ← 完整历史,不再只传当前一句max_tokens1000,)...每次对话的流程:用户输入 →{role: user, content: 输入}加入 messages调用 API,把完整 messages 发过去模型回复 →{role: assistant, content: 回复}也加入 messages下一次调用,messages 里已经带着之前的全部问答这样模型每次都能看到完整上下文,金鱼记忆问题解决。2.3 一张表看清三期演进第 01 期第 02 期第 03 期调用方式单次一问一答while 循环while 循环 历史回灌messages 数组只传当前一句只传当前一句完整对话历史记忆能力无无(故意暴露痛点)有(短临记忆)token 观察无每次 prompt 都很小prompt 随历史增长2.4 本期的组装公式短期记忆 messages[] 回灌 上下文长度限制把历史塞进去,模型就记住了;但历史不能无限长,得加个上限。三、动手做:从金鱼记忆到短期记忆3.1 维护一个 messages 列表用一个 list 在内存里维护对话历史,角色严格按user/assistant交替:messages:list[dict][]# 用户输入messages.append({role:user,content:user_input})# 调用 API(传完整历史)answer,p,cchat(messages)# 模型回复也加回历史messages.append({role:assistant,content:answer})这样下一次调用时,messages 里已经带着之前的全部问答,模型能看到上下文。3.2 上下文长度限制:历史不能无限长历史一直累积,prompt_tokens会越滚越大,最终触发模型的上下文长度上限(DeepSeek 通常 64K token)。本期用最简单的截断策略:MAX_ROUNDS10# 1 轮 1 user 1 assistantdeftrim_history(messages:list[dict])-list[dict]:roundssum(1forminmessagesifm[role]user)ifroundsMAX_ROUNDS:returnmessages excess_roundsrounds-MAX_ROUNDS cutexcess_rounds*2# 每轮 2 条returnmessages[cut:]超过 10 轮时,删掉最早的一轮,保留最近 10 轮。简单粗暴,但有边界。第 07 期会升级为 compact 压缩策略(把旧对话摘要成一段,而非直接删),本期先解决有没有的问题。3.3 reset 和 history 命令reset:清空 messages 列表,重新开始(第 02 期埋的伏笔,这期兑现)history:打印当前 messages 列表,直观看到[user, assistant, user, assistant, ...]的结构这两个命令不是花架子,是帮你调试和理解历史是怎么组织的。3.4 自动演示:对比第 02 期的金鱼记忆程序跑起来会先自动问两个问题(和第 02 期一模一样):“我叫张三,是一名 Python 后端工程师” —— 告诉模型信息“我姓什么?我是做什么工作的?” —— 看它能否接住这次模型应该能答上来——因为 messages 里带着上一轮的问答。同时你会看到第 2 轮的prompt_tokens比第 2 期大,因为历史一起发了过去。四、跑起来:短期记忆的实际体验4.1 为什么回灌历史能让模型记住?模型本身是无状态的,但每次调用都会读到你传入的完整messages。只要历史在 messages 里,模型就能看到之前说过什么。第 1 轮: messages [user: 我叫张三] → 模型回复 你好,张三! messages [user: 我叫张三, assistant: 你好,张三!] 第 2 轮: messages [user: 我叫张三, assistant: 你好,张三!, user: 我姓什么?] → 模型能看到前两条,答 你姓张4.2 token 增长可视化对比第 02 期,本期的prompt_tokens会明显更大,因为历史一起发了过去:轮次第 02 期 prompt_tokens第 03 期 prompt_tokens第 1 轮~10(一句话)~10(一句话)第 2 轮~10(还是一句话)~30(含第 1 轮的问答)第 5 轮~10~150(含前 4 轮)这就是上下文长度问题的由来——历史越多,token 越贵,也越容易触顶。4.3 调用流程(与前两期一致)你的代码 → openai SDK → HTTPS 请求(带完整 messages) → DeepSeek → 推理 → 返回 JSON usage相比第 02 期,唯一的差异是:请求体里的messages从一句话变成了完整历史。五、执行脚本#!/usr/bin/env python3step03_history.py — 第 03 期:短期记忆 history 本期目标: 1. 维护一个 messages 列表,每次调用把完整对话历史回灌进去 2. 让模型真正记住上一句,解决第 02 期的金鱼记忆 3. 引入上下文长度限制,历史不能无限长——超限时做最简单的截断 累积式:step03 step02 messages[] 回灌 上下文长度限制 (尚未做记忆压缩/长期记忆,后续第 07 期解决) 运行: python code/step03_history.py importosfromdotenvimportload_dotenvfromopenaiimportOpenAIfromprompt_toolkitimportpromptfromprompt_toolkit.historyimportInMemoryHistory load_dotenv()# 1. 初始化客户端(与第 01/02 期一致)clientOpenAI(api_keyos.environ[DEEPSEEK_API_KEY],base_urlos.environ.get(DEEPSEEK_BASE_URL,https://api.deepseek.com),)MODELos.environ.get(DEEPSEEK_MODEL,deepseek-chat)# 上下文长度上限(轮数,1 轮 1 user 1 assistant)MAX_ROUNDS10defchat(messages:list[dict])-tuple[str,int,int]:带历史回灌的对话:传入完整 messages 列表,返回 (回答, prompt_tokens, completion_tokens)。responseclient.chat.completions.create(modelMODEL,messagesmessages,max_tokens1000,)answerresponse.choices[0].message.content usageresponse.usagereturnanswer,usage.prompt_tokens,usage.completion_tokensdeftrim_history(messages:list[dict])-list[dict]:上下文长度限制:超过 MAX_ROUNDS 轮时,从最早的一轮开始截断。roundssum(1forminmessagesifm[role]user)ifroundsMAX_ROUNDS:returnmessages excess_roundsrounds-MAX_ROUNDS cutexcess_rounds*2returnmessages[cut:]defmain():print(*60)print(第 03 期:短期记忆 history —— 让模型记住上一句)print(*60)print(f当前模型:{MODEL})print(fAPI 地址:{client.base_url})print(f上下文上限:{MAX_ROUNDS}轮(超出自动截断最早))print(*60)# 2. 自动演示:对比第 02 期的金鱼记忆 demo_questions[我叫张三,是一名 Python 后端工程师,我姓什么?我是做什么工作的?,]print(\n[自动演示] 同样两个问题,这次模型能否记住上一句:\n)messages:list[dict][]fori,qinenumerate(demo_questions,1):print(f[问题{i}]{q})messages.append({role:user,content:q})try:answer,p,cchat(messages)print(f[回答]{answer})print(f[token] prompt{p}completion{c}total{pc})print(f[历史] 当前 messages 共{len(messages)}条)messages.append({role:assistant,content:answer})exceptExceptionase:print(f[出错]{e})returnprint(-*60)print(\n 对比第 02 期:这次模型答上来了——因为 messages 里带着上一轮的问答,模型看到了完整上下文。\n 但注意 prompt_tokens 比第 02 期大,因为历史一起发了过去。\n)# 3. 交互式对话(带历史回灌)print(*60)print(现在进入自由对话(有记忆,但超过 10 轮自动截断最早))print(输入 quit 退出 / 输入 reset 清空历史 / 输入 history 查看历史)print(←/→ 移动光标,↑/↓ 翻历史,Ctrl-C 作废当前行重输)print(*60)total_prompt0total_completion0cli_historyInMemoryHistory()whileTrue:try:user_inputprompt(\n你: ,historycli_history).strip()except(EOFError,KeyboardInterrupt):print( (本行作废,重新输入))continueifuser_input.lower()in(quit,exit,q):print(f\n[本次会话 token 汇总] prompt{total_prompt}fcompletion{total_completion}total{total_prompttotal_completion})print(f[历史] 退出时共{len(messages)}条消息)print(再见!)breakifuser_input.lower()reset:messages.clear()total_prompt0total_completion0print([提示] 历史已清空,重新开始对话。)continueifuser_input.lower()history:print(f[历史] 共{len(messages)}条消息:)foridx,minenumerate(messages):rolem[role]contentm[content][:50](...iflen(m[content])50else)print(f{idx:2d}. [{role:9s}]{content})continueifnotuser_input:continuemessages.append({role:user,content:user_input})messagestrim_history(messages)try:answer,p,cchat(messages)total_promptp total_completionc messages.append({role:assistant,content:answer})print(fAlex:{answer})print(f[token] 本次 prompt{p}completion{c}f累计 total{total_prompttotal_completion})print(f[历史] 当前{len(messages)}条消息f({sum(1forminmessagesifm[role]user)}轮))exceptExceptionase:messages.pop()print(f[出错]{e})if__name____main__:main()六、总结一句话回顾:模型本身无记忆,记忆是你用 messages 列表喂给它的。三个关键动作记牢:维护 messages 列表→ 每轮把 user assistant 都加进去回灌历史→ 调用时传完整 messages,模型就能看到上下文上下文限制→ 历史不能无限长,超限时截断最早(下期升级为压缩)一行代码记住本期:messages.append({role:assistant,content:answer})# ← 回复也加回历史把模型回复也加入 messages,下一轮调用时它就记住了。适用场景:这篇适合刚跑通第 02 期、想让模型真正记住对话的人。下一期预告:第 04 期——System Prompt 人设。我们用templates/SOUL.md给 Agent 设定技术助理 Alex的角色,对比有无 system prompt 时的行为差异。同时 system prompt 会成为 messages 列表的第一条,进一步影响上下文。感谢各位看官的一路陪伴,大家都再接再厉!