ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【ACL 2026】OCR-Memory 论文解读:把 Agent 记忆搬进图像域,用光学检索换更长的历史|从 Agent 记忆工程视角

【ACL 2026】OCR-Memory 论文解读:把 Agent 记忆搬进图像域,用光学检索换更长的历史|从 Agent 记忆工程视角 摘要本文解读 ACL 2026 论文《OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory》。该论文提出光学上下文检索记忆OCR-Memory通过融合图像化轨迹存储、Set-of-Mark 视觉锚点与自适应多分辨率主动召回把长程 agent 的历史经验从文本域整体搬到图像域其特别之处在于检索阶段模型只输出片段索引、原文再由外部日志逐字取回从而把「找证据」与「生成证据」彻底解耦。实验表明Mind2Web 上元素准确率 53.8%、步成功率 46.1%、任务成功率 4.8% 全面第一AppWorld 平均成功率 58.1%Hard 子集 30.8%并把每步注入推理模型的文本 token 从 3,980 降到 5966.7 倍为长程 agent 记忆给出了一条「用存储与延迟换上下文」的可行路径。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQOCR-Memory 和普通的 RAG 记忆有什么区别为什么把记忆存成图像反而更省 token多分辨率降采样会不会让检索变差这套方法能直接用来替换现有 agent 的记忆模块吗论文最大的贡献是模型还是机制参考链接论文基本信息项目内容标题英文OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory标题中文把 Agent 记忆搬进图像域用光学检索换更长的历史作者Jinze Li、Yang Zhang†、Xin Yang、Jiayi Qu、Jinfeng Xu、Shuo Yang、Junhua Ding、Edith Cheuk-Han Ngai†† 为通讯作者机构香港大学HKU、北德克萨斯大学UNT、筑波大学、延世大学会议ACL 2026Long Papers, pp. 10409–10420arXivhttps://arxiv.org/abs/2604.26622项目网站论文未公开项目主页代码与数据待作者释放背景与动机长程 agent 的核心矛盾不是推理能力而是经验的丰富程度与文本上下文窗口之间的冲突。在 Web 自动化、移动端应用操作这类连续任务里agent 会持续产生推理轨迹、工具调用与环境反馈这些内容理想上都应该被完整保留但有限上下文窗口让它既存不下、也读不完。结果是现有方法被迫做压缩而压缩几乎总是要以信息损失为代价。现有路线可以归成三类局限都很具体检索式记忆MemGPT、MemoryBank把历史外置存储、按语义相似度取回片段。它能扩展可用上下文但相似度匹配本身脆弱——检索到的片段可能主题相关却在逻辑上无关任务一旦依赖因果或长程依赖就会失效。经验抽象Voyager、Agent Workflow Memory把轨迹压成可复用的技能或工作流。它降低了后续推理成本却丢掉了错误信息、中间状态、细微的对话轮次这类低层细节而这些恰是调试与忠实回溯所必需的。上下文压缩ACON、LLMLingua、StreamingLLM压缩上下文本身包括潜空间记忆、学习式压缩策略、token 剪枝与流式推理。代价是压缩比与保真度的直接权衡并且在多模态场景里视觉布局与结构线索特别容易在纯文本摘要中丢失。本文的出发点来自 DeepSeek-OCR 的一个观察密集文本可以被编码成消耗更少上下文的视觉 token同时保持原始信息的完整保真。既然视觉是高密度的、无损的载体那么 agent 的长期记忆为什么一定要以文本形式存储把记忆的介质从文本换成图像再把检索任务从「生成答案」降级为「选择索引」就有机会同时拿到高压缩与高保真。研究主线从问题到结论图 1Mermaid 流程图OCR-Memory 的研究主线——问题文本上下文预算受限→ 动机摘要与检索都在丢信息→ 设计历史渲染成 SoM 图像→ 方法模型只预测片段索引→ 取回按索引取回逐字原文→ 结论两个长程基准全面第一。基准/方法设计OCR-Memory 把 agent 记忆重新定义为一个图像记忆库加索引式检索的问题。记忆库是一个按序排列的条目集合 $\mathcal{M} (m_1, \dots, m_N)$其中第 $i$ 个条目是 $m_i (I_i, S_i, \pi_i)$$I_i$ 是轨迹片段被渲染并标注后的图像$S_i (s_{i,1}, \dots, s_{i,K_i})$ 是按编号存储的原始文本片段$\pi_i$ 则是时间戳与 episode id 这类元数据。给定新查询 $q$检索函数读取记忆库并返回一个小的支持片段索引集合 $\hat{S}(q) g_{\theta}(q, \mathcal{M})$再由取回函数把它映射回原样存储的文本 $E \mathrm{Fetch}(\hat{S}(q), \mathcal{M})$。这里的关键设计是 $\hat{\mathcal{S}}(q)$ 是一个索引集合而不是一段文字$\mathrm{Fetch}(\cdot)$ 再把这些索引映射回原样存储的文本片段。也就是说$g_{\theta}$不需要回答问题它只被优化为「在有限 token 预算下取回能提升下游成功率的证据」真正的推理仍由主 agent 完成。这个分工把上下文理解与证据生成彻底解耦从机制上消除了「检索阶段编造内容」的空间。图 2OCR-Memory 总览论文 Fig. 1。左交互历史被渲染并压缩成多分辨率图像存入记忆库中检索时模型扫描带 Set-of-Mark 视觉锚点的历史图像只预测相关片段的编号右按编号从原日志确定性取回逐字文本既避免生成式幻觉也把 token 用量压到最小。分类全景把 OCR-Memory 放回 agent 记忆的技术版图它改变的其实是「记忆用什么介质表示」这一最底层的选择图 3Mermaid 流程图把 OCR-Memory 放回 agent 记忆的技术版图——它改变的是最底层的一层选择即记忆用什么介质来表示从文本摘要与工作流、文本向量检索、潜空间与 KV 压缩走到图像式的光学记忆。方法细节论文给出四个核心设计要素前两个解决「找得准」后两个解决「存得起」。1Locate-and-Transcribe把生成任务改成指针选择。沿用 Set-of-MarkSoM提示每个文本片段在记忆图像中用红色 bounding box 高亮并标注唯一数字 ID $k\in[1,K_i]$。模型是严格的相关性抽取器对一张含 $K_i$ 个片段的图像输出一个长度为 $K_i$ 的二值相关向量 $\hat{\mathbf{y}}_i(q)$把所有记忆图像上的正例汇总就得到全局索引集合。由于输出被约束为「0 / 1」标签 token任务从「下一 token 生成」变成了「下一 token 判别」。2召回导向打分宁多取不漏取。仅靠贪心解码会带来漏检风险因此论文从标签位的 logits 校准出片段相关概率 $p_{i,k}(q)\frac{\exp(z_{i,k}(1))}{\exp(z_{i,k}(1))\exp(z_{i,k}(0))}$而不是直接使用离散输出。随后用低阈值 $\tau0.4$ 与 Top-$K$ 兜底$K5$取并集构成一个最小保证策略阈值部分保留高置信片段Top-$K$ 部分保证模型不确定时每张图至少取回 $K$ 段单次查询最多注入 20 段文本超出时按概率排序截断。3多分辨率轨迹与主动召回上采样。论文用记忆龄期 $\Delta t_i$ 决定分辨率档位$\ell_i\rho(\Delta t_i)$更老的记忆被降采样成低分辨率缩略图视觉 token 成本随之下降。关键在于这一步是可逆的一旦某个降采样的记忆被检索命中就立即重渲染回高分辨率并在该 episode 内豁免衰减函数避免已经被证明有用的证据再次退化。实现上不存储高低分辨率双份副本只保留原始文本日志与当前图像表示需要时按需重渲染。4训练冻结视觉编码器只微调解码器。骨干是 DeepSeek-OCR (3B)视觉编码器 $\theta_{\mathrm{vis}}$ 完全冻结语言解码器用 LoRA 适配挂在 query、key、value 与输出投影上秩 $r16$、缩放 $\alpha32$、dropout $0.05$。数据侧把 HotpotQA 改造为判别任务丢弃文本答案只用「支持事实」作为监督目标是最小化加权二元交叉熵 $\mathcal{L}-\sum_{n}\sum_{k}[w_ y_k \log p_k w_- (1-y_k)\log(1-p_k)]$并刻意让 $w_ w_-$实际取 $2.0$ 与 $1.0$因为正样本稀疏且漏检的代价更高。训练时还引入分辨率课程按 $\pi[0.3,0.7]$ 在两档分辨率间采样让模型提前适应部署时会遇到的「模糊旧记忆」。优化用 AdamW、峰值学习率 $1\times10^{-5}$ 的余弦计划、warmup 覆盖 10% 步数、全局 batch 128、训练 3 个 epoch。实验设计与结果评测覆盖两个长程基准记忆模块上下文窗口统一设为4096 token基线横跨三类记忆范式Zero-Shot无历史、Retrieval稠密文本 RAG、MemoryBank、Agent Workflow Memory (AWM) 与 ACON。主推理 agent 在默认设置下是 GPT-4temperature 0。Mind2WebCross-Task元素准确率 / Action F1 / 步成功率 / 任务成功率%方法Ele AccAction F1Step SRTask SRZero-Shot40.146.237.92.2Retrieval41.348.238.92.7MemoryBank43.849.539.23.3AWM49.155.742.64.3ACON48.254.141.44.1OCR-Memory53.859.246.14.8AppWorld成功率 %方法EasyMedHardAvgZero-Shot68.736.220.941.9Retrieval72.544.821.446.2MemoryBank81.350.124.952.1AWM84.153.627.255.0ACON84.855.128.756.2OCR-Memory86.257.430.858.1消融一Set-of-Mark 是否必要Mind2Web变体Ele AccStep SR延迟 (s)OCR-MemoryFull53.846.11.7w/o SoM改自由文本生成46.539.25.3w/o SoM改预测 bounding box49.244.52.1消融二多分辨率主动召回Mind2Web分辨率策略Step SRTask SR平均视觉 token / 帧Static Low-Res512²39.72.965Static High-Res1024²46.54.9256Dynamic本文46.14.882检索级评测与证据忠实度方法Recall1Recall5Recall10MRRDense Text-RAG52.774.382.10.61OCR-Memory78.693.496.20.84长上下文检索RULER / NIAHRecall1上下文长度压缩比准确率4k10.3×98.58k10.2×97.216k10.7×95.832k10.6×94.1系统效率画像Mind2Web连续记录方法磁盘 / Episode文本 Token / 步检索延迟 / 步Text-RAG18 KB3,9800.3 sOCR-Memory1.47 MB5961.7 s骨干泛化附录 B骨干方法Ele AccStep SRTask SRGPT-4Text Retrieval (RAG)41.338.92.7GPT-4OCR-Memory53.846.14.8Qwen3-32BText Retrieval (RAG)35.231.51.8Qwen3-32BOCR-Memory48.642.33.9图 4不同上下文 token 上限下的性能对比论文 Fig. 2。OCR-Memory 在四个 Mind2Web 指标上一致优于文本检索且预算越紧差距越大在 1,024 token 的极端限制下仍可工作而 Text-RAG 因信息损失明显退化。结果对比总结图 5Mermaid 流程图结果对比链路——检索级 Recall1 由 52.7 提升到 78.6证据忠实度由 84.3% 提升到 100%每步注入文本 token 由 3,980 降到 596而这笔收益的代价是单 episode 磁盘占用从 18 KB 涨到 1.47 MB。关键发现两个基准全面第一且优势集中在需要精确 grounding 的指标。Mind2Web 元素准确率 53.8%AWM 49.1%、步成功率 46.1%AWM 42.6%、任务成功率 4.8%AppWorld 平均成功率 58.1%Hard 子集 30.8%高于 Retrieval 的 21.4% 与 AWM 的 27.2%。证据忠实度是这套机制最硬的证据。检索级评测中 Recall1 从 52.7% 提到 78.6%、MRR 从 0.61 提到 0.84内容级忠实度达到100.0%而自由生成式检索只有 84.3%——因为模型只输出索引原文由日志逐字取回。SoM 锚点是精度与效率的共同来源。去掉 SoM 改回自由文本生成元素准确率掉 7.3 个百分点53.8 → 46.5延迟涨到 5.3 秒、约 3 倍改用 bounding box 预测虽然快2.1 秒但只到 49.2。分辨率可以当作预算来花。动态策略用 82 个视觉 token 拿到 46.1 的步成功率纯高分辨率用 256 个才拿到 46.5仅差 0.4 个百分点却省下约 68% 的 token纯低分辨率虽只花 65 个但步成功率掉到 39.7。收益与骨干无关。把主推理 agent 从 GPT-4 换成 Qwen3-32B元素准确率仍从 35.2 提到 48.6、步成功率从 31.5 提到 42.3相对增益被完整保留。长上下文下压缩几乎不损精度。从 4k 到 32k压缩比稳定在 10.2–10.7×Recall1 只从 98.5% 缓降到 94.1%。局限性论文对代价的交代相当克制四条局限都写进了正文需要额外微调。不像免训练的检索基线这套框架必须训练一个专用的光学检索模型LoRA 适配 3B 解码器带来额外的训练资源开销。渲染与存储更贵。把交互日志渲染成图像比直接存文本更耗算力视觉历史也更占磁盘——单个 episode 从 18 KB 涨到 1.47 MB。额外显存占用。部署时视觉编码器的参数必须与主语言模型一同常驻内存这在显存紧张的环境里是真实成本。适用边界明确。收益出现在上下文预算受限的长程任务上当存储、延迟或显存比 token 更贵时这笔账可能反转。论文明确把 OCR-Memory 定位为一次资源重分配而不是「免费的更长记忆」。还有两处值得读者留意论文写的是「可扩展存储任意长的历史」但 NIAH 只验证到 32k另外 100% 忠实度只表示「取回的文本与存储证据完全一致」并不代表选中的每一段都相关——作者在正文里专门做了这个限定。常见问题FAQOCR-Memory 和普通的 RAG 记忆有什么区别普通 RAG 在文本域里按向量相似度取回片段检索结果可能主题相关但逻辑无关而且取回的是「文本块」本身OCR-Memory 先把历史渲染成带编号锚点的图像让模型只输出片段索引再由日志逐字取回原文。前者在检索阶段仍可能引入生成式误差后者从机制上排除了这种误差。为什么把记忆存成图像反而更省 token因为视觉是高密度载体。DeepSeek-OCR 已经证明密集文本可以映射成极少的视觉 token 且保持信息完整OCR-Memory 在此之上报告 32k 上下文下仍有约 10.6× 压缩、94.1% 的 Recall1注入推理模型的文本 token 从每步 3,980 降到 596。多分辨率降采样会不会让检索变差论文用消融回答了这一点纯低分辨率会让步成功率掉 6.4 个百分点46.1 → 39.7因为模型开始读不懂部分词。因此方案不是一味降采样而是降采样加命中即回升高分辨率动态策略以 82 个 token 取得 46.1与纯高分辨率 46.5 只差 0.4 个百分点。这套方法能直接用来替换现有 agent 的记忆模块吗需要满足前提一是愿意训练一个专用光学检索器或至少接入一个能输出 SoM 索引的视觉模型二是能接受更高的存储与检索延迟。如果场景本身显存紧、磁盘小、延迟敏感论文建议的权衡方向是只对「旧记忆」做光学编码让新近历史仍走高分辨率路径。论文最大的贡献是模型还是机制机制。它的核心不是更强的视觉模型而是换掉记忆的存储介质并把检索降级为索引选择Locate-and-Transcribe 让「找证据」与「生成证据」解耦于是高压缩与逐字保真不再互斥。这也解释了为什么把推理骨干从 GPT-4 换成 Qwen3-32B 后相对优势依然保留。参考链接论文 arXiv 摘要页https://arxiv.org/abs/2604.26622ACL Anthology 正式版https://aclanthology.org/2026.acl-long.474/DeepSeek-OCR: Contexts Optical Compression光学压缩基础https://arxiv.org/abs/2510.18234Mind2Web: Towards a Generalist Agent for the Web评测基准https://arxiv.org/abs/2306.06070AppWorld评测基准https://arxiv.org/abs/2407.18901Agent Workflow MemoryAWM 基线https://arxiv.org/abs/2409.07429ACON: Optimizing Context Compression for Long-horizon LLM Agents压缩基线https://arxiv.org/abs/2510.00615MemoryBank: Enhancing Large Language Models with Long-Term Memory检索基线https://arxiv.org/abs/2305.10250给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件
返回列表