
炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
这项由浙江大学、上海人工智能实验室、复旦大学、上海交通大学、上海创新研究院及澳大利亚国立大学等多家机构联合开展的研究,以预印本形式于2026年7月30日发布,论文编号为arXiv:2607.28272v1,感兴趣的读者可通过该编号查找完整论文。
一、被遗忘的常识:记忆从来不是录像机
每个人都有这样的经历:朋友上个月告诉你某家餐厅停车方便,但你今天去的时候才发现那条街正在修路,根本没有地方停车。此时你不会机械地按照朋友的记忆行事,而是会自然地调整——"他说的停车方便那是以前的事了,现在得换个方向找。"这种能力看起来理所当然,但对于当下绝大多数被寄予厚望的AI智能体来说,恰恰是一块明显的短板。
研究团队发现,当前主流的"记忆增强型AI智能体"(可以把它理解为配备了经验笔记本的AI助手)在使用历史经验时,普遍采用的是一种极为粗暴的方式——把过去的记录原封不动地塞进当前的决策过程,就好像把一张三年前的旧地图直接用来导航今天的城市,完全不管这期间城市是否拆了路、建了新街。这种做法在研究中被称为"逐字回放"范式,它的致命缺陷在于:一段记忆在语义层面可能与当前任务高度相关,但在具体的执行状态层面却可能完全错位,最终导致"负迁移"——也就是本想借鉴经验,结果反而被旧经验带偏了方向。
认知科学早就告诉我们,人类的记忆天生就不是录像机式的回放,而是一个主动的重构过程。每次回忆,大脑都会结合当前的情境和知识,对过去的经历进行重新解读和组织,才会影响接下来的行为。受到这一洞察的启发,研究团队提出了一套名为MemHarness的全新框架,其核心理念可以用一句话概括:记忆是被重构的,而不是被回放的。
二、老导航遇上新路况:为什么"照搬记忆"会出问题
要理解这个问题的严重性,不妨把AI智能体想象成一位经验丰富的外卖配送员。他有一本厚厚的经验册,上面记满了各种小区的进门方式、哪条路不堵车、哪栋楼电梯在哪里。当他接到一个新订单时,他会翻出相似任务的记录来参考。
但问题来了:如果那栋楼上个月刚把东门封了,只开西门,而经验册里写的是"走东门直接刷卡进入",那么这条记录不仅没有帮助,还会让他绕一大圈甚至进不了门,浪费大量时间。这正是"逐字回放"范式的症结所在。
现有的记忆增强AI智能体大体分为两类。一类是"显式记忆型",就像上面那位配送员,有一个外部的经验库,可以随时查阅,优点是透明、可追溯,但缺乏对当前状态的适应能力。另一类是"参数化记忆型",经验被直接"消化"进模型的参数里,就像老司机积累的那种"肌肉记忆",行动时会自然流露,但你根本看不清它到底依赖了什么经验,也没法去核查或纠正。
MemHarness的目标,正是在这两者之间找到一条中间路:既保留显式记忆库的透明可追溯性,又让智能体具备人类那种主动评估、按需重构记忆的适应能力。
三、五个步骤,模拟人类的"记忆重构"过程
MemHarness的运作逻辑被研究团队拆解为五个环环相扣的阶段,这五个阶段共同构成了一个完整的"感知—检索—评估—重构—行动"闭环。
元股证券:ygzq.hk第一步是环境观察,也就是智能体感知当前所处的真实状态,包括最近几步的行动历史和当下的具体观察,相当于配送员抬头看清楚眼前的实际路况。第二步是经验检索,系统根据当前情境生成一个检索查询,从历史经验库中取出最相关的几条记录,同时这些记录还附带着它们被生成时的"原始情境"——也就是当初这条经验是在什么状态下总结的。第三步是记忆评估,这是整个框架最关键的创新环节,智能体会把历史经验的原始情境与当前情境进行比较,判断这段记忆是否还适用、哪些部分可以借鉴、哪些部分已经过时。第四步是情境重构,保留可以迁移的有效知识,修改或丢弃与当前状态不匹配的内容,最终生成一段经过"校准"的指导信息。第五步才是行动生成,以这段经过重构的指导信息为基础,做出当前步骤的具体决策。
值得特别说明的是,如果智能体在评估阶段发现检索到的记忆根本不适用于当前情境,它会输出一个特殊的空信号,系统随即切换到"纯自主推理"模式,完全依靠智能体自身的推理能力来决策,而不是被一段错误的记忆误导。这相当于配送员看着经验册上的记录,坦然地说"这条记录已经过时了,我自己重新想想该怎么走"。
四、一个模型做两件事:从技术层面理解MemHarness
在技术实现上,MemHarness有一个相当优雅的设计:记忆重构和最终行动决策,由同一个策略模型来完成,共享全部参数。这意味着它不是"两个AI在互相传递信息",而更像是一个人用同一套大脑同时负责"分析情况"和"做出决定",这两件事在同一个思维流程中被统一处理。
更重要的是,这套重构能力不需要人类提前标注任何"正确的重构示例"——研究团队没有雇人去写"这段记忆应该被改成什么样"的标准答案。整个重构能力是通过强化学习从零开始自发涌现的。具体来说,系统采用了一种名为GRPO(群体相对策略优化)的强化学习算法,核心逻辑非常直观:对于同一个任务,同时让智能体尝试多条不同的轨迹,然后根据最终任务是否完成来评判哪些轨迹更好,并据此调整策略。那些在重构记忆之后做出了正确决策、顺利完成任务的轨迹,会自然地获得更高的"分数",从而引导模型越来越擅长这种有益的重构行为。
股票在线官方配资奖励信号的设计也颇具巧思。主要奖励来自任务结果:完成任务得10分,失败得0分。在此基础上还有一个小额的格式奖励,用来鼓励智能体遵守规定的交互协议——比如每步必须先有思考过程、记忆检索次数要合理、输出必须是英文等。格式奖励的权重只有0.1,确保它不会喧宾夺主地盖过主任务的重要性。
五、实验结果:在两个真实环境中全面验证
为了检验MemHarness的实际效果,研究团队选择了两个在AI智能体研究领域极具代表性的测试平台。
第一个是ALFWorld,一个模拟家庭室内任务的文本环境,包含六种不同类型的任务:拿取物品、查找物品、清洁物品、加热物品、冷却物品以及多物品拾取,每个任务都需要智能体在一个虚拟家居环境中进行最多50步的交互操作。第二个是WebShop,一个模拟在线购物的环境,包含超过110万件商品,智能体需要根据用户的具体购物需求(包括颜色、尺码、价格等多维度约束)在网页上完成最多15步的操作,找到并购买符合要求的商品。这两个环境对应着截然不同的挑战:ALFWorld考验的是空间推理和物体操作的序列规划,WebShop考验的是信息筛选和多约束匹配能力。
研究团队以Qwen2.5-7B-Instruct这个70亿参数的开源模型作为基础底座。在ALFWorld上,MemHarness实现了85.2%的平均任务完成率;在WebShop上,成功率达到75.6%,综合评分达到87.4分。
对照实验揭示了几个格外值得关注的现象。纯强化学习(GRPO,不使用任何记忆)的基线在ALFWorld上达到76.4%,在WebShop上达到66.1%。把记忆直接"逐字回放"注入(不经过重构)的方案,ALFWorld成绩反而跌到了70.1%,比不用记忆还差,印证了"逐字回放"确实会造成负迁移。其他几个同样结合了强化学习和外部记忆的竞品方法,也都或多或少地受到了这个问题的拖累,成绩普遍低于MemHarness。
相比目前最强的闭源大模型Gemini 2.5 Pro,MemHarness在ALFWorld上高出23.1个百分点,在WebShop上高出39.7个百分点,而这一切是用一个只有70亿参数的小模型实现的。与同样基于强化学习的竞品EvolveR相比,MemHarness在ALFWorld上的成绩也高出15个百分点以上(85.2% vs 70.1%)。
六、逐步拆解:各个组件各自贡献了什么
研究团队设计了一系列消融实验,像拆积木一样一个一个地移除各个组件,观察成绩如何变化,以此精确量化每个部分的贡献。
移除记忆重构模块、仅保留原始记忆回放时,ALFWorld成绩从85.2%下滑至79.6%,这直接证明了重构本身(而不仅仅是记忆检索)才是性能提升的关键驱动力。把MemHarness内部的重构步骤替换为另一个通用语言模型(同样是Qwen2.5-7B-Instruct,但没有经过MemHarness的端到端训练)来执行重构,成绩从85.2%大幅跌至77.7%,这说明零样本的文本改写是远远不够的,重构能力必须通过端到端的强化学习来内化到策略中,与任务环境的动态紧密绑定。
最出人意料的发现来自另一个对照组:在推理阶段完全不提供记忆(既不检索也不使用记忆库)时,MemHarness训练出来的模型在ALFWorld上仍然达到了83.0%,显著高于没有记忆训练的纯强化学习基线(76.4%)。这意味着,重构训练目标不仅在有记忆可用时发挥作用,它在训练阶段本身就作为一种隐性的高质量推理引导,从根本上提升了智能体的内在推理能力主力洗盘。即使在测试时把记忆库完全拿走,这种能力提升依然保留着。
七、陌生环境的考验:分布外泛化能力
任何实际应用场景中都不可避免地会遇到"分布外"问题——训练时没见过的新情况。对于记忆增强型智能体来说,这个问题尤为棘手:如果历史记忆全都来自熟悉的环境,当智能体突然面对一个房间布局完全不同、物品位置全部打乱的新场景时,那些记忆不仅无法帮忙,甚至可能主动添乱。

研究团队专门构建了ALFWorld的分布外测试集,其中所有房间布局和物品放置都是训练期间从未出现过的新配置。结果显示,MemHarness在这个更困难的测试集上依然达到了85.9%的平均成功率,而逐字回放方案(RL + Raw Memory)只有76.3%。更说明问题的是:在这个陌生环境中,直接把未经过滤的记忆注入("w/o reconstruction",即不做重构直接用记忆)的成绩是82.4%,而完全不用记忆的成绩是83.0%,前者反而更低——在陌生环境里,旧记忆不加甄别地使用,真的会帮倒忙。MemHarness的记忆重构机制在这种情况下起到了保护性过滤作用,动态识别并丢弃那些与新环境不匹配的记忆,确保智能体不被误导。
八、深入追问:重构究竟是怎么发生的
研究团队不满足于仅仅展示MemHarness的性能优势,他们还设计了两类机制探针实验,深入追问:智能体的记忆重构行为,是否真的在做有意义的状态比较,还是只是在执行某种表面的文字游戏?
第一类实验是宏观层面的消融测试。研究团队尝试在重构时隐去记忆的原始情境(即"历史状态"):如果去掉原始情境,拒绝率(智能体判断记忆不适用并输出空信号的比例)几乎不变,但任务成功率从85.2%降至80.0%,说明智能体在没有原始情境参照时会接受更多实际上并不适用的记忆,从而被误导。如果把原始情境替换为一段随机从其他记忆抽来的错误情境,拒绝率明显上升(从8.7%升至13.3%),说明智能体确实在主动做情境匹配而非走形式——一旦发现历史情境和当前情境之间有明显差距,它会更倾向于拒绝这段记忆。
第二类实验是微观层面的反事实探针。研究团队请另一个强大的语言模型(GPT-5.1)对1000个真实的"记忆适用"案例进行最小化修改,每次只改一个关键细节,让原本适用的记忆变得不适用,然后观察MemHarness的反应是否发生相应变化。在ALFWorld中,经过修改的情境导致"不修改直接使用"的比例下降(从46%降至37.3%),"做出调整再使用"的比例上升(从53.4%升至56.3%),"直接拒绝"的比例也有所上升(从0.6%升至6.4%)。在WebShop中,由于网页内容本身就更长更复杂,整体拒绝率本来就很高(超过70%),经过修改后拒绝率进一步略微提升。两个环境的不同反应模式与它们各自的观察格式完全一致——ALFWorld的状态描述简洁,适合细粒度调整;WebShop的网页内容冗长,整体更倾向于直接拒绝不确定的记忆。
九、训练过程中行为的演化
研究团队还追踪了整个强化学习训练过程中,智能体记忆使用行为的动态变化,得到了一些生动的观察结果。
在ALFWorld中,智能体随着训练的推进逐渐演化出了一套"稀疏检索"策略,每条轨迹的平均检索次数从训练初期的较高水平逐渐收敛到2到3次左右,说明智能体学会了有选择性地在真正需要参考经验的时候才触发检索,而不是每步都去查。在WebShop中,由于购物任务本质上需要持续参考用户需求和商品信息,智能体保持了较为频繁的检索行为,但同时也发展出了持续的主动过滤机制,对检索到的记忆进行严格筛选。
更重要的行为规律出现在成功率与记忆决策的关联分析中:在整个训练过程中,那些包含至少一次"接受重构"(即记忆被判断为适用并经过重构使用)的轨迹,其成功率始终高于那些只包含"拒绝重构"的轨迹。这说明智能体确实在有效地学习如何区分"这段记忆值得参考"和"这段记忆应该扔掉",而不是随机地接受或拒绝。
十、两个生动案例:重构的魔力具体长什么样
研究团队在附录中提供了两个非常直观的案例,能帮助我们把上面所有的技术描述落地成具体画面。
第一个案例来自ALFWorld。任务是把一个杯子冷却后放到边桌上。系统从经验库中检索到的历史记忆是这样写的:"一旦你拿到并准备好了目标物品(比如信用卡),直接前往最终放置地点(比如咖啡桌)并把它放在那里就可以完成目标。"这段记忆在结构上确实是对的(拿到物品→放到目标地点),但具体细节全错了:它提到的是信用卡和咖啡桌,而当前任务是杯子和边桌。如果逐字回放这段记忆,智能体的上下文里会凭空出现"信用卡"和"咖啡桌"这两个根本不存在于当前环境的幻觉信息,极有可能导致输出无效动作。MemHarness的重构输出则是这样的:"如果你手里拿着目标物品(这里是杯子)并且已经用冰箱把它冷却了,下一步就是把它放到目的地(这里是边桌)。不需要再去冰箱了;冰箱只是用来冷却杯子的,边桌才是最终要放置杯子的地方。"可以看到,通用结构被保留了,但所有具体对象都被精确替换为当前环境中真实存在的实体,不再出现任何幻觉信息。
第二个案例来自WebShop。任务是找到一款符合多个条件的女式牛津鞋,包括颜色、尺码、防滑、记忆棉等一系列约束。系统检索到的历史记忆是一条抽象的操作建议:"当面对搜索结果页面且任务有复杂的多维约束时,在点击具体商品之前,仔细对照所有要求核查可见的标题和属性。"这条建议是正确的,但在执行层面毫无帮助——它只是告诉智能体"要仔细检查",但没有说检查哪个商品、怎么检查。MemHarness的重构结果则是:"B06W51MMKY:Alegria Women's Kourtney——似乎符合日常舒适、防滑、高跟、封闭式鞋头、踝带、记忆棉、橡胶底、颜色黑色、尺码6的所有条件。"重构过程实际上"执行"了这条启发式规则:扫描当前页面,对照用户所有约束条件逐一比对,最终输出了一个具体的、可以直接行动的目标商品ID,而不是再把一条抽象建议转交给智能体自己去处理。
归根结底,MemHarness做的事情,就是把AI智能体从一个"照本宣科的学生"变成了一个"会活学活用的老手"。它不改变记忆库里存着什么,只改变了拿到记忆之后怎么用——在用之前先问一句"这段经验放在今天的情况下还管用吗?哪些部分要修改一下?"仅仅是这一个额外的思考步骤,就让整个系统的表现产生了质的跃升。
这项研究还带来了一个颇具启示性的副产品:那些在训练时学会了重构记忆的智能体,即使在测试时把记忆库完全拿走,依然比普通训练出来的智能体更聪明。这暗示着,"批判性地审视和改写信息"这一能力本身,也许就是一种普适的推理素养,而不只是记忆管理的技巧。
未来的研究方向或许可以继续探索这一思路:更大规模的模型是否能发展出更精细的重构策略?在更开放、更动态的真实世界任务中,这套机制能否保持同样的有效性?有记忆与没有记忆时的性能差距,是否能随着训练的深入进一步缩小,还是存在某种上限?这些问题的答案,或许将定义下一代AI智能体的能力边界。如有兴趣深入了解,可通过arXiv编号2607.28272v1查阅完整论文。
Q&A
Q1:MemHarness和普通记忆增强型AI智能体有什么本质区别?
A:普通记忆增强型AI智能体会把历史经验原封不动地塞进当前决策中,就像用旧地图导航,不管路况变没变。MemHarness则在使用记忆之前增加了一个"评估+重构"步骤,先比较历史情境和当前情境的差异,再决定保留、修改还是丢弃这段记忆,避免被不适用的旧经验误导。
Q2:MemHarness的重构能力是怎么训练出来的?
A:研究团队没有人工标注任何"正确重构示例",而是完全通过强化学习让这种能力自然涌现。系统同时尝试多条不同轨迹,根据最终任务是否完成来评分,那些正确重构记忆后顺利完成任务的轨迹会被强化,模型因此逐渐学会有益的重构行为。
Q3:MemHarness在没有记忆可用的情况下表现如何?
A:训练了记忆重构能力的模型,即使在测试时完全不使用记忆库,在ALFWorld上的成绩(83.0%)依然明显高于普通强化学习基线(76.4%)。这说明重构训练作为一种隐性的推理引导,从根本上提升了智能体的内在推理能力,而这种能力提升在没有记忆可用时同样保留着。
元股证券证券交易提示:本文来自互联网,不代表本网站观点。