一句话讲清楚 北京智源提出深度研究智能体 AREX :内环搜证据、外环按约束核对,把已核实的证据留下、没核实的条件写成下一轮题目,再用模型自学的「进展备忘录」工具撑住长对话; 122B-A10B 的 AREX-Base 在 WideSearch 上拿到 82.0 ,并与更大模型同台可比。

论文标题:AREX: Towards a Recursively Self-Improving Agent for Deep Research
论文链接:https://arxiv.org/abs/2607.21461
项目主页:https://vectorspacelab.github.io/arex-model/
在线应用:https://arex-research.com
模型合集:https://huggingface.co/collections/BAAI/arex
深度研究常卡在一件事上:正确答要同时满足好几条绑在一起的条件。时间对不对、不同来源能不能互相印证、候选实体是不是唯一解,缺一条都不算过关。许多系统的默认反应是把单条搜索拉得更长:多想几步、多调几次工具、多塞一点上下文。算力花出去了,早期错方向却可能一直跟着走,半对半错的候选也被提前当成终稿。
北京智源 AREX 团队抓住的不对称很具体:一次性凑齐满足全部条件的答案很贵,把候选拆开「条件一项一项核对」通常更省事。核对不只告诉你对错,还会标出哪些说法站得住、哪些还悬着、哪里证据互相打架。 AREX 把核对结果当成「这一轮收工还是接着查」的依据:本轮临时答案变成「部分已核实状态」,已确认的进度留下,剩下的不确定性改写成下一轮更窄的研究题目。
他们把这套推理时的多轮修正叫递归自改进( Recursively Self-Improving , RSI )。权重保持不动,靠外环反复决定:分数够就收稿,不够但还有进展就缩小目标再查,完全走偏就清空重来。模型有两个规格:稠密 4B 的 AREX-Turbo ;以及总参数约 122B 、每次推理大约只激活 10B 的 MoE 结构 AREX-Base (大参数量里只唤醒一部分专家,算力开销更接近中等规模模型)。骨干分别来自 Qwen3.5-4B 与 Qwen3.5-122B-A10B 。
Figure 1 : AREX 在 BrowseComp 、 GAIA 、 xbench-2510 、 DeepSearchQA 、 WideSearch 、 HLE 上的结果总览。深色条为闭源、浅灰为开源,蓝/青绿分别标出 AREX-Base 与 AREX-Turbo 。
双环:内环做研究,外环决定收不收
如图 2 , AREX 分两层。给定输入问题,先得到本轮研究目标。内环反复执行搜索、浏览等动作,读回结果,做中间分析;需要时调用 update_context,把对话整理成进展备忘录;认为目标查得差不多了,就调用 finish,交出三样东西:临时答案、支撑证据、对答案靠不靠谱的 0–100 分。
Figure 2 : AREX 递归自改进框架。下方内环维护研究状态;上方外环根据分数与轨迹评估,选择直接采用、精炼或清空重来。
外环拿着这三样东西做决策。分数高于阈值就直接采用,作为终答。低于阈值则先问:这次搜索里还有没有能用的进展?
举个更具体的形状:问「某篇 2020 年论文的一作,现在在哪所大学任职?」若身份已核实、任职时间还悬着,外环通常不会整段推倒,而是精炼成「查该作者近年官方主页或机构页面上的任职记录」。若前面一直在追错同名作者、证据互相打架,才更像清空重来。
设一个置信度阈值 (可理解成收稿及格线):分数够就接受;不够但还能从当前轨迹里救出可用进展就精炼;不够且进展不值得留就重启。轮次有上限;若始终达不到阈值,系统返回已完成答案里分数最高的那一个。
核对因此出现在轮次切换处。不确定的条件触发定向补查,该停就停,该改目标就改目标。整段搜索跑完再做一次终检,抓不住「半对半错」这种中间态。
Figure 3 :正确与错误输出的置信度分布。正确答大多落在 90–100 ;错误答仍有大量低于 60 的质量。后文消融会再看 ACU 如何改变这张分布。
内环怎么一步步收证据
内环每一步会产出中间分析、具体操作(搜索或打开网页等),再由搜索与浏览工具返回观察,拼进本轮轨迹。新证据会改策略:支持性结果把注意力推到剩余条件;矛盾结果会否决当前候选、逼模型换路;来源冲突时优先找更权威、出处更直接或时间更相关的材料。
第一轮目标通常直接由原问题导出;之后各轮,外环可能塞进来更窄的目标,例如「验一条还没站住的条件」「调和互相打架的证据」「检查时间是否仍有效」「候选被否后另找替代」。
内环结束时的结构化输出可以写成:
可以把它看成一张「研究进度条」: 是现阶段最好的答案草稿; 列出说法对应哪些网页或文档; 综合完整度、一致性、出处与时间有效性,供外环决定收工还是继续。完整轨迹里混着废弃方向和原始工具返回;外环评估时只看这份答案级摘要,避免被噪声带偏。
进展备忘录:压历史,不丢「还缺什么」
长程研究里,轨迹会堆满检索结果、中间结论、被否候选、冲突发现和过时计划。整段历史原样留下会干扰后续推理;按固定规则乱砍,又可能丢掉出处、否定证据、未核实条件,而这些恰恰决定下一步该查什么。
常见做法多半把上下文管理当成「别超过长度上限」:按规则丢工具返回,或到固定 token 阈值再摘要。 AREX 提供显式工具 update_context(文中也称自主上下文更新, ACU ),由模型自己决定何时调用,把累积轨迹压成刷新后的研究状态,保留:
已核实发现与来源标识、当前候选、未核实条件、有效性疑虑、被否候选、下一步计划。
冗余观察、被取代的结论、过时计划删掉。调用之后,后续推理条件在「刷新状态 更新之后的新交互」上,而不必每次从完整历史重建进度。触发时机通常是:子问题告一段落、主候选被否、冲突证据刚调和完、研究计划本身改了。同一内环里可以多次调用,也可以一次都不调。
在 BrowseComp (偏深检索、多步改写查询的基准)上的行为统计很能说明它在干什么:约 80.3% 的案例会调用更新;平均激活上下文约 2.57 万 token ,中位数约 2.54 万,远低于配置的 12.8 万上限;几乎触顶才更新的比例只有约 0.01%。它主要是主动整理研究状态,硬上限更像防失控的安全阀。
触发原因里,修订检索策略占 66.9%,否决候选占 13.6%。更新内容方面,未核实条件与下一步计划的保留率分别约 95.5% 与 96.4%,被否候选约 81.5%,已核实发现约 72.1%。模型优先保住的是「还要查什么、下一步怎么走」,同时带着正负证据,避免重蹈旧路。
训练:造能核对的题,再把转折点加重
要让双环跑起来,训练数据得强迫模型做多跳检索、多源整合和中间假设检验。任务合成先抽潜在答案实体,再挂上一组可核对条件(时间关系、数值属性、实体关系、技术属性、证据要求等),再把条件改写成间接表述,避免关键词一搜即中。合格任务要满足:答案不能从问句直接读出、每条条件可被证据核对、条件合起来能唯一锁定答案。之后还会单独再跑完整解题流程,丢掉「浅检索就能过」或「查很久仍过不了」的题。
更强的教师模型在与 AREX 相同的工具环境里跑完整解题轨迹,再做质控:要有实质迭代与状态维护;工具调用有效;终答能从证据重建(说法都能对到出处);置信度低于阈值的丢掉。留下的轨迹教模型:怎么迭代取证、怎么维护研究状态、怎么在证据上写答案,以及何时继续、何时收束。
训练分两段:先在大量「带工具的多步解题示范」上做多阶段中期训练,再用强化学习微调中间决策。
先练会用工具翻网页,再练长链条推理。两者混着从头训会互相干扰——推理阶段训狠了,浏览与工具习惯会被冲掉——所以后面还有混合巩固:回放浏览长轨迹里的关键转折点,并扩到学术文献检索与知识密集型难题;同时让模型见到「临时答案按条件核对 → 保留已核实证据 → 标出未核实条件 → 写出下一轮目标」这类轮次切换。
长轨迹里九成是换关键词、翻页这类例行操作;真正决定对错的,往往是少数几次转折。论文用规则标注三类关键步(只在终答能核对成功的轨迹上保留):
全轨迹中期训练之后看逐步损失:普通步平均约 0.232 ;证据发现、路径否决与改向、关键上下文更新分别约 0.277 / 0.298 / 0.300 ,相对高出约 19% / 28% / 29%。模型学「继续搜、换关键词」很快,但在「第一次找到靠谱证据」「承认前面猜错了并改方向」「写进展备忘录」上仍更容易错。于是构造关键步训练集:保留该步完整前文作条件,损失只打在关键步本身,把预算砸在少数决定成败的点上。
Figure 4 :全轨迹中期训练后的平均逐步损失。三类关键步明显高于普通步,说明额外监督应砸在这些决策点上。
强化学习阶段,轨迹级对错仍是主信号。同一批题目里,好轨迹相对差轨迹得分更高,用来更新策略;奖励按「助手说了几步」做平均,防止模型靠无意义多搜几步刷高分。对成功轨迹里的标注关键步,再加一点有界加分。它不试图给每个中间动作都算清楚功劳,只给一批可识别、且实证重要的研究步骤额外偏好。
主结果:同激活量级里谁更强
六个基准大致对应四类能力: BrowseComp 与 DeepSearchQA 偏深检索(多步改写、证据拼装); WideSearch 英文子集偏广覆盖综合; GAIA 与 xbench-2510 偏「找信息 规划 工具」的任务完成;带工具的 Humanity's Last Exam ( HLE )偏专家级推理。推理侧统一接口: search 、 visit 、 update context 、 finish ; HLE 另加 python 。每局最多 300 次内环回合、 5 次外环自改进。
Table 1 :深检索与智能体推理任务对比。带 * 的 HLE 为全量集报告,其余为纯文本子集。底部紫色行为 AREX 。
看 AREX-Base (约 10B 激活参数)几个醒目数字:
4B 的 AREX-Turbo 在六项里有五项超过 Qwen3.5-35B (例如 BrowseComp 70.7 vs 61.0 , DeepSearchQA 78.5 vs 68.5 , WideSearch-en 68.5 vs 57.1 )。框架在两个量级上都成立,不只是参数堆出来的结果。
边界也要说清楚:相对 MiroThinker-H1 , AREX-Base 在 DeepSearchQA 与文本 HLE 上更好,但 GAIA ( 85.4 vs 88.5 )与 BrowseComp ( 82.5 vs 88.2 )仍有差距;闭源前沿在部分深检索指标上依然更高。论文想证明的是:在相近实际算力档位里能和大模型同台比,并未声称每项基准都夺冠。
消融:双环与训练配方各自贡献多少
先把推理框架拆开。去掉自主上下文更新( ACU )时,模型仍有其他工具与相同交互预算,但只能盯着未压缩的完整历史。 BrowseComp 准确率如下:
单轮设定下,仅 ACU 就把准确率从 59.6 提到 71.4 ( 11.8 )。外环在「无 ACU / 有 ACU 」两种底座上分别再加约 10.2 与 11.1 分。完整系统相对「双无」配置高出 22.9 分。刷新后的研究状态(已核实发现、被否候选、未核实条件、来源标识)比完整交互历史更有用;低分后再开一轮,也比直接交第一次 finish 结果更稳。
正确终答高度集中在 90–100 :无 ACU 时约 89.3%,有 ACU 时约 95.9%。错误终答里,低于 60 的分别约占 61.0% 与 55.2%。不少失败不必重读整段轨迹,从分数就能先拦下来。有 ACU 时,错误答里高置信区间占比也会升高:分数有用,但不够当终审法官,外环仍要结合这次搜索里还有没有能用的进展,来决定精炼还是清空重来。
训练配方在 BrowseComp 上的替换实验:
掉得最狠的是关键转折点:随机回放主要打到本来就低损失的例行步,准确率落到 74.1 。渐进训练改成混合训练掉到 77.5 ;标准组相对优化替掉步骤加权强化学习则到 79.4 。三块拼在一起才到 82.5 。
能带走什么
若你也在做深检索、研报核对或合规核查,最值得对照的是三件事:低分不硬交卷;未核实条件改写成下一题;用进展备忘录代替堆全文历史。这比单纯把单条搜索轨迹拉长更省事,因为它逼着系统每轮交「已证实清单 待查清单 置信分」。
代价同样明确:它依赖可核对条件与工具环境;外环轮次与内环步数有硬预算;错误答上高置信区间在开 ACU 后还会升高,所以「能不能救出进展」的判断不能外包给一个标量分数。 4B Turbo 能在多项上压过更大的基线,说明这套控制结构本身有独立贡献;要不要上 122B-A10B ,更多取决于你的任务对广覆盖综合( WideSearch 一类)有多敏感


VIP复盘网