昭通万能胶 大模型搜索总偷懒?IQuest等联出FORT,30B开源搜索Agent刷新同规模SOTA

当大模型从"回答问题"走向"自己搜索、验证、综证据"昭通万能胶,Deep Search Agent 正在成为下阶段智能体能力的重要向。
这类 Agent 不再满足于次检索、次回答。它需要在开放网络中多轮搜索,交叉验证,排除错误,并在足够证据支撑下给出终答案。
但真正训练这种能力,先要解决个基础问题:什么样的搜索数据,才是真的难、真的有用?
来自至知创新研究院(IQuest Research)、人民大学瓴人工智能学院、KAUST 等机构的研究团队提出了FORT,个面向 Deep Search Agent 的 shortcut-resistant training-data synthesis framework。
与单纯经验式构造复杂问题不同,FORT 先从理论上建模 Deep Search 任务中的 shortcut collapse,再将这些风险转化为数据成中的显式控制项。
基于 FORT 生成的搜索轨迹,研究团队训练得到 FORT-Searcher。该模型使用 Qwen3-30B-A3B-Thinking-2507 作为基座,仅通过监督微调(SFT)训练,就在多个挑战 Deep Search 基准上取得了同规模开源 Agent 中优的整体表现。
△FORT-Searcher 在 BrowseComp 和 BrowseComp-ZH 上的主要结果。为什么难搜索题会"塌缩"?
FORT 的核心理论出发点是:Deep Search 任务的难度不是个静态属。
个问题设计得多复杂,只说明它的 apparent difficulty 很;但当这个问题真正交给个搜索 Agent,在具体检索接口和具体模型能力下执行时,难度可能会发生变化。真正重要的是 realized difficulty:模型在真实搜索中是否须经历充分的证据获取过程,才能识别答案。
论文将 Deep Search 问题形式化为多约束检索任务。完整约束集可以唯确定答案,但模型在实际求解时不定需要验证所有约束。只要某个较小的约束子集已经足以识别答案,并且这个子集可以通过很短的搜索路径被验证,任务难度就会塌缩。
论文将这条低成本答案识别路径称为cheapest identifying route。
这揭示了个关键问题:真正决定搜索难度的,不是设计者预设的完整理链,而是所有可能识别答案的路径中,是否存在条足够便宜的路径。
基于这视角,论文将难度塌缩分成两类。
类是 route-level collapse。它来自问题和检索环境本身。例如,个线索就足够锁定答案,多个线索被同个网页共同覆盖,或者题面暴露了后续搜索本应逐步发现的中间常量。
二类是 solver-level collapse。它来自具体模型自身。例如答案实体足够知名,模型可能在检索证据充分出现前,就凭参数知识提前提出答案。
FORT 将这些现象总结为四类 shortcut risks:
Evidence Co-coverage:多个线索被同个证据源覆盖,使多步验证退化成少量检索;
Single-clue Selectivity:某个或少数线索过于特,已经足够定位答案;
Exposed Constants:题面暴露人名、作品名、年份、数字等可直接搜索的常量昭通万能胶,使后续 query 提前可执行;
Prior-knowledge Binding:模型在证据充分出现前,凭参数知识提前提出答案。
FORT 的理论贡献在于,它不是孤立地观察这些现象,而是把它们放入统的 shortcut-aware difficulty framework 中,解释它们如何降低真实搜索成本,并指后续数据成。
FORT:把理论风险变成数据构造控制项
FORT 的目标不是简单把问题做长,而是系统减少 cheap identifying route,让模型难通过单个线索、单个网页、题面常量或参数知识提前获得答案。
整个成流程包括四个阶段:Graph Initialization、Graph Construction、Question Formulation 和 Adversarial Refinement。
△FORT 整体数据成 pipeline。从长尾实体出发,降低先验捷径
FORT 先从 Wikidata 中选择 root entity,并初始化 seed graph。
为了降低 prior-knowledge binding,FORT 优先选择长尾实体,尤其是没有英文 Wikipedia 页面、模型不太可能直接记住的实体。同时,FORT 会进行轻量预搜索,过滤掉外部证据不足的实体,保证问题仍然可解。
除了实体选择,FORT 还尽可能使用 cycle-based initialization,而不是简单线链条。线链条在问题生成时容易暴露中间实体,致后续 query 从开始就能执行;cycle seed 则可以让关系表达间接,减少 exposed constants 风险。
构造异构证据图,而不是单纯把图做大
从 seed graph 出发,FORT 会扩展 evidence graph。这里的不是图有多大,而是 facts、sources 和 dependencies 是否能支持真正 search-heavy 的问题。
具体来说,FORT 会从多种外部来源收集事实,降低 evidence co-coverage 风险;构造 derived facts,避 clue 直接对应网页原文;并选择那些"单看平凡,但组起来能够定位答案"的 facts。
Derived facts 是 FORT 的关键设计之。它们不是简单摘取网页中的句话,而是通过跨记录匹配、计数聚、数值关系或元信息抽取等式构造新的约束。
例如,问题可以不直接说"某人出生于某年",而是描述"某人的师比他年长多少岁";也可以不直接给出作品标题,而是通过歌词、章节结构或出现次数形成间接约束。
这种设计让每个 clue 都有贡献,但又避任何单个 clue 过强。
隐藏中间实体,模糊精确常量
在 Question Formulation 阶段昭通万能胶,FORT 会将 answer-bearing subgraph 渲染成自然语言问题。
为了减少 exposed constants,FORT 会隐藏中间实体名称,用关系描述替代直接命名。例如,不直接给出某个人物、作品或机构名称,而是通过其属、关系或事件间接描述。
对于须出现的数值、日期或名称,FORT 会进行exact-value fuzzing。比如,将精确年份、数字或日期改写成范围、类别、数字特征或间接约束。这样可以避模型直接复制题面中的精确字符串去搜索,同时保证问题仍然真实、可验证。
很多看似多跳的搜索题并不真正难,万能胶生产厂家因为题面已经给出了下跳的搜索关键词。FORT 的问题生成阶段试图避这种情况:不是让问题变得模糊不可解,而是让关键中间信息须通过搜索逐步发现。
用强搜索模型攻击草稿题,修复残余捷径
构造阶段的控制并不能保证问题在真实搜索接口下定没有 shortcut。因为 shortcut 往往只有在具体搜索引擎、具体模型和具体轨迹中才会暴露。
因此,FORT 引入 Adversarial Refinement:让强 search agent 实际求解 draft question,并观察轨迹中的 solving cost、answer hit time 和 prior-shortcut 行为。
如果模型过早命中答案,FORT 会修复早出现的 shortcut-prone clue;如果问题因为过度 fuzzing 或歧义致不可解,FORT 会收窄 clue、恢复要约束或移除歧义事实。
这步让 FORT 从 construction-time control 闭环到 trajectory-level diagnosis。也就是说,FORT 不只是理论上避捷径,而是用真实搜索轨迹来检查和修复残余捷径。
30B FORT-Searcher 达到同规模开源 SOTA
基于 FORT 生成的 shortcut-resistant search trajectories,研究团队训练得到 FORT-Searcher。
FORT-Searcher 使用 Qwen3-30B-A3B-Thinking-2507 作为基座模型。该模型总参数规模为 30B,理时约激活 3B 参数,并支持 256K 上下文窗口。该基模未提前对搜索能力进行优化,因此能好反映 FORT 数据带来的提升。
评测覆盖五个挑战 Deep Search 基准:BrowseComp、BrowseComp-ZH、xbench-DeepSearch-2505、xbench-DeepSearch-2510 和 Seal-0。
△FORT-Searcher 与其他 Deep Search Agent 的主结果对比。
实验结果显示,FORT-Searcher 在 comparable-size open-source agents 中取得 Overall 分数 66.2,过 MiroThinker-1.7-mini 的 64.6 和 Qwen3.5-35B-A3B 的 59.9。
在 BrowseComp 上,FORT-Searcher 达到 72.2,于 MiroThinker-1.7-mini 的 67.9;在 BrowseComp-ZH 上达到 75.0,于 MiroThinker-1.7-mini 的 72.3;在 xbench-DeepSearch-2505 上达到 80.8,也过同规模开源基线。
重要的是,FORT-Searcher 只使用 SFT 训练,理时约激活 3B 参数,却在 BrowseComp 上过多个大规模开源 Agent;在 BrowseComp-ZH 上,也取得了表中所有开源 Agent 的结果。
这说明 FORT 的贡献不只是成了批复杂问题昭通万能胶,而是生成了真正有的搜索监督数据。
不是简单让轨迹变长,而是提答案发现成本
FORT 的进步分析聚焦于个问题:训练数据的难度到底体现在哪里?
长轨迹本身并不等于质量搜索监督。后续搜索可能有助于验证和补充证据,但 Deep Search 训练还需要关注答案出现之前的证据发现过程:模型是否须跨越多个约束、多个证据来源和要的中间依赖,才能逐步识别答案。
因此,论文引入了组trajectory signatures:
Solving cost(
):模型完成任务所需的总体搜索成本;
Answer hit time(
):答案次出现在轨迹中的轮次;
Prior-shortcut rate(
):模型在证据充分出现前提前提出答案的比例。
△FORT 与已有开源 deep-search 数据的 trajectory signatures 对比
相比已有开源 deep-search 数据,FORT 带来了的 solving cost 和晚的 answer hit time。具体来看,相比强开源数据基线 REDSearcher,FORT 将平均 solving cost 从 92.1 提升到 141.0,将 answer hit time 从 18.7 迟到 46.9,同时 prior-shortcut rate 保持在相近水平。
这说明 FORT 并不是简单诱模型多搜几步,而是在构造阶段减少 cheap identifying route,使答案发现过程本身难被绕过。
进步的 training-data difficulty analysis 也验证了这点。
△Training-data difficulty analysis:轨迹长度之外的答案发现成本。
结果显示,单纯提平均轨迹长度只能带来有限提升;而在相近轨迹长度下,答案发现过程长、prior-shortcut 少的训练数据,终带来了好的训练果。
这也是 FORT 的核心经验:质量搜索监督的关键,不只是轨迹有多长,而是答案发现过程是否足够要、足够难以被捷径绕过。
从"复杂问题"到"不可绕过的搜索过程"
FORT-Searcher 的意义不只是提出了个强的 30B Deep Search Agent。重要的是,它系统回答了个基础问题:难 Deep Search 数据为什么难造?
过去,Deep Search 数据构造往往关注问题有几跳、图结构有多复杂、轨迹有多长。但 FORT 指出,这些都只是 apparent difficulty。真正关键的是 realized difficulty:答案是否须通过真实搜索中的充分证据获取才能出现。
为此,FORT 从理论上建模了 shortcut collapse,并将四类 shortcut risks 转化为数据构造中的具体控制机制,包括长尾实体选择、异构证据图构造、derived facts、name withholding、exact-value fuzzing 和 adversarial refinement。
终,基于 FORT 数据训练得到的 FORT-Searcher,在多个挑战 Deep Search benchmark 上取得同规模开源 Agent 中优整体表现。进步分析也表明,FORT 的提升来自的答案发现成本、少的真实搜索捷径,以及有的搜索监督。
FORT-Searcher 的核心价值不只是 30B Deep Search Agent 新 SOTA,而是提出了套从理论建模到数据成再到模型训练的闭环法:让搜索数据不只是看起来复杂,而是真的能训练模型进行长程证据发现。
关于至知创新研究院
至知创新研究院(IQuest Research)以"做有价值的 AI "为核心理念,致力于破解研究与真实场景应用之间的转化鸿沟。作为创新型研究组织,至知集探索者、实战派、连接器三重角于身:聚焦下代 AI 基础架构,动自主可控的全栈自研;耕智慧医疗、生物技术、能源电力、数学智能等壁垒研究与应用场景,造端到端智能解决案;依托全球资源网络,通从理论到实践的转化链路。研究院汇聚顶人才,持续培养复型 AI 人才。至知创新研究院将持续以智能计重写科学规则,以系统案重塑产业路径,开启 AI 具价值的未来。
论文题目:FORT-Searcher:Synthesizing Shortcut-Resistant Search Tasks for Training Deep Search Agents
arXiv:https://arxiv.org/abs/2606.12087
GitHub:https://github.com/RUCAIBox/FORT-Searcher
键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系式。
� � 我们会 ( 尽量 ) 及时回复你 : )
� � 点亮星标 � �
科技前沿进展每日见相关词条:铝皮保温施工 隔热条设备 钢绞线 玻璃棉卷毡 保温护角专用胶
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
