当前位置: 首页 > news >正文

经验记忆黑科技!LightSearcher让AI工具调用减39.6%、推理快48.6%

北邮百家AI团队 投稿
量子位 | 公众号 QbitAI

深度思考大模型面临的“跷跷板”困境,这下有解了!

现有RL驱动的深度思考大模型常常面临准确率与效率的“跷跷板”困境——

频繁调用搜索工具能提升准确性,却带来计算开销和效率低下

对此,北邮百家AI团队提出LightSearcher框架,首创基于经验记忆的高效RL优化技术,不依赖额外数据,仅通过引入经验记忆机制,实现Agent工具调用高效自主优化,解决痛点问题。

在保持与SOTA基线ReSearch相当准确率的同时,搜索工具调用和模型回复时间显著缩短,搜索工具调用次数减少39.6%,推理时间缩短48.6%,Token消耗降低21.2%,在保持模型效果的同时显著提升了工具调用效率。

团队表示,以DeepSeek-R1为代表的深度思考大模型能够处理复杂的推理任务,DeepSearch作为深度思考大模型的核心搜索器,在推理过程中通过迭代调用外部搜索工具,访问参数边界之外的最新、领域特定知识,从而提升推理的深度和事实可靠性。

不过,虽然高频调用外部搜索工具能补充实时信息、提升推理准确率,但使得推理延迟大幅升高,等待时间可达几十秒至几分钟。

而从用户体验角度来看,若信息加载时间超过10秒,50%的移动用户会放弃访问。

因此,深度思考大模型系统的长时推理等待无疑会带来类似的用户流失风险。

反之,减少工具调用以提升效率,则会因大语言模型内部知识局限,导致推理结果准确性与完整性不足。

面对这一两难困境,LightSearcher框架应运而生。

LightSearcher框架

如何教会深度思考大模型策略性地控制搜索工具的使用,优化何时以及如何查询外部知识源,是深度思考大模型亟待解决的问题,现有方法存在显著缺陷:

1、提示工程或监督学习方法依赖人工标注,成本高且泛化差;RL驱动方法虽能自主优化,但奖励偏重准确性,导致模型为确保正确而频繁调用工具,造成冗余开销。

2、工具调用“过度依赖”,现有模型往往不分难易,对简单查询也反复检索,导致推理时间延长、token消耗激增。

3、 准确性与效率失衡,部分方法虽提升准确率,但牺牲效率;另一些虽减少调用,却降低答案质量,无法兼顾双重目标。

这些问题导致现有模型要么要么答案不准、可靠性差,要么工具调用过多、效率低下,难以同时满足推理准确和高效执行的核心需求。

为解决上述缺陷,北邮百家AI团队提出基于经验记忆的高效DeepSearch框架——LightSearcher

核心思路是在大模型强化推理过程中,通过“对比经验学习”将隐性推理轨迹转化为显性指导经验,并结合自适应奖励优化工具调用。

具体包含三大关键组件:

  • 对比经验推理机制(Contrastive Experiential Reasoning):收集高低质量推理轨迹,通过LLM生成成功模式的自然语言总结(如“简单查询优先用内部知识”),构建动态经验记忆库;

  • 自适应奖励塑造机制(Adaptive Reward Shaping):引入最小工具调用基准,仅在答案正确时惩罚冗余调用,使用指数衰减函数动态平衡准确性和效率,避免盲目优化;

  • 基于经验的RL训练机制:采用GRPO算法,将积累经验和少样本示例融入提示模板,指导模型生成高效轨迹,确保探索与利用的均衡。

模型最终优化目标为多目标奖励函数的加权和,确保工具调用精简与答案质量的协同提升。

实验

研究团队在四个多跳QA基准数据集(NQ、HotpotQA、Musique、2WikiMultihopQA)上进行了全面评估,对比了多种主流DeepSearch方法。

主实验结果

实验结果显示:

1、模型准确性保持顶尖: LightSearcher在F1分数和LLM评判上与SOTA基线ReSearch相当,甚至在部分数据集上优于ReSearch;

2、效率显著提升: 工具调用减少39.6%,推理时间缩短48.6%,token消耗降低21.2%;

3、泛化能力强:在不同难度的查询(易/难)上均表现稳定,即使在域外测试集也能超越依赖固定检索的迭代方法。

消融实验

移除经验导致F1下降7.2%,证明其核心作用。

团队表示,LightSearcher框架通过“经验记忆”这一核心理念,为构建高效、可靠的深度推理系统提供了新路径。

尽管目前限于多跳QA,未来可扩展到代码合成、策略规划等领域。

它成功解决了现有DeepSearch的关键痛点:

  • 从隐性到显性:将对比轨迹转化为可解释的推理指导;

  • 精准平衡:通过自适应奖励确保工具调用最小化;

  • 效率优先:利用RL训练维持准确与开销的连贯性;

  • 双重优化:同时提升推理质量和执行效率,而非顾此失彼。

最后,大模型的DeepSearch能力需设计有效的经验机制。

相比于复杂的手动标注, LightSearcher通过其“对比经验”的设计思想, 在推理过程依赖可靠的外部知识调用,为构建更加高效、可靠的AI深度思考系统提供了重要的技术路径。

论文链接:https://arxiv.org/abs/2512.06653
百家AI主页:https://baijia.online/homepage/index

http://www.cnnetsun.cn/news/159245.html

相关文章:

  • Java计算机毕设之基于springboot的中小学“延时服务”平台的设计与实现基于springboot的中小学课后延时服务系统(完整前后端代码+说明文档+LW,调试定制等)
  • 基于LangChain的大模型本地化实践:Langchain-Chatchat详解
  • Langchain-Chatchat与Kubernetes集成:实现容器化弹性伸缩部署
  • Langchain-Chatchat在物联网设备说明书管理中的应用
  • python+vue3的健康体检网络管理系统的设计与实现754682131
  • python+vue3的见山茶食酒馆网站 公益活动报名系统87433411
  • Langchain-Chatchat在设备维修手册查询中的快速响应能力
  • 【金猿案例展】中电防务科技股份有限公司——质量管理数据要素价值释放与智能知识库建设实践
  • Kotaemon可用于健身房课程预约智能助手
  • FaceFusion在AI健身课程教练形象多样化中的应用
  • Langchain-Chatchat实现错误信息智能诊断
  • Langchain-Chatchat在DevOps知识管理中的应用
  • Langchain-Chatchat在航空航天手册查询中的价值
  • FaceFusion在虚拟房地产导览中的形象应用
  • 基于Kotaemon的RAG应用实战:从零搭建高准确率问答系统
  • Spring6.0+Boot3.0:秒级启动、万级并发的开发新姿势
  • 计算机小程序毕设实战-基于springboot+微信小程序的汽车后市场二手车出售系统二手车买卖交易小程序系统【完整源码+LW+部署说明+演示视频,全bao一条龙等】
  • 【必学收藏】从指令到智能:计算机学习的范式革命与大模型入门指南
  • FaceFusion能否用于体育解说?运动员历史形象重现
  • FaceFusion结合Stable Diffusion生成更逼真人脸?
  • 一文搞懂LangChain多模态:DeepSeek+content_blocks实战,从小白到工程师的必学之路
  • Langchain-Chatchat用于代码注释自动生成
  • FaceFusion如何处理反光眼镜造成的数据干扰?
  • Langchain-Chatchat助力精准广告投放
  • FaceFusion能否实现眼神跟随效果?视线重定向技术前瞻
  • 【课程设计/毕业设计】基于微信小程序的考研公共课资料库分享平台基于php+微信小程序的考公资料库分享平台资料库平台【附源码、数据库、万字文档】
  • 程序员必藏:大模型时代生存手册:从传统开发到AI工程师的转型秘籍
  • Langchain-Chatchat支持的知识库版本控制机制设计
  • Java毕设项目推荐-基于Java+SpringBoot的仓库管理系统的设计与实现基于springboot的自行车仓库管理系统设计与实现【附源码+文档,调试定制服务】
  • FaceFusion人脸美化功能拓展可能性分析