
📄更充分地利用,更聪明地探索:预算受限下的智能体搜索革命 Exploit More, Explore Smarter for Budget-Constrained Agentic Search 👥 Haoyang Fang, Bernie Wang | 🏛 Amazon AGI 📎 arxiv.org/abs/2608.23848v1 💡 一句话总结 当别人还在"撒网式搜索"浪费预算时,亚马逊AGI团队用一套"信息价值决策"机制,让LLM智能体在仅用固定配置的情况下,跨4个领域平均提升5.5%——核心发现不是搜更多,而是决定"哪些根本不该搜"。 🔬 核心发现 ① 三大结构性缺陷:探索奖励主导→选择近乎随机;强制全展开→预算摊薄;分支不看质量→低分节点浪费资源 ② ExTS三大核心机制:判别式奖励塑造(放大高分差异)+ 虚拟子节点(展开变成信息价值决策)+ 质量门控分支(只有高分节点才能产生新分支) ③ 跨领域通用性:提示优化+10.8%、代码生成+11.7%、分子解析+1.3%、工作流优化+3.5%(成本降58%) ④ 诊断驱动的自适应:通过试点诊断指标(失败率/分数漂移/refine方差)自动匹配最优配置 ⑤ 消融实验:失败惩罚影响最大(-7.78pp),虚拟子节点次之(-3.22pp),质量门控(-2.34pp) 🧭 深度解读(摘要) ExTS的核心洞察是:在预算紧张时,"是否展开新分支"和"访问哪个子节点"同等重要。通过虚拟子节点从父节点奖励历史采样估算展开价值,与真实子节点直接竞争;配合温度控制的非线性奖励变换放大高分差异,以及质量门控限制低分节点产生新分支。三个机制协同将搜索从"撒网"变成"狙击"。 🎯 启发 别再给AI"无限预算"了,论文告诉你:限制反而是最好的催化剂,逼它学会选择 原来"展开新分支"不是理所当然的,而是需要像投资决策一样计算"信息价值" 你以为MCTS的探索常数C调一调就够了?论文证明:结构性缺陷靠参数调节根本治不了 给搜索树装上"质量门禁",低分节点连生孩子的资格都没有——这才是真正的优胜劣汰 从围棋到AI智能体搜索,蒙特卡洛树搜索的第二次青春来了 💬 今日金句 「在预算紧张时,决定'不做什么'比决定'做什么'更重要——ExTS把搜索从'撒网'变成了'狙击'。」 🏷 #预算受限搜索 #信息价值决策 #虚