PulseAugur
实时 13:00:48
实体 Monte Carlo tree search

Monte Carlo tree search

PulseAugur coverage of Monte Carlo tree search — every cluster mentioning Monte Carlo tree search across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
24
90 天内 66
发布 · 30天
0
90 天内 0
论文 · 30天
23
90 天内 65
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-08 research_milestone A new paper presents a finite-time analysis for MCTS in continuous POMDP planning, offering theoretical guarantees. 来源
情绪 · 30 天

16 天有情绪数据

最近 · 第 1/4 页 · 共 66 条
  1. TOOL · CL_216002 ·

    新方法利用MCTS实现动态网络在线设计

    研究人员提出了一种新颖的动态网络在线设计方法,这与传统的离线规划不同。该方法利用蒙特卡洛树搜索(MCTS)驱动的滚动视界优化,以响应环境变化和性能目标动态构建网络。通过模拟纽约市未来公共交通网络的仿真,该方法证明了其有效性,能够根据随机的用户需求即时调整公交线路,并优于现有的动态车辆路径问题方法。

  2. TOOL · CL_210462 ·

    AlphaClifford使用强化学习优化量子电路合成

    研究人员开发了AlphaClifford,一个利用基于模型的强化学习和蒙特卡洛树搜索来优化量子计算中Clifford电路的合成和转译的新框架。与现有方法相比,这种方法有效地应对了辛群的组合复杂性,从而减少了门数量。AlphaClifford在无约束优化、硬件约束转译以及作为更大合成流程中的后合成优化工具方面表现出卓越的性能,为量子编译挑战提供了可扩展的解决方案。

  3. TOOL · CL_208479 ·

    新的MCTS方法提升LLM知识库问答能力

    研究人员开发了一种名为Fast MCTS的新方法,以提高大型语言模型(LLM)在知识库问答(KBQA)方面的性能。该方法解决了基于LLM的KBQA中传统蒙特卡洛树搜索(MCTS)在设计奖励和计算成本方面面临的挑战。Fast MCTS利用信息增益奖励来处理中间状态,该奖励使用开源指令LLM计算,无需额外的奖励模型训练。在四个KBQA基准测试上的实验表明,Fast MCTS优于线性基线,并且与经典的MCTS方法相比,提供了更好的准确性-成本权衡。

  4. TOOL · CL_208430 ·

    新的MCTH框架利用AI进行生物分子序列-结构协同设计

    研究人员开发了一个名为MCTH(Monte Carlo Tree Hallucination,蒙特卡洛树幻觉)的新框架,用于设计生物分子序列和结构。该方法使用蒙特卡洛树搜索来探索潜在的设计轨迹,并整合预训练模型的置信度和生物物理约束。在蛋白质-RNA和蛋白质-DNA等各种生物分子相互作用上的实验表明,MCTH的自适应搜索优于简单的采样策略,并且在AlphaFold3和Chai-1上的评估证明了其在搜索时间模型之外的有效性。

  5. TOOL · CL_206210 ·

    新系统AutoSR通过搜索研究状态实现符号回归自动化

    研究人员开发了AutoSR,一种新颖的自动符号回归系统,它通过搜索研究状态而非孤立的方程来进行。这种方法保留了科学记录,包括推理和计算证据,以指导可信表达式的搜索。AutoSR利用提议者-审查者代理和蒙特卡洛树搜索来探索竞争性研究,最终将积累的知识综合成一份最终报告。该系统在各种基准挑战中都取得了成功,恢复了代数等价关系,并将符号回归扩展到自动化科学研究。

  6. TOOL · CL_204052 ·

    AI 方法通过 98.43% 的生存率提升电网稳定性

    研究人员开发了一种受 AlphaZero 启发的蒙特卡洛树搜索 (MCTS) 方法,用于电力网络的自主拓扑控制。该方法旨在管理拥堵并维持电网稳定,尤其是在可再生能源整合日益增加的情况下。研究发现,优化的 AlphaZero 方法达到了 98.43% 的峰值生存率,优于近端策略优化 (PPO) 变体。关键发现表明,使用简单的二元生存奖励和受限的线路负荷观测空间,在没有先验策略或价值函数指导的情况下,可以提高训练效率和有效性。

  7. TOOL · CL_196008 ·

    MIRA框架通过证据验证增强自主医学诊断

    研究人员开发了MIRA,一个用于自主医学图像诊断的新框架,该框架侧重于验证通过工具使用收集的证据的必要性和相关性。MIRA动态地运用图像处理操作和网络搜索,并评估它们与诊断假设的一致性。该框架采用了两阶段过程进行训练,包括工具增强的蒙特卡洛树搜索和强化学习来优化决策。在九个基准测试中,MIRA将Qwen3-VL-8B骨干模型的性能提高了7.44个百分点,显著提高了准确的工具使用判断并减少了有害的判断。

  8. TOOL · CL_193932 ·

    新框架通过贝叶斯 MCTS 提升 LLM 启发式设计

    研究人员开发了 Clade-AHD,一个旨在提高大型语言模型(LLM)自动启发式设计(AHD)中蒙特卡洛树搜索(MCTS)效率的新框架。这种新方法用分支级别的贝叶斯信念取代了传统的节点级别估计,利用 Beta 分布和 Thompson 采样来更有效地建模不确定性和指导探索。实验表明,Clade-AHD 在复杂的优化问题上优于现有方法,同时需要更少的计算资源。

  9. TOOL · CL_193648 ·

    新的VCU-Bridge框架增强了MLLM的视觉推理层级

    研究人员推出VCU-Bridge,一个旨在改进多模态大语言模型(MLLM)理解视觉信息方式的新框架。与当前模型通常分别处理细节和高级概念不同,VCU-Bridge通过明确的证据-推理追踪,将具体线索与抽象结论联系起来,模仿人类的分层推理。为评估这一点,他们开发了HVCU-Bench,一个诊断不同推理层级性能的基准。实验表明,在较高的推理阶段性能有所下降,但通过蒙特卡洛树搜索指导的数据生成全面提高了性能,包括在MMStar基准上的显著提升。

  10. TOOL · CL_193347 ·

    Branch2Skill框架利用推理树提高AI技能演进效率

    研究人员开发了Branch2Skill,一个旨在提高AI技能演进效率的新型框架。该方法利用蒙特卡洛树搜索从单个任务生成多样化的推理轨迹,通过比较精英路径与其同级路径来提取详细反馈。这种方法将多步证据提炼为可重用的更新,显著降低了传统技能优化周期相关的代币成本。在基准测试中,Branch2Skill展示了卓越的性能和效率,尤其是在与GPT-5.5结合使用时,其代币成本比现有方法低73.2%。

  11. TOOL · CL_187251 ·

    LLM引导的框架加速微架构设计探索

    研究人员开发了MicroEvo,一个利用大型语言模型(LLMs)结合蒙特卡洛树搜索(MCTS)来增强微架构设计空间探索的新型框架。这种知识引导式方法结合了LLM驱动的进化算子和主动知识积累机制,以从迭代搜索中学习并重用优化见解。实验表明,与NSGA-II算法相比,MicroEvo的帕累托前沿质量显著提高了36.2%,搜索效率提高了10.6倍,并且对复杂工业规模核心表现出强大的可扩展性。

  12. TOOL · CL_185321 ·

    G-Boost框架通过LLM协作增强边缘SLM

    研究人员开发了G-Boost,一个旨在增强边缘设备上部署的小型语言模型(SLM)性能的新颖框架。该系统实现了资源受限的边缘SLM与基于云的强大大型语言模型(LLM)之间的协作,而无需对边缘模型进行直接参数更新。G-Boost使用一种由奖励模型指导的树搜索方法,动态决定何时仅使用SLM,何时融合SLM和LLM的logits,从而转移领域知识。在GSM8K和MATH-500基准上的评估表明,G-Boost的性能显著优于独立的SLM和其他基…

  13. TOOL · CL_185218 ·

    新的基于MCTS的框架增强了表格到多模态报告的生成

    研究人员开发了MCTS-Report,一个利用蒙特卡洛树搜索(MCTS)来改进从结构化表格数据生成多模态报告的新框架。该方法将报告创建分解为离散动作,如规划、图表生成和叙述优化,并由一个LLM指导整个过程。一个多维奖励函数用于评估事实一致性、视觉质量和连贯性,同时创建了一个新的基准测试MMRBench来测试该系统的有效性。实验表明,MCTS-Report在生成准确且结构良好的报告方面显著优于现有方法。

  14. TOOL · CL_184946 ·

    HELENA框架通过新颖的协调增强多智能体系统

    研究人员推出HELENA,一个新颖的多智能体系统框架,旨在通过整合不同的推理路径并抑制噪声来增强分析能力。HELENA使用蒙特卡洛树搜索和行列式点过程选择互补拓扑,构建一个复合图。然后,一个分层稀疏协调模块仅激活必要的子图,通过压缩的潜在摘要抑制冗余信息。实验表明,HELENA在八个基准测试中取得了最先进的成果,包括在MMLU-Pro上显著的平均提升。

  15. TOOL · CL_183221 ·

    研究发现 AlphaZero 的学习行为得到部分内化

    一项新的研究论文探讨了 AlphaZero 如何内化在自我对弈搜索中学到的行为。研究人员使用一种称为跨阶段先验干预(CPI)的方法,可以在评估期间区分网络学到的行为和搜索算法提供的行为。研究发现,虽然搜索指导显著提高了性能,但即使在移除指导后,网络仍保留了相当一部分这些学习到的行为,尽管这种内化的能力受限于几何形状,在新的情况下的效果较差。

  16. TOOL · CL_180641 ·

    新框架超越外在指标评估MARL策略最优性

    研究人员开发了一个新的信息论框架来评估多智能体强化学习(MARL)策略,超越了传统的奖励曲线等外在指标。这种新颖的方法使用收敛的蒙特卡洛树搜索作为基线来计算有界策略最优性得分,该得分会惩罚协作遗漏。该框架提供了细粒度的

  17. TOOL · CL_181227 ·

    新论文统一进化计算用于自主交易信号发现

    一篇新论文提出了一个统一的进化计算(EC)视角,用于自动化公式化阿尔法发现,这是一个从符号因子空间生成交易信号的过程。该研究引入了一个六个组成部分的框架来分析现有方法,以及一个八维评估框架来指导开发更可靠和自适应的阿尔法发现系统。这种方法旨在解决诸如嘈杂的适应度估计、市场非平稳性和昂贵的历史回测等挑战。

  18. RESEARCH · CL_178310 ·

    新的MARS框架实现了多智能体系统的自主修复

    研究人员开发了MARS,一个用于自主修复多智能体系统(MAS)的新型基于搜索的框架。MARS将修复过程构建为蒙特卡洛树搜索(MCTS)问题,通过诊断引导的扩展和分类增强的评估来导航潜在解决方案。该方法在新提出的StateMAS基准测试中表现显著优于现有方法,该基准测试包含1,310个多智能体故障轨迹。MARS在有效管理令牌消耗的同时,显著提高了修复准确性。

  19. TOOL · CL_174016 ·

    新AI架构在消费级硬件上提升围棋表现

    研究人员开发了一种新的围棋AI信念引导架构,旨在提高在消费级硬件上的性能。该架构将策略头与一个独立的信念头分开,后者模拟认知不确定性和战略稳定性。通过引入记忆机制和门控机制来过滤过度自信的策略错误,该模型将智能从运行时搜索转移到参数化直觉,显著提高了无搜索胜率并减少了幻觉。

  20. RESEARCH · CL_174104 ·

    新的LLM框架SciDataSailor支持深度科学数据探索

    研究人员推出SciDataSailor,一个旨在使大型语言模型(LLM)代理能够交互和分析复杂科学数据集的新框架。这种代理任务范式允许LLM导航分层数据存储库、解释不同文件类型、执行分析并综合基于观测数据的结论。SciDataSailor采用蒙特卡洛树搜索,并配有专门的机制来平衡探索和利用,已被用于在不同科学领域创建用于监督微调和评估的数据集。