PulseAugur
中
实时 17:45:54
实体 Monte Carlo tree search

Monte Carlo tree search

PulseAugur coverage of Monte Carlo tree search — every cluster mentioning Monte Carlo tree search across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
81
90 天内 81
发布 · 30天
0
90 天内 0
论文 · 30天
80
90 天内 80
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-08 research_milestone A new paper presents a finite-time analysis for MCTS in continuous POMDP planning, offering theoretical guarantees. 来源
情绪 · 30 天

9 天有情绪数据

最近 · 第 1/5 页 · 共 86 条
  1. TOOL · CL_284479 ·

    深度集成模型改进了用于溢油监测的AI路径规划

    研究人员开发了一种用于水体环境监测的信息路径规划新方法,特别适用于溢油等场景。该方法用深度集成模型取代了传统的高斯过程,显著提高了场重建的准确性。研究还强调了模型不确定性估计的质量如何放大不同规划算法的影响,当不确定性校准良好时,多步前瞻规划器优于贪婪选择。

  2. TOOL · CL_284473 ·

    新的DrugMCTS框架利用LLM和多智能体系统增强药物再利用

    研究人员开发了DrugMCTS,一个旨在利用大型语言模型改进药物再利用的新框架。该系统集成了检索增强生成(RAG)、多智能体协作和蒙特卡洛树搜索,以克服传统微调或RAG方法的局限性。DrugMCTS利用五个专门的智能体进行分子和蛋白质信息分析,实现了结构化推理,并在DrugBank和KIBA等数据集上取得了比现有LLM和深度学习模型更高的召回率和鲁棒性。

  3. TOOL · CL_280919 ·

    LLM代理通过新颖的搜索框架增强蛋白质设计

    研究人员开发了ELMS(基于证据的LLM引导蒙特卡洛搜索),一种用于蛋白质设计的新颖框架,该框架利用大型语言模型(LLM)代理来改进基序支架。与传统的生成后过滤方法不同,ELMS利用结构评估的反馈来指导设计动作的迭代。评论员代理识别结构故障,策略代理选择修改运算符,蒙特卡洛树搜索(MCTS)通过重新访问有希望的状态来优化搜索过程。该方法显著优于现有基线,在单基序任务上成功率为86.41%,在配对基序任务上成功率为84.57%,并在有限…

  4. RESEARCH · CL_270796 ·

    新框架增强AI视频理解和多视频推理能力 · 跟踪3个来源

    研究人员开发了用于改进视频理解智能体的新框架。Video-RSI 通过让智能体修改自身的工具链以更好地从视频中获取和使用证据,专注于递归式自我改进,从而提高了准确性和效率。VidHarness 使用蒙特卡洛树搜索和不确定性感知验证来自动化长视频理解的工具链设计,在多个基准测试中表现优于现有方法。此外,SAMA 框架和 MVX-Bench 基准测试解决了多视频推理的局限性,使智能体能够跨多个视频进行结构化推理,并优于强大的基线。

  5. TOOL · CL_268724 ·

    受大脑启发的“层程序”重新构想大型语言模型推理

    研究人员探索了一种新颖的大型语言模型(LLM)推理方法,称为层程序(Programs-of-Layers, PoLar),它偏离了标准的固定深度前向传播。受人脑通过丘脑进行灵活信息路由的启发,PoLar将LLM层视为一个函数库,可以根据输入难度动态选择、跳过或重复。虽然该研究重现了一些发现,例如跳过和重复层可以提高性能,但未能复制其关于单次推理学习路由器的主要论点,因为该路由器始终默认为标准前向传播。研究还强调了旨在纠正错误的程序的脆…

  6. TOOL · CL_269383 ·

    深度集成模型增强水生环境监测路径规划

    研究人员开发了一种用于水生环境监测中信息路径规划的新方法,利用深度集成模型来提高标量场重建的准确性。该深度集成模型显著优于传统的斯高斯过程,在模拟漏油场景中将重建误差降低了83%。研究还强调,模型的不确定性估计质量对于有效的路径规划至关重要,当不确定性得到良好校准时,多步前瞻算法比贪婪方法有显著的收益。

  7. TOOL · CL_259183 ·

    PrimeScientist 框架优化自动研究精力分配

    研究人员推出 PrimeScientist,一个旨在优化自主研究代理资源分配的新框架。该系统通过战略性地决定在连续尝试中将研究精力投入何处来应对资源有限的挑战。PrimeScientist 利用可执行计划树来跟踪竞争性研究计划及其结果,并结合自适应蒙特卡洛树搜索策略,该策略利用实验反馈和剩余资源来平衡探索与利用。在人工智能研究、系统优化和机器学习工程方面的评估表明,PrimeScientist 显著提高了研究质量和样本效率,在奖励和资…

  8. TOOL · CL_257006 ·

    新AI框架ViCo通过自反思增强图表生成能力

    研究人员推出了一种新颖的训练框架ViCo,旨在提高AI生成学术图表的质量。该系统解决了当前AI代理在生成与人类撰写的论文在风格和语义保真度上匹配的可视化方面的局限性。ViCo采用迭代自反思和多步强化学习算法,逐步使生成的图表图像与参考图表保持一致,解决了奖励稀疏等问题。实验表明,在8B模型上训练的ViCo,其性能可与具有强大反思能力的专有LLM相媲美。

  9. TOOL · CL_254210 ·

    新的VisInteract范式解决了不完美的视觉查询问题

    研究人员推出了一种新颖的文本到可视化系统范式VisInteract,它解决了不完美用户查询的挑战。与假设输入明确的现有系统不同,VisInteract专为动态、交互驱动的意图恢复而设计。为了支持这一点,他们还开发了VisInteract-Bench,这是第一个用于交互式文本到可视化系统的基准测试,其中包括注入查询不完美的方法和一个用于真实多轮反馈的用户代理。提出的算法方法Vis-MCTS利用增强的蒙特卡洛树搜索技术来提高性能。

  10. TOOL · CL_244962 ·

    新算法 \Algname 增强了蒙特卡洛树搜索在随机环境中的性能

    研究人员开发了一种新的蒙特卡洛树搜索(MCTS)算法,名为 \Algname,专门用于连续和随机马尔可夫决策过程(MDP)。这种新颖的方法整合了幂均值作为值备份算子和多项式探索奖励,以处理连续动作空间和非平稳性的复杂性。理论分析表明,\Algname 实现了多项式收敛速率,将先前的保证扩展到了随机环境。相关任务的实验结果证实了该算法在这些具有挑战性领域中的有效性。

  11. TOOL · CL_244895 ·

    近似价值迭代在AI游戏对弈中被证明具有惊人的有效性

    一篇新的研究论文探讨了近似价值迭代(AVI)在游戏程序自我对弈中的有效性。与预期相反,AVI 展现出了惊人的有效性,学习到的价值函数比 AlphaZero 更准确,并以显著更低的计算成本保持了有竞争力的策略。研究表明,尽管像 AVI 这样的简单方法随着现代深度学习工具的实用性日益增强,但它们可能被蒙上了阴影,而像蒙特卡洛树搜索(MCTS)这样的复杂方法则更受关注。

  12. TOOL · CL_233397 ·

    新的AI安全框架BLUEPRINT揭示模型漏洞

    研究人员开发了一个名为BLUEPRINT的新框架,用于评估前沿AI模型在多轮越狱攻击下的安全性。该框架将影响策略因素与情境模块分开,并使用蒙特卡洛树搜索来优化对话轮次。BLUEPRINT在各种模型上都显示出高有效性,只需少量查询即可揭示模型特定的漏洞。研究结果表明,强大的安全措施必须考虑对话状态如何使不安全请求显得具体且可执行。

  13. TOOL · CL_233380 ·

    DiffuSearch系统统一扩散和MCTS以改进自动驾驶轨迹规划

    研究人员推出了一种新颖的混合轨迹规划系统DiffuSearch,用于自动驾驶,它在生成和精炼阶段对齐目标。这种方法通过让扩散模型和蒙特卡洛树搜索(MCTS)组件都遵守共同的驾驶目标,如避碰、舒适和进度,从而确保一致性。在nuPlan和InterPlan基准上的实验表明,DiffuSearch通过减少碰撞和提高舒适度,显著提高了性能,尤其是在复杂场景下。

  14. TOOL · CL_229081 ·

    SkillForge 框架生成形式化验证的 Dafny 程序

    研究人员开发了 SkillForge,一个新颖的框架,旨在根据自然语言描述生成形式化验证的 Dafny 程序。该系统将复杂任务分解为可重用技能库,每个技能处理一个特定子任务,如规范推断或错误诊断。一个由验证驱动的约束器协调这些技能,将代码提交给 Dafny 验证器,诊断失败,并路由到适当的修复技能,直到达到形式正确性或满足资源预算。与现有的基于代理和迭代的方法相比,SkillForge 在自然语言到 Dafny 规范的基准测试中表现出…

  15. TOOL · CL_228919 ·

    AI代理框架使用Qwen2.5-7B改进逆合成搜索

    研究人员开发了一个用于逆合成的代理式框架,逆合成是药物发现和化学合成中使用的过程。该框架利用大型语言模型,特别是Qwen2.5-7B,来选择分子前沿进行扩展。与在LASER和RetroPath RL Golden等基准测试上的蒙特卡洛树搜索相比,经过微调的Qwen2.5-7B策略显示出更高的解决率,表明路线监督的前沿选择可以在不改变潜在生化生成过程的情况下增强预算搜索。

  16. TOOL · CL_228636 ·

    新的MCTS框架用于AI定理证明,凸显了证明审计的必要性

    研究人员开发了一种新颖的三角色蒙特卡洛树搜索(MCTS)框架,用于利用大型语言模型进行形式化定理证明。该方法将Lean 4编译器视为奖励预言机,使用其输出作为搜索更新的标量信号,而不将错误消息馈送到生成上下文中。该框架在MiniF2F和PutnamBench等基准测试中表现出改进的性能,并且重要的是,由于奖励黑客攻击问题(模型产生了依赖于非预期机制的可编译证明),揭示了对内核级证明审计的需求。

  17. RESEARCH · CL_231390 ·

    新的DREAMS框架通过MCTS和LLM增强对话推荐系统

    研究人员开发了DREAMS,一个用于建模对话推荐系统上下文的新框架。该方法使用树状模型来跟踪用户在多次交互中的偏好。DREAMS包含用于偏好引导的专用节点,采用蒙特卡洛树搜索(MCTS)来推断用户需求,以及用于偏好利用的节点,使用基于LLM的精炼来生成结构化查询以进行推荐。

  18. RESEARCH · CL_229178 ·

    单智能体强化学习模型提升化学工具学习能力,优于树搜索

    研究人员开发了一种新的化学工具学习方法,该方法使用单一策略,优于先前多智能体强化学习方法。该单一策略模型通过监督预训练和结果级强化学习进行训练,在单次生成中交织推理和工具调用。当应用于使用 Qwen 2.5 7B 和 Llama-3.1:8b 主干的 ChemToolBench 数据集时,与现有的搜索配置相比,该模型在工具 F1 和回报 F1 分数上取得了显著的改进。

  19. TOOL · CL_227113 ·

    论文认为蒙特卡洛树搜索与MC控制是相同的方法

    一篇新论文认为,蒙特卡洛树搜索(MCTS)和每次访问蒙特卡洛控制(every-visit Monte Carlo control)在根本上是相同的方法,主要区别在于术语和数据结构。该论文提出,MCTS的选择、扩展、模拟和备份阶段可以被重新解释为轨迹采样和每次访问蒙特卡洛更新。这种观点旨在阐明这两种方法之间的等价性,将MCTS视为蒙特卡洛控制的一种搜索语言表达。

  20. TOOL · CL_227102 ·

    新的探索方法提升无搜索象棋AI实力

    研究人员开发了一种名为先验引导探索的新方法,用于无搜索象棋引擎,旨在提高其超越简单模仿更强玩家的表现。该技术用前向Kullback-Leibler散度取代了标准的熵奖励,该散度将探索引导至网络自身搜索先验所识别的有希望的走法。该方法还结合了基于结果不确定性的自适应采样温度,从而提高了自我对弈强化学习中的战术准确性和博弈能力。