WideSearch
PulseAugur coverage of WideSearch — every cluster mentioning WideSearch across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究探讨LLM智能体的KV缓存压缩
一篇新近发表在arXiv上的研究探讨了大型语言模型(LLM)智能体在线KV缓存压缩的实用方法。该研究通过调整token驱逐和注意力匹配技术以适应在线压缩,专注于减少由长智能体轨迹引起的推理瓶颈。实验表明,延迟压缩和利用未来智能体查询可以弥补性能差距,并且在代理条件不完美的情况下,token驱逐被证明更具鲁棒性。
-
新的搜索代理方法将页面选择与提取解耦
一篇新的研究论文介绍了 Fetch-then-Explore,这是一种新颖的搜索代理方法,它将页面选择与证据提取解耦。与将页面内容与其打开时绑定的现有方法或仅使用片段的方法不同,Fetch-then-Explore 将选定的页面存储在文件系统上的持久工作区中。这使得代理可以按需重新访问页面并提取信息,跨多个搜索轮次累积证据,并提高 BrowseComp 和 WideSearch 等基准测试的准确性。
-
阿里云发布Qwen3.8,提升编程和办公AI能力 · 追踪2个来源
阿里云正式发布了其新的旗舰大型语言模型Qwen3.8,总参数量达到2.4万亿。该先进模型在编程和专业办公任务方面表现出显著的改进,跻身全球顶级大型模型之列。支持视觉理解和100万token上下文长度的Qwen3.8-Max,以及Qwen3.8-27B模型,将于下周开源发布。新模型提供了增强的推理能力、更快的推理速度以及具有竞争力的API服务定价。
-
新的AI代理处理深度研究和误导性网络数据 · 跟踪4个来源
研究人员推出了一系列新的递归自改进代理AREX,用于深度研究任务。AREX在研究和自我改进循环之间交替进行,使用自主上下文更新工具来管理不断增长的交互历史。这种方法使AREX在BrowseComp和Humanity's Last Exam等基准测试中表现优于同等规模的基线。同时,另一项研究引入了DRNOISE,这是一个旨在评估深度研究代理在开放网络上处理误导性信息的能力的基准,突出了存在此类文件时准确性显著下降的问题。
-
阿里巴巴Qwen发布AgentWorld语言模型用于环境模拟
阿里巴巴的Qwen团队推出了Qwen-AgentWorld,一个旨在模拟各种代理环境的新型语言世界模型。该模型侧重于训练大型语言模型理解和预测环境,而不仅仅是在其中行动。研究探索了两个主要途径:构建一个用于环境模拟的基础模型,以及研究世界建模如何增强代理训练,表明使用世界模型训练的代理可以优于在真实环境中训练的代理,并且预测性知识能有效地迁移到代理任务中。
-
Web2BigTable系统通过双层智能体架构增强LLM网络搜索能力
研究人员开发了Web2BigTable,一个新颖的双层多智能体系统,用于大规模互联网信息搜索和提取。该框架设有一个协调器,将任务分解以供低层工作智能体并行处理。通过一个持续的运行-验证-反思循环和一个共享工作空间,Web2BigTable增强了分解和执行能力,从而提高了数据一致性和覆盖范围。