PulseAugur
实时 02:29:41
实体 DeepSearchQA

DeepSearchQA

PulseAugur coverage of DeepSearchQA — every cluster mentioning DeepSearchQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_221074 ·

    AI智能体通过新的“工具链”演进技术得到提升 · 跟踪4个来源

    两篇新的研究论文介绍了通过关注围绕核心语言模型的“工具链”来提高AI智能体性能的方法。第一篇HarnessLens使用行为感知验证来高效地演进工具链,在较低的评估预算下显示出显著的性能提升。第二篇JIT-Agent是一个可训练的模型,可以即时合成任务自适应工具链,证明工具链智能可以成为智能体能力的独立且累积的维度。

  2. TOOL · CL_161242 ·

    Anthropic 的 Claude 食谱提供了高级代理构建食谱 · 跟踪 2 个来源

    Anthropic 发布了一系列资源和教程,称为 Claude 食谱,详细介绍了如何使用其 Claude 模型和 SDK 构建和部署高级 AI 代理。这些资源涵盖了从重现基准分数、编排多代理系统到为网络安全、数据分析和 SRE 事件响应创建专用代理的各种应用。该食谱还提供了关于代理托管、内存能力以及将代理与 Slack 等平台集成的指导。

  3. RESEARCH · CL_153696 ·

    新的AI代理处理深度研究和误导性网络数据 · 跟踪4个来源

    研究人员推出了一系列新的递归自改进代理AREX,用于深度研究任务。AREX在研究和自我改进循环之间交替进行,使用自主上下文更新工具来管理不断增长的交互历史。这种方法使AREX在BrowseComp和Humanity's Last Exam等基准测试中表现优于同等规模的基线。同时,另一项研究引入了DRNOISE,这是一个旨在评估深度研究代理在开放网络上处理误导性信息的能力的基准,突出了存在此类文件时准确性显著下降的问题。

  4. TOOL · CL_145206 ·

    Khidi 弥合了开发者与更便宜的开源模型之间的差距

    一项名为 Khidi 的新服务旨在弥合开发者与开源模型成本效益之间的差距。创始人解释说,虽然开源模型在技术上已能与旗舰产品相媲美,但访问和支付它们的复杂性却造成了障碍。Khidi 通过提供一个兼容 OpenAI 的 API 网关来简化这一过程,处理推理来源、计量和密钥管理,允许用户通过银行卡或 USDT 付款。这种方法旨在让用户在没有直接集成提供商的技术障碍的情况下,也能使用更便宜的模型。

  5. TOOL · CL_86307 ·

    Perplexity 将深度研究与多模型编排系统集成

    Perplexity 已将其深度研究功能集成到其计算机编排系统中,增强了将复杂问题分解为子任务的能力。然后,这些子任务会被路由到 20 多个不同的 AI 模型,从而显著提高准确性和分析深度。该系统采用“搜索即代码”方法,现在可以生成可直接用于工作的报告、演示文稿和仪表板,并在代理浏览能力方面取得了显著的基准改进。

  6. FRONTIER RELEASE · CL_11258 ·

    Google Gemini API 推出 Deep Research 更新,支持 MCP 和图表生成

    Google 发布的两个重要更新增强了其 Gemini API 的 Deep Research 功能。这些更新引入了更高的质量、对 MCP 的支持以及图表和信息图表的原生生成。Gemini API 现在提供两种模式:用于速度和效率的 Deep Research 模式,以及用于最高质量上下文收集和综合的 Max 模式,在 DeepSearchQA 和 HLE 上取得了强劲的基准测试分数。

  7. TOOL · CL_17634 ·

    Spine Swarm 发布 AI 代理,在研究方面超越 Claude 和 ChatGPT

    Spine Swarm 是一家获得 Y Combinator 支持的初创公司,已推出一个平台,该平台利用 300 多个 AI 代理进行研究并生成面向客户的文档。该系统声称在 Google DeepMind 的 DeepSearchQA 基准测试中获得最高排名,超越了 Claude 和 ChatGPT 等模型。Spine 的方法涉及并行代理群组,它们处理不同的工作流,传递结构化输出来创建报告、演示文稿和电子表格等可交付成果。