PulseAugur
中
实时 23:50:30
实体 agent loop

agent loop

PulseAugur coverage of agent loop — every cluster mentioning agent loop across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. COMMENTARY · CL_292202 ·

    AI代理循环成本由架构驱动,而非仅仅模型价格

    运行AI代理循环的成本通常高于预期,这主要是由于代理内部流程的开销,而不是模型按token计费的价格。代理回合的每个步骤,包括规划、工具执行以及重新注入工具结果,都会产生token成本。将工具输出反复反馈给模型以进行后续步骤,会显著增加费用,尤其是在涉及重试的情况下。优化这些代理循环需要关注架构选择,并衡量所有阶段的token消耗,而不仅仅是最终的模型输出。

  2. TOOL · CL_246528 ·

    AWS推出面向多轮AI对话的Agent评估指标

    Amazon Web Services (AWS) 推出了Agent评估指标 (AEM),以应对评估多轮对话Agent的挑战。AEM提供了一种可分解的、回合级别的评估,可以精确定位具体错误,而整体分数则会掩盖根本原因。该指标将Agent质量分解为可衡量的子指标,如真实性和完整性,从而能够更精确地识别和纠正复杂、多步骤交互中的失败。与此同时,DeepSeek的开发团队详细介绍了其Agent循环的内部工作原理,解释了对话处理中的“回合 (…

  3. COMMENTARY · CL_239919 ·

    Martin Fowler 质疑 AI 代理循环中的 TDD 价值

    Martin Fowler 探讨了测试驱动开发 (TDD) 在代理循环中的实际应用,质疑其是否提供真正价值,抑或仅仅是表演。他审视了 TDD 原则如何融入 AI 开发流程,并考虑了对软件开发的影响。

  4. TOOL · CL_122619 ·

    Quorum 工具阻止 AI 代理循环以防止产生幻觉

    一个名为 Quorum 的新开源工具通过引入评论员-裁判系统来提高 AI 代理循环的可靠性。该工具通过在代理的每个步骤进行评估,然后再允许其继续,从而防止诸如幻觉之类的错误传播。Quorum 采用五个独立的裁判来评估基础性、一致性、安全性、引用和可复现性,如果共识被打破则会停止代理执行并提供详细的失败反馈。