PulseAugur
中
实时 20:59:03
实体 LLM agent

LLM agent

PulseAugur coverage of LLM agent — every cluster mentioning LLM agent across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
37
90 天内 37
发布 · 30天
0
90 天内 0
论文 · 30天
18
90 天内 18
层级分布 · 90 天
主题
时间线
  1. 2026-05-21 product_launch A developer built and documented a local LLM agent for automating work list generation.
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 37 条
  1. TOOL · CL_282011 ·

    自托管SearXNG和网关可降低LLM代理网页搜索成本

    一位开发者分享了一种方法,可以在不产生高额费用或达到速率限制的情况下,为LLM代理集成网页搜索功能。该方法涉及自托管类似SearXNG的元搜索引擎,并实现一个搜索网关。该网关负责缓存、速率限制、使用trafilatura等库获取内容,并在将结果返回给LLM代理之前执行引用检查。

  2. MEME · CL_274476 ·

    LLM代理越来越多地出现在Mastodon评论中

    Mastodon上的用户越来越多地遇到似乎来自LLM代理的帖子,通常附带专注于特定主题的描述。当用户打开帖子阅读评论时,发现只有机器人生成的内容,这种趋势变得越来越明显。

  3. TOOL · CL_244855 ·

    论文质疑LLM智能体排行榜的有效性

    一篇新论文质疑LLM智能体排行榜的有效性,认为对排名智能体的直接比较可能具有误导性。作者们强调,任务组合、数据来源、发布细节和成本规则的差异会显著影响智能体的得分。他们提出了一种可估算感知程序,以更准确地评估成对优势,并强调在解释排名差异时需要考虑不确定性和实际边际,尤其是在SWE-bench和AgentRewardBench等基准测试上。

  4. TOOL · CL_240184 ·

    Best of AI 推出‘技能’目录,用于 LLM 代理工具

    Best of AI 推出了一个名为 Skills 的新版块,旨在帮助用户查找和整理 LLM 代理的专业指令和脚本。这个精选目录通过提供一个集中的平台来浏览和比较,解决了代理技能分散的问题。首批发布包含 9 个类别中的 50 项技能,涵盖文档自动化、开发、代码审查和设计等,其中 Anthropic 在文档处理方面做出了显著贡献。

  5. TOOL · CL_238707 ·

    SAP BTP 支持 AI 代理主体传播,实现用户特定的 ABAP API 访问

    本技术指南详细介绍了如何为与 SAP BTP 交互的 AI 代理实现主体传播。该过程确保后端 REST API 调用在 ABAP 系统中以单个用户的身份进行记录和授权,而不是使用共享服务账户。这是通过建立从用户浏览器会话到 SAP BTP Cloud Foundry、Cloud Connector,最终到 ABAP ICM 层的主体信任链来实现的,其中 X.509 证书会验证调用者。该指南概述了启用此安全且可审计的用户身份流程所需的 …

  6. RESEARCH · CL_252665 ·

    新的LLM代理技能路由方法提高了效率和多样性

    研究人员开发了新的方法,使LLM代理能够更有效地选择和利用外部技能。一种名为Gavel的方法使用冻结的LLM,仅通过训练两个线性映射来引发本地技能路由,然后可以识别正确的技能,而无需在上下文中包含其元数据。与添加大量外部参数的流水线相比,该方法在基准测试中表现出优越的性能。另一种方法,多样化技能路由(DSR),通过使用行列式点过程来平衡相关性和非冗余性,解决了冗余技能的问题,提高了召回率和覆盖率,尤其是在需要多种技能的复杂查询方面。

  7. TOOL · CL_233737 ·

    LLM代理在实时CAN总线上安全测试,以电源站为目标

    一个LLM代理已成功在实时CAN总线上进行测试,目标是消费级便携式电源站。这涉及到设置线束、权限门和仪器仪表,以确保与物理硬件的安全交互。该实验证明了该代理绕过安全权限的能力,该电源站储存了约3.6兆焦耳的能量。

  8. RESEARCH · CL_235650 ·

    LLM代理SLIDEFORGE支持可控编辑演示幻灯片

    研究人员开发了SLIDEFORGE,一个专为可控编辑演示幻灯片而设计的LLM代理。与现有在布局和可编辑性方面存在困难的代理不同,SLIDEFORGE构建了一个Deck State Graph。该图连接了视觉分解、原生对象结构和感知组织,通过幻灯片原生操作实现主题保留重建和验证。实验表明,在组件恢复、一致性和可编辑性方面,SLIDEFORGE优于直接提示和基于屏幕截图的代理。

  9. TOOL · CL_222726 ·

    LLM Agent 开发者解决 OAuth Token 过期问题以实现工作流稳定性

    一位开发者在构建一个与 Blogger API 交互的 LLM Agent 时,遇到了 OAuth Token 过期的问题。起初,重点是刷新访问令牌,但底层的刷新令牌也过期或失效,导致 Agent 停止运行。这使得人们意识到,需要更强大的重新认证策略来处理刷新令牌本身过期或失效的情况,从而确保自动化工作流的稳定性。

  10. RESEARCH · CL_217698 ·

    大语言模型-代理分解研究探讨增值税确定的任务规模调整

    一项试点研究探讨了在增值税(VAT)确定中,大语言模型(LLM)代理任务的最佳分解方法。该研究比较了从单一、宽泛的代理到五个专业化、狭窄的代理的配置,同时保持基础模型和编排器等其他因素不变。虽然中间配置的准确性(0.830)高于单一或高度碎片化的代理,但未能达到预定义的准确性阈值,因此在试点规模下,中间最优的假设未得到支持。研究还发现,单一代理的表现并不总是优于编排系统,并且故障注入显示,更宽泛的重启机制可以从错误中恢复,而符合模式的…

  11. RESEARCH · CL_208387 ·

    新型大语言模型代理可自动检测金融时间序列变化点

    研究人员开发了EvoTS-Agent,这是一种新颖的大语言模型代理,旨在自主检测金融时间序列数据中的变化点。该代理解决了非平稳和异构数据特性带来的挑战,而传统方法通常需要大量专家干预。EvoTS-Agent采用自演化方法,包含Revision、Alternative Strategy和Recombination等算子,以适应特定数据集的检测流程,并在各种大语言模型上展示了卓越的性能和100%的执行成功率。

  12. TOOL · CL_206212 ·

    新BATON方法通过子任务探索增强机器人操作

    研究人员开发了一种名为BATON的新方法,通过将复杂任务分解为更小、可管理的子任务来改进长时机器人操作。该方法解决了多阶段任务中错误累积以及子任务成功不能保证下一阶段能利用其结果的问题。BATON独立探索每个子任务,并将解决方案存储在感知转换的内存中,这降低了探索成本并将失败归因于特定阶段。该方法在RoboMemArena基准测试中显示出更高的任务成功率。

  13. TOOL · CL_203925 ·

    LLM智能体通过生理反馈实现个性化葡萄糖调控

    研究人员开发了一个新颖的系统,该系统使用大型语言模型(LLM)智能体来个性化餐食水平的葡萄糖调控。该系统整合了个体吸收建模与饮食干预,解决了当前血糖指数方法未能考虑个人生理反馈的局限性。提出的生理反馈智能体循环包括一个生理感知葡萄糖预测器和一个预测驱动的两阶段餐食优化智能体,该智能体根据预测结果迭代地优化餐食。实验表明,该方法提高了预测准确性并有效减少了葡萄糖波动,标志着将LLM智能体应用于精准营养学迈出了重要一步。

  14. MEME · CL_196646 ·

    开发者错误地责骂了终端而不是LLM代理

    一位用户幽默地分享了一个关于错误地责骂终端而不是LLM代理的轶事。这种情况突显了AI工具日益融入日常开发者工作流程。

  15. TOOL · CL_174784 ·

    JetBrains Research 开源 KotlinLLM 以实现运行时代码生成

    JetBrains Research 已开源 KotlinLLM,这是一个为 Kotlin/JVM 项目设计的实验性 IntelliJ IDEA 插件。该工具引入了“智能宏”,它们是常规的 Kotlin 函数调用,可在运行时生成 Kotlin 源代码。该插件促进了一个循环,它捕获运行时值,向 LLM 代理请求代码更新,然后编译并热重载类。在对 Spring Petclinic 项目进行测试时,KotlinLLM 在 24 个场景中实现…

  16. TOOL · CL_167324 ·

    LLM 智能体自动化 CT 重建研究,挑战基准有效性

    研究人员开发了一种能够执行 CT 重建技术自主研究的 LLM 智能体,自动化了比较和调整各种方法的劳动密集型过程。该智能体被用于实现、调整和基准测试 26 种不同的重建技术。研究发现,基于理想化数据的排行榜无法准确预测在现实噪声条件下的性能,当引入噪声时,方法的排名发生了显著的倒置,证明了这一点。研究表明,基准测试应同时纳入广泛的现实因素,以认证 CT 重建方法的通用性。

  17. COMMENTARY · CL_166289 ·

    已识别出22种常见的LLM代理失败模式

    无论其专业领域如何,例如编码或研究,LLM代理都会表现出22种一致的失败模式,而不是独特的bug。这些失败可以被分类,并且特定的提示词可以缓解它们。这些提示词的有效性范围从完全消除失败到仅仅标记它,具体取决于修复是模型的程序性规则还是其推理能力的真正改进。

  18. TOOL · CL_165817 ·

    阿里巴巴发布集成 LLM 代理的 Open Code Review 工具

    阿里巴巴集团发布了 Open Code Review,一个旨在通过将 LLM 代理集成到审查流程中来提高代码质量的开源工具。该混合系统结合了确定性管道和 AI,对 SQL 注入和 NullPointerExceptions 等常见漏洞提供精确的行级反馈。该工具通过兼容 OpenAI 和 Anthropic 模型来支持灵活性,旨在减少审查瓶颈并提高开发效率。

  19. TOOL · CL_157995 ·

    用户分享指导LLM Agent编码的技巧

    一位Reddit用户分享了一种在编码任务中指导LLM Agent的技术。该方法包括将纯文本注释直接插入代码中,故意破坏其语法。这会促使LLM Agent注意到编译错误,找到注释,并相应地调整其代码。这种方法允许在不中断Agent工作流程的情况下进行实时指导,将该过程变成实时的代码审查。

  20. TOOL · CL_155503 ·

    AI代理获得密码保险库访问权限,带来新的安全风险

    AI代理与密码管理器的集成引入了一个重大的新攻击面,可能允许恶意行为者窃取凭据或执行未经授权的操作。尽管尚未发生任何泄露,但风险在于提示注入或工具调用混淆会说服代理滥用密码。开发人员必须为代理凭据访问实施严格的作用域限制和人工审核确认,安全团队需要更新其风险登记册以应对这一新兴威胁。