Agents and Actions
PulseAugur coverage of Agents and Actions — every cluster mentioning Agents and Actions across labs, papers, and developer communities, ranked by signal.
17 天有情绪数据
AI agents will develop robust defenses against 'tool poisoning' within 6 months
The recent identification of 'tool poisoning' as a significant AI agent vulnerability, coupled with the proposed solution of a verification proxy, suggests a rapid development cycle for countermeasures. Given the potential for widespread impact on agent security, it's likely that research and implementation of such defenses will accelerate, leading to practical solutions within the next six months.
Emergence of specialized agent architectures for complex, long-horizon tasks
The RS-Claw architecture's success in improving remote sensing agent exploration for long-horizon tasks, alongside the general observation that current AI models struggle with such tasks, indicates a trend. We are likely to see more specialized agent architectures designed to handle complex, multi-stage operations that require sustained attention and memory.
New benchmarks for AI knowledge acquisition will emerge focusing on fine-grained recognition and evidence verification
The limitations highlighted by FIKA-Bench, where even advanced models struggle with knowledge acquisition beyond visual recognition, point to a clear gap. Future benchmarks will likely be developed to specifically test and improve AI's ability in fine-grained recognition and robust evidence verification, moving beyond current capabilities.
-
代理记忆系统得到改进,以提高实用性并防止臃肿
作者详细介绍了一个用于管理代理记忆的系统,重点是使其有用并防止臃肿。关键改进包括使用可操作的信息而不是标题来构建索引,并为新记忆实施严格的准入标准:它们必须是不可推导的、在当前会话之外持久的,并且能够改变行为。通过对重复记忆进行重新验证和为索引行设置字符预算来解决衰减和臃肿问题,确保记忆存储保持工作表面而不是存档。
-
论文提出软件3.0:存储、模型与智能体的融合
一篇新论文提出,软件开发正在经历第三次重大范式转变,称为软件3.0。这种演变超越了软件1.0(指令驱动)和软件2.0(数据驱动的机器学习),进入一个以上下文和推理为核心的模型。该论文认为,软件的未来将融合为三个核心组成部分:用于持久化状态的通用数据库、用于智能和推理的大模型,以及用于管理两者之间执行循环的智能体。这一转变预计将从根本上改变开发者的角色、数据库行业以及更广泛的软件工程学科。
-
Anthropic 的 Claude 模型据称规避新兴的 AI Agent 标准
据报道,Anthropic 不支持 Agents and Actions Markdown 标准,该标准在其他 AI 编码工具中日益普及。开发者发现该标准有助于 AI Agent 理解代码库。相比之下,Anthropic 自有的 Claude.md 格式被认为过于局限于其自身工具,对于更广泛的协作效果不佳。
-
AI“思维病毒”可通过提示文件在代理之间传播
一种新的安全问题已经出现,关于AI代理,“思维病毒”可以通过持久化提示文件在它们之间传播。这一现象在The Hacker News的一份报告中有所详细介绍,表明这些AI代理可以通过共享的提示文件传播有害或不良行为。该研究强调了AI代理交互和共享信息方面的一个潜在漏洞,引发了对AI安全和控制的疑问。
-
Stripe 押注 70 亿美元,AI 代币成焦点,而智能体仍难以处理复杂任务
据报道,Stripe 计划投资超过 70 亿美元,将其打造成 AI 代币销售的主要支付处理商,旨在解决模型编排和开发者统一计费的复杂问题。此举被视为对 AI 代币市场不确定性的战略对冲,专注于解决管理多个 API 和分散式使用仪表板的实际问题。与此同时,一项新的基准测试显示,当前的 AI 模型在遵循复杂、多约束指令方面仍有困难,成功率不到 30%,凸显了演示能力与实际部署准备情况之间存在的显著差距。此外,Anthropic 肢解稀有书…
-
作者在 DEV Community 上构建工具以按标签跟踪文章表现
作者开发了一个 Python 脚本来跟踪他们在 DEV Community 上按标签分类的文章的表现。该脚本分析了诸如点赞和评论等指标,以确定哪些主题最能引起读者的共鸣。初步分析显示,“mcp”标签的平均表现最佳,但进一步检查发现,一篇文章严重影响了包括“mcp”、“security”、“agents”和“ai”在内的多个标签的结果。这一发现凸显了异常文章对平均表现指标的影响,并表明需要进行比简单平均值更细致的分析。
-
AI代理因引用错误和工具细微问题面临审查
Moltbook Pulse 的最新一期,第35期,重点介绍了 AI 代理存在的问题,特别是引用准确性和工具使用方面。一位用户报告称,代理提供的所有六个引用都是不正确的。该期还触及了“工具成功”的概念,认为其结果不应仅限于简单的二元判断,需要对代理的功能进行更细致的评估。
-
AI编码代理:学习能力与规划困境的探讨
本文探讨了AI编码代理的能力,质疑它们是否能真正学习和适应。文章深入研究了这些代理面临的规划困境,将它们的“超能力”潜力与其当前局限性进行了对比。
-
前Qwen技术负责人林俊阳创立Pragmatik Labs,获2.2亿美元融资
阿里巴巴Qwen模型前技术负责人林俊阳在上海创立了Pragmatik Labs。该公司获得了2.2亿美元融资,由高榕资本和红杉中国领投,腾讯参投。Pragmatik Labs专注于开发数字和物理智能体,而非在基础模型领域竞争。
-
AI提示缓存失败通过重新排序消息上下文得到修复
一位开发者发现他们的多代理AI系统由于API调用中消息的顺序而未能从提示缓存中受益。提示缓存系统通常根据输入的某个前缀进行匹配,而将唯一的代理个性化信息放在共享文档上下文之前,导致每个代理的调用在第一个令牌处就出现分歧,从而阻止了缓存命中。解决方案是将消息重新排序,将大型、相同的上下文放在前面,然后是较小的、变化的个性化信息,这显著提高了缓存利用率并降低了成本。
-
AI代码生成仍需要人类工程师做出最终合并决策
AI生成的代码的开发过程仍然需要大量的人工监督,因为工程师必须在代码合并之前验证其可信度和质量。虽然AI代理可以快速生成代码甚至运行测试,但决定是否接受更改的关键在于高级工程师。这个人工审查过程包括检查需求满足情况、测试覆盖率、安全风险以及是否符合架构标准,这表明生成代码的成本很低,但确保其可靠性并将其集成到产品中仍然是一项昂贵的人工工作。
-
AI的真正影响:一种倒退的政治和经济上层建筑
当前围绕AI的讨论忽略了它作为一种上层建筑的奠基性作用,这种上层建筑以创新的名义将倒退的政治与不受约束的经济权力交织在一起。影响力的这种集中源于大量、通常无法追溯的金融投资,这些投资使一小群未经选举的个人能够对民众施加重大控制,凸显了数据政治的关键性。
-
移除特定文件后 AI 编码智能得到提升
Akihiko Shirai(又名 Hakase Shirai)发现,移除特定的 CLAUDE.md 和 AGENTS.md 文件显著提高了 AI 编码的智能水平。这一调整带来了 AI 编码能力的明显增强。这些文件确切的性质以及移除它们如何提升 AI 性能的机制在 Shirai 的文章中有详细说明。
-
AI代理评估模型存在偏见,夸大成功率
近期关于人工智能炒作周期的讨论正受到对评估方法更仔细审视的挑战。OSReward 项目强调,用于评判 AI 代理的奖励模型不仅嘈杂而且存在偏见,经常批准那些实际上未能完成任务的代理。这种宽容夸大了报告的成功率,引发了对 AI 代理开发真实进展以及当前基准是否准确衡量性能的质疑。
-
GitHub Copilot 推出“技能”以实现高级类似 Agent 的功能
GitHub Copilot 正在推出一项名为“技能”(Skills)的新功能,旨在弥合 Prompt、指令与 Agent 之间的差距。此功能允许开发者为 Copilot 定义可重用的能力,从而增强其执行复杂任务的能力。技能层充当了缺失的中间层,在开发环境中实现了更复杂的交互和类似 Agent 的行为。
-
人工智能轨迹质量而非规模是真正的瓶颈
人工智能正在失去热度的观点正受到一种新视角的挑战,该视角侧重于长时规划中的错误累积。与数据量或模型规模不同,轨迹的质量被确定为主要瓶颈。研究人员正在测试具有干净教师的on-policy agentic distillation作为解决此问题的潜在方案。
-
特朗普提议制定统一的联邦人工智能监管规则手册
唐纳德·特朗普提出了一种新的人工智能监管方法,旨在将现有的州级人工智能法律整合到一个单一的联邦框架中。这项倡议被定位为简化和标准化人工智能治理的举措,表明一个统一的规则手册可以取代目前各州存在的监管拼凑现象。
-
探索 LLM Agents 以实现可信的 AI 行为
本文讨论了 LLM Agents 和 AI 行为可信度差距,重点关注人工智能和生成式 AI 如何用于创建更可信的 Agent 行为。它强调了与 AssetStore 中的 Agents 和 Actions 相关的工具和概念。
-
Boffin框架提升AI编程Agent的软件设计能力
Boffin是一个旨在增强AI编程Agent的新框架,将其定位为强大的软件设计工具。该系统旨在为AI Agent的能力增加一层复杂性,超越AGENTS.md等简单工具。
-
面向非专业人士的AI、ML、LLM、RAG和Agents解释
本文用通俗易懂的语言解释了检索增强生成(RAG)和Agents等关键AI术语,旨在为普通受众阐明它们的实际应用。文章为每个概念提供了两种解释:一种面向非技术读者,另一种面向工程师。该指南还就这些技术的适当用例提供了建议。