Omar Sanseviero
PulseAugur coverage of Omar Sanseviero — every cluster mentioning Omar Sanseviero across labs, papers, and developer communities, ranked by signal.
13 天有情绪数据
Omar Sanseviero to release open-source agent framework emphasizing HTML artifacts
Given Omar Sanseviero's recent emphasis on the growing importance of HTML artifacts in AI agent workflows and his demonstration of an agent skill that leverages them for YouTube video analysis, it's plausible he will release an open-source framework that prioritizes these artifacts for user interaction and data organization. This would provide a concrete tool for others to adopt his approach.
Agent conversation protocols to see early adoption in multi-agent research settings
Omar Sanseviero predicts a rapid rise in the importance of Multi-Agent Conversation Protocols (MCP). This suggests that research groups and developers working on complex multi-agent systems will likely prioritize the integration and standardization of these protocols in the near future to improve coordination and performance.
Omar Sanseviero's work consistently links agent capabilities with user-facing outputs
Omar Sanseviero's recent contributions highlight a pattern of connecting advanced AI agent functionalities (like scaling laws for harnesses, conversation protocols) with tangible, user-friendly outputs (HTML artifacts, organized notes from videos). This suggests a strategic focus on making complex AI systems more accessible and practical for end-users.
-
HF 研究员推荐 /eli5 代理技能用于技术概念可视化
HF 研究员 Omar Sanseviero 推荐使用 /eli5 代理技能来可视化复杂的技术概念。他认为该技能可以增强与 AI 代理的协作并加速思考过程。Sanseviero 鼓励用户在 academy.dair.ai 平台上尝试将 /eli5 与 Raspberry Pi 和 Ox Alpha 一起使用。
-
Google 的 EnvHarness 和 EnvRigger 增强了 AI 智能体训练环境
Google 研究人员开发了 EnvHarness 和 EnvRigger 来解决 AI 智能体静态训练环境的问题。EnvHarness 允许在不改变核心逻辑的情况下动态重塑现有环境,并通过原始验证器确保安全性。EnvRigger 分析智能体执行轨迹以识别弱点,并合成目标性的约束组件,然后通过新的回滚进行验证。这种方法取得了显著的改进,在四个领域的五个基准测试中,在未见过的实例上性能提高了高达 9.0 分,执行步骤减少了 9.8%。
-
Dots3-Note Preview:专为长任务设计的开放权重模型发布
Omar Sanseviero 推出了 Dots3-Note Preview,这是一个专为持续数小时或数天的扩展任务设计的开放权重模型。该模型拥有 2800 亿个总参数和 160 亿个活动参数,512K 上下文窗口,并具备文本、视觉和语音能力。值得注意的是,Dots3-Note Preview 包含一个机制,可以在长任务运行期间自我评估其进度。
-
Microsoft的Agent Lightning v1.0提升了Qwen3.5-9B在SWE-bench上的表现
微软开发了Agent Lightning v1.0,这是一个连接强化学习以进行智能体训练的系统。这项新工作利用了一个端点代理来集成任何连接器,使训练器能够与环境循环进行交互。通过使用这种方法,并辅以适度的计算资源和6,000个训练示例,微软成功地将Qwen3.5-9B在SWE-bench Verified基准测试上的性能从41.8%提高到了56.4%。
-
ClawGym II 框架通过异构组合器增强 AI 代理训练
一篇新论文介绍了一个名为 ClawGym II 的框架,该框架旨在通过利用 OpenClaw 和 Claude Code 等现有工具来训练 AI 代理。该系统捕获与这些工具的交互,并将它们组织成前缀树,以使用近端策略优化 (PPO) 和 GRPO 来优化模型。研究表明,使用 OpenClaw 可使 Qwen3-30A3B 模型的 Pass@1 分数提高 9.98 分,使用 Claude Code 可提高 14.81 分。此外,该研究还…
-
Omar Sanseviero 分享 Codex 中协调代理的技巧
Omar Sanseviero 在 X 上分享了一篇推荐阅读,提供了关于在 Codex 框架内协调和编排多个代理的宝贵见解。该帖子强调了管理复杂代理交互的实用技巧。
-
Anthropic 研究探索 AI 代理系统中的“心智病毒”
Anthropic 发布了关于“心智病毒”的研究,这些病毒是在多代理 AI 系统中传播的观念。即使在代理的上下文被重置后,这些病毒也能传播,共享的工作成果充当了载体。研究发现,这些观念的传播受到宿主模型、现有指令、有效载荷的感知有害性以及网络拓扑结构的影响。虽然有害的有效载荷不太可能传播,但它们仍然可能成功,尽管系统提示中的简单警告可以提供显著的免疫力。
-
新的DataSpace基准测试揭示代理线束选择显著影响数据检索准确性
一项名为DataSpace的新基准测试已发布,旨在评估数据代理从不同工作空间生成可验证表格结果的能力。该基准测试包含410个跨语言任务,涉及超过7,439个文件,总计15.01 GB,格式包括CSV、JSON、SQLite、Markdown、PDF和视频。对前沿多模态模型和代理线束的初步测试表明,线束的选择对准确性有显著影响,最佳性能达到66.34%,更换线束会导致15.36个百分点的差异。
-
研究发现,代理框架和提示设计会严重影响AI代理的成本
一项新的基准测试显示,代理框架的选择和提示措辞对AI代理的成本和性能有显著影响。将相同的模型、任务和提示在不同的代理框架之间移动,每次成功的成本可能相差5到30倍。具体来说,鼓励模型开发和比较多种方法的提示,或通用的“深入思考”提示,会大大增加令牌使用量,但并不能提高正确性。然而,一种有界效率模板被证明是成本中性的,有时甚至将推理成本减半。
-
新论文对AI代理的失败模式进行分类并实现自动化跟踪
一篇新论文引入了一个框架,根据模型、框架和用户等组件交互中的起源,对41种代理失败模式进行分类。这种方法将错误归因于组件之间的“缝隙”,特别是模型与其脚手架之间,这与代理问题在实践中如何显现相符。该论文还表明,这种分类模式可以实现自动化,在应用于生产跟踪时,与人类标签的Cohen's kappa值为0.76,从而能够持续监控代理性能。
-
Anthropic 的 Claude Opus 5 生成了具有缩放功能的 ThreeJS 应用
一位用户分享了 Anthropic 的 Claude Opus 5 模型的一个演示,展示了其生成 ThreeJS 应用程序的能力。该应用程序旨在模拟从叶子开始,一直到叶绿素分子中的镁原子,跨越九个数量级的连续缩放。然而,用户指出缩放效果存在一些连续性问题。
-
NVIDIA 发布用于 AI 代理的 NOOA 框架,采用 Python 对象
NVIDIA 推出了 NOOA,一个用于构建 AI 代理的新框架,它将 Python 对象作为核心抽象。这种方法旨在将通常分散在提示模板、工具模式和工作流图中的代理开发整合到一个单一的约定中。通过将代理视为 Python 对象,其方法可以代表动作,字段可以存储状态,文档字符串可以充当提示,类型注解可以充当契约。这种集成允许确定性的 Python 代码与概率性的 LLM 补全并行,使代理行为更具可测试性和可重构性。
-
Moonshot AI 发布 2.8T Kimi K3 权重,规模空前但难以运行
Moonshot AI 已发布其 Kimi K3 模型的全部 2.8 万亿参数权重,使其成为迄今为止最大的开放权重模型。尽管规模庞大且已公开发布,但由于其极高的显存需求(估计超过 1.6TB),在消费级硬件上运行 Kimi K3 实际上是不可能的。此次发布凸显了开放权重运动中的一种紧张关系,即由于部署所需的大量基础设施,模型的商品化可能并不等同于人工智能能力的真正民主化。
-
Omar Sanseviero 推出代理编排器的动态工作流
Omar Sanseviero 为其代理编排器开发了一个强大的“动态工作流”功能,该功能泛化了 Harness、自动化、循环、路由和图等概念。这种元 Harness 方法允许灵活地将任务路由到各种代理后端,包括 Claude、Codex 和 Hermes,从而实现诸如 LLM 委员会、顾问-执行器工作流和通信代理团队等复杂用例。Sanseviero 从 Claude Code 团队的类似功能中获得灵感,并认为这种方法在人工智能开发中将…
-
增强了多模态输入的AI代理可减少纠错循环
Omar Sanseviero讨论了如何通过为AI代理添加更多模态来增强其理解能力并减少纠错循环。他引入了“任务”的概念,该概念将语音笔记、屏幕上下文和文本等各种输入捆绑在一起,使代理能够更有效地重建用户意图并处理更大的工作分配。
-
Omar Sanseviero 展示了多模态代理编排器功能
Omar Sanseviero 强调了一项新功能,该功能允许将文本、屏幕截图、音频、视频和注释等多种模态输入集成到代理编排器中。他之前为自己的编排器开发了一个类似的系统,并强调了其作为可重用技能的功能。
-
AI的进步可能会让年轻研究人员感到沮丧,但也提供了新的机会
一位研究人员表示担心,AI的进步可能会让年轻研究人员对自己的工作感到迷茫和无助。然而,他们反驳说,AI提供了无限的机会,作为一种强大的工具,通过实现并行探索、提出独特问题和改进发现的沟通来增强研究。研究人员鼓励利用AI来加深理解和加速科学进步,并建议现在是适应和将这些工具整合到研究过程中的绝佳时机。
-
AI研究中心推出论文集和AI导师
Omar Sanseviero 在 academy.dair.ai 的“资源中心”下推出了新的“本周AI论文集”。该论文集旨在方便访问重要的AI研究论文。此外,还提供了一个新的AI导师功能,可以根据用户的兴趣或学习主题推荐论文。该平台计划每周更新论文集,并推出更多用于阅读和注释论文的工具。
-
Omar Sanseviero 推出 X AI 新闻策展技能
Omar Sanseviero 为 AI 代理开发了一项新技能,该技能可以从专注于 AI 新闻、论文和项目的 X(前身为 Twitter)账户中精选高信号内容。该工具使用 X MCP 构建,允许用户通过连接其 X API 并指定所需的 AI 模型(如 Codex、Claude 或 Hermes)来生成个性化的 HTML feed。Sanseviero 提供了一个 GitHub 存储库供该技能使用,并提供了一个指向他自己策展的 feed…
-
AI新闻策展神器利用X MCP工具实现个性化信息流
Omar Sanseviero开发了一个新的HTML神器,该神器利用X的MCP工具从高信号X账户精选AI新闻。该神器由研究代理每日更新,这些代理从选定的X账户捕获AI论文和项目。Sanseviero认为,这个精选的信息流非常接近理想的“为你推荐”体验,并愿意分享该神器和自动化说明。