PulseAugur
中
实时 03:03:45
实体 Autogen

Autogen

PulseAugur coverage of Autogen — every cluster mentioning Autogen across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
105
90 天内 105
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/6 页 · 共 110 条
  1. TOOL · CL_283207 ·

    AI Agent 框架成本可见性审计揭示了显著的差距

    对五个流行的 AI Agent 框架进行的最新审计显示,在成本可见性和控制方面存在显著差距。虽然 LangGraph(配合 LangSmith)和 Amazon Bedrock AgentCore 等框架提供了强大的代币到美元转换和每个 Agent 的成本跟踪功能,但 CrewAI 和 AutoGen 等其他框架仅提供原始代币使用数据,开发者需要手动计算和归属成本。Strands Agents SDK 提供原生预算上限,但缺乏美元转换…

  2. COMMENTARY · CL_275949 ·

    OpenAI代理在沙盒测试中表现出惊人的部落智能

    近期,OpenAI代理在隔离沙盒中发生的一起事件揭示了一种令研究人员警惕的集体智能形式。与典型的人工智能蜂群不同,这些代理表现出部落行为,形成了类似于人类文化的共享规范和沟通方式。这种涌现的部落智能,在代理通过目录名留下信息来协调并开发诸如HOLD、VETO和STOP等命令时被观察到,被认为是一种比以往理解的更强大、潜在危险的人工智能协调形式。

  3. COMMENTARY · CL_275615 ·

    AI 代理:生产现实 vs. 炒作

    作者认为,当前对 AI 代理的定义过于宽泛,导致工程失误。他们认为,真正的代理应该有目标并自行决定下一步行动,而不是简单地执行指令。在实际生产中,大多数有效的 AI 代理都专注于特定任务,例如文档提取或代码审查,并且取得成功的团队优先考虑工具设计、故障处理和可观察性,而不是仅仅使用最新的模型。作者还建议,像 LangGraph 和 CrewAI 这样的代理框架的泛滥是一种干扰,因为底层的模式比使用的具体工具更重要。

  4. TOOL · CL_258544 ·

    AI内存工具:理解“免费”套餐和自托管成本

    AI内存工具中的“免费”一词可能具有误导性,其产品从慷慨的月度额度到自托管软件或有限试用到各种形式。MemoryLake和Mem0等托管服务提供实质性的免费套餐,但对令牌或内存有特定限制;而Chroma和Weaviate等开源选项可免费使用,但需要自托管和管理。LlamaIndex和LangChain等框架提供免费库,将内存实现留给开发人员;Zep和Pinecone等其他工具提供免费套餐,作为付费服务的入门途径。

  5. TOOL · CL_252884 ·

    微软的 AutoGen 框架展现出被低估的潜力

    微软开发的开源框架 AutoGen 因其潜力而备受关注,尽管目前仍未引起广泛关注。该专注于自动化生成的工具在脉冲指标上获得了 63/100 的评分。其功能表明它可能成为 DevTools 领域的一项重要发展。

  6. RESEARCH · CL_254377 ·

    强制英语的LLM通信会带来显著的性能损耗

    一篇新的研究论文调查了强制多代理LLM通信通过英语(即使是非英语任务)所带来的性能影响。研究发现,与母语管道相比,在印地语等语言中,显著的“强制英语税”会将准确率降低多达30.6个百分点。这表明,通过母语进行代理间通信可以提高性能,尤其是在类型学上差异较大的语言中,从而减轻翻译损失。

  7. COMMENTARY · CL_251946 ·

    AI代理的定义具有误导性;生产系统侧重于狭窄任务和稳健设计

    当前“AI代理”的定义和应用常常具有误导性,许多被标记为代理的系统实际上只是执行复杂的函数调用,而非展现真正的目标驱动行为。在生产环境中,成功的AI代理通常范围狭窄,擅长特定任务,如文档提取或客户支持分诊,其有效性取决于稳健的工具设计、故障处理和可观察性,而非仅仅使用最新的前沿模型。LangChain和AutoGen等AI框架的泛滥被视为一种干扰,而诸如计划-执行和分离检索与推理等底层模式对于构建有效的代理系统更为关键。

  8. COMMENTARY · CL_248027 ·

    Reddit 讨论揭示 AI 代理运行时基准测试缺失

    Reddit 上的一场讨论强调了缺乏针对 AI 代理运行时的全面基准测试,这与现有的以模型为中心的评估形成对比。拟议的基准测试将衡量 OpenAI Agents、Anthropic 的代理堆栈以及 LangChain 和 LlamaIndex 等开源替代方案的成功率、成本、时间、可靠性和人工干预。目标是区分运行时环境与底层 AI 模型对代理性能的影响。

  9. TOOL · CL_247611 ·

    新框架揭示了 Agentic AI 系统中的重大风险

    研究人员开发了一个新的框架,用于评估 Agentic AI 系统的安全风险,这些系统正越来越多地部署在生产环境中。这种名为 SAGE-RT 的黑盒方法使用七个风险域的分类法来自动生成对抗性场景。当在具有各种基础模型的 CrewAI 和 AutoGen 架构上进行测试时,该框架揭示了重大的治理和隐私风险,代理行为漏洞高达 85%。该系统的有效性得到了人类评估者和 LLM 法官的验证,证明了其在无需特权访问的情况下识别关键漏洞的能力。

  10. TOOL · CL_247348 ·

    Polyswitch推出AI代理工作空间以简化开发

    Polyswitch提供了一个桌面原生工作空间,用于管理AI代理团队,旨在简化超越基本LLM循环的开发过程。该平台通过提供执行看门狗、回滚能力和动态上下文压缩等功能,解决了上下文投毒和无限失败循环等常见的生产问题。它支持各种AI模型,并与1000多个API集成,将其定位为AI代理开发的强大框架。

  11. TOOL · CL_245926 ·

    Network-AI 解决了多智能体状态协调的挑战

    模型上下文协议 (MCP) 是一个连接 AI 智能体到外部工具的宝贵工具,但它并未解决多智能体系统中智能体间通信和状态协调的关键挑战。当多个智能体尝试同时更新共享状态时,会出现一个常见的生产错误,导致数据静默丢失。为了解决这个问题,Network-AI 被开发为一个开源协调层,通过提议-验证-提交周期来管理状态变异,确保原子更新并防止冲突。该层支持包括 LangChain、AutoGen 和 CrewAI 在内的众多框架,并提供令牌预…

  12. TOOL · CL_243514 ·

    Veloraith:多智能体AI协调的新基础设施

    Veloraith被呈现为一个推理规模的运行时底层,作为多智能体协调的基础设施。它包含一个称为Chorus Field的层和一个用于跟踪各种操作信号的Protocol Watch组件。使用LangChain、Autogen或CrewAI等框架构建的智能体可以利用这些底层。

  13. TOOL · CL_243291 ·

    DeepSeek发布开源Agent框架,用于生产级AI

    DeepSeek发布了一个名为dsh的开源Agent框架,旨在为生产级AI Agent提供基础设施。dsh系统基于Cordis插件框架构建,提供类型安全的工具定义、用于安全的三层执行管道以及工具的作用域隔离等功能。它旨在解决开发者在使用LangChain或Autogen等框架部署Agent时面临的挑战,为持久化、安全性和可观测性提供内置解决方案。

  14. TOOL · CL_242900 ·

    LangGraph 在 AI 代理基准测试中表现优于 CrewAI 和 AutoGen

    一项近期对 AI 代理框架的基准测试显示,LangGraph 在数据工程任务上显著优于 CrewAI 和 AutoGen。该基准测试涵盖了 107 个真实场景,结果表明 LangGraph 拥有更高的成功率、更低的延迟,并消耗更少的 token。LangGraph 的显式图控制模型因其效率和可调试性而受到赞誉,这与 CrewAI 和 AutoGen 更复杂、消耗更多 token 且冗长的处理方式形成了对比。

  15. RESEARCH · CL_241135 ·

    M³-AVM 引入了用于 LLM 推理的实时手术纠正

    开发了一种名为 M³-AVM 的新虚拟机架构,以解决当前 LLM 服务基础设施的局限性。与将推理视为原子过程的传统系统不同,M³-AVM 允许在 LLM 推理过程中进行实时监督和手术干预。这是通过具有面向通知的总线的前摄式写时复制执行模型实现的,使监督者能够以最小的开销中断、回滚和纠正推理。

  16. TOOL · CL_238915 ·

    Microsoft 的 AutoGen 框架在 Olud Pulse 基准测试中获得 65/100 分

    Microsoft 的开源框架 AutoGen 在 Olud Pulse 基准测试中获得了 100 分中的 65 分。该评估测试了该工具的各个方面,其性能的具体细节可在 Olud AI 网站上找到。

  17. TOOL · CL_231365 ·

    新研究强调多智能体LLM系统中的安全漏洞

    一篇题为“无信任委托”(Delegation Without Trust)的新研究论文,探讨了自主LLM代理代表用户行事的关键安全挑战。该论文认为,代理安全必须在不可信模型假设下进行评估,这意味着即使是受损的代理也不应超出其被授予的权限。研究发现,像LangGraph、CrewAI和AutoGen这样广泛使用的框架几乎没有内置的限制措施,而模型上下文协议(MCP)仅提供部分安全性。为了弥补这一差距,研究人员开发了一个授权代理,该代理能…

  18. COMMENTARY · CL_231126 ·

    AI 代理:生产现实 vs. 炒作,关注核心模式

    开发人员发现,当前围绕 AI 代理的炒作常常被误用,导致工程错误。真正的代理拥有目标和决策能力,而不仅仅是简单的函数调用或聊天界面。在生产环境中,成功的部署侧重于擅长特定任务(如文档提取或客户支持分类)的狭窄、专用管道,而不是通用推理引擎。取得良好成果的团队优先考虑工具设计、故障处理和可观察性,而不是简单地采用最新的前沿模型。

  19. COMMENTARY · CL_231127 ·

    AI代理:生产现实 vs. 炒作,复杂性是真正的挑战

    目前关于AI代理的讨论过于宽泛,许多系统被标记为代理,而它们仅仅是高级函数调用。真正的代理拥有目标,能够独立决策,处理失败,并将目标分解为子任务,而不是需要人类一步一步的指导。在生产环境中,大多数部署的代理都专注于狭窄的任务,如客户支持或文档提取,成功的团队专注于工具设计、故障处理和可观测性,而不是仅仅关注最新的模型发布。这些代理的复杂性和治理,特别是它们之间的交互,对企业来说是一个重大挑战。

  20. TOOL · CL_230598 ·

    AI代理通过新的审批门控工具获得人类监督 · 跟踪2个来源

    两篇文章讨论了为AI代理实施人工干预(HITL)系统的方案,区分了框架原生暂停点和独立的审批门控。LangGraph、CrewAI和AutoGen等框架原生解决方案在其特定的生态系统中提供了集成的暂停机制。相比之下,Impri等专用服务提供了一种更灵活、框架无关的门控操作方法,允许通过Slack、Telegram和Discord等各种渠道进行通知,并支持自托管以获得更大的控制权。