实体
execution
execution
PulseAugur coverage of execution — every cluster mentioning execution across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
AI 开发工具优先考虑可验证证据而非速度
作者花了四个月时间开发了一个 AI 开发工具,用于构建可发货的产品,强调对代理生成的工作进行可验证的证据和人工监督。该系统采用五角色循环(策略、执行、批评、评估、运维),使用更强大的模型来执行判断角色,使用更便宜的模型来执行任务,所有这些都由人类操作员指导的编排层进行管理。一个关键特性是冷启动的独立批评者门控,它在没有先前上下文的情况下审查工作,确保在执行不可逆操作(如提交到 Git)之前进行客观评估,而这些操作始终需要明确的人工批准。
-
LLM 代理需要安全的代码沙箱和高效的令牌管理
第一篇文章讨论了在代理系统中对大型语言模型 (LLM) 执行的代码进行沙箱处理的关键需求。它强调了运行 LLM 生成的代码的风险,这些代码可能存在缺陷或恶意,并探讨了沙箱作为代码执行安全隔离环境的概念。第二篇文章侧重于 LLM 代理中的令牌优化,认为对于处理多项任务的代理来说,有效地管理上下文窗口正变得与模型选择或提示质量同等重要。