Harness Engineering
PulseAugur coverage of Harness Engineering — every cluster mentioning Harness Engineering across labs, papers, and developer communities, ranked by signal.
- used by Loop engineering of amadoriase II and mutational cooperativity 70%
- used by Context 70%
- instance of Loop engineering of amadoriase II and mutational cooperativity 70%
- other Loop engineering of amadoriase II and mutational cooperativity 60%
- affiliated with Loop engineering of amadoriase II and mutational cooperativity 60%
5 天有情绪数据
-
AI代理通过新的内存层设计获得持久性
本文详细介绍了内存层,这是AI代理的关键组成部分,它在单个模型调用之外提供了持久性。它区分了短期记忆(在单个任务中存储状态,如对话历史和中间结果)和长期记忆(跨会话保留有关用户、代码库或过去行为的信息)。内存层至关重要,因为底层的AI模型本身是无状态的,在没有明确的Harness Engineering的情况下不会保留记忆。
-
AI代理依赖受控环境进行安全执行
本系列文章“Harness Engineering”的这一部分,重点介绍了“环境”在AI代理执行中的关键作用。环境被定义为AI模型调用的工具运行的运行时,涵盖文件系统、Shell、网络访问和计算资源等方面。精心设计的环境对于控制AI代理的行为并防止意外后果至关重要,其关键特性包括有界性、可复现性和可检查性,以管理代理的操作范围并降低风险。
-
研究人员开发 Self-Harness,使 LLM 代理能够自主改进其自身系统
一篇新研究论文介绍了一种名为“Self-Harness”的方法,该方法允许基于 LLM 的代理自主改进其自身的运行 Harness。这个迭代过程包括识别模型特定的失败模式、生成 Harness 修改以及通过回归测试验证这些更改。当应用于各种模型和基准测试时,Self-Harness 持续提高了性能,为实现自改进的 AI 代理指明了方向。
-
Lilian Weng 探讨 AI 的递归自我改进潜力
Lilian Weng 发表了一篇探讨 AI 系统递归自我改进(RSI)概念的文章,重点关注“Harness Engineering”的作用。该方法旨在创建能够随着时间推移改进自身能力的 AI 系统,可能导致 AI 发展的加速。
-
Harness Engineering:构建生产级 AI Agent 的学科
Harness engineering 被视为构建生产级 AI Agent 的关键学科,强调围绕代码或“harness”构成了 Agent 架构的大部分,而非语言模型本身。这种观点将焦点从模型的能力(这些能力是租用的且可能随时变化)转移到可控且可拥有的 harness 上。该术语的起源追溯到现有的概念,如测试 harness、评估 harness 和强化学习环境,突出了一个共同的模式:一个小的核心组件被一个更大的、支持其功能的脚手架所包围。
-
AI工程演进:提示、循环和图控制层详解
提示工程、循环工程和图工程这些术语代表了AI系统中不同的控制层级,而非相互竞争的技术。提示工程专注于单个模型的响应,循环工程管理代理的行为周期,而图工程则协调多个代理。随着AI任务日益复杂和自动化,对这些更高级别控制层级的需求也在增加,提示工程即使在更复杂的系统中,仍然是基础要素。
-
AI Agent Harness:LLM任务执行的关键基础设施
AI Agent Harness 是围绕概率性大型语言模型(LLM)的确定性基础设施,使其能够与外部世界交互并执行任务。该Harness将LLM连接到API、数据库和代码执行环境等工具,同时提供内存、工作空间以及用于安全和策略执行的关键护栏。虽然强大的模型可以改进决策,但健壮的Harness控制着哪些决策可以产生后果,从而防止错误完成并确保可靠的任务执行。
-
AI“工程”术语如循环和图工程引发争议
“循环工程”和“图工程”等术语最近在AI讨论中受到关注,这在很大程度上归功于病毒式传播的社交媒体帖子。然而,一些人认为这些术语是对现有概念(如“提示工程”和“上下文工程”)的演变或重命名。虽然学科的快速重命名是幽默和评论的焦点,但也凸显了AI能力讨论和开发方式的真实(尽管被过度炒作)转变,即使对于那些没有巨额预算的人来说也是如此。
-
GitHub 的 "Harness Engineering" 项目讽刺了 AI 生成的流行语
GitHub 发布了一个新项目,名为 "Harness Engineering",被描述为一本工程术语集。该项目由 Ryan Lopopolo 创建,被定性为对流行语的讽刺性收集,这些流行语脱离现实,听起来令人印象深刻但缺乏实质内容。创作者认为,AI 可以用来生成此类内容,使其与胡言乱语无法区分。
-
AI工程趋势:Harness和评估先进系统
AI工程领域在Harness工程和评估方法方面正出现显著趋势。这些进展对于开发和完善人工智能系统至关重要。讨论强调了AI工程师使用的工具和技术的演变格局。
-
新研究应对LLM代理可审计性和多智能体安全风险
两篇新研究论文探讨了大语言模型(LLM)安全和企业应用的关键方面。第一篇论文介绍了一种“工具链工程”方法,通过确定性的代码、清单和验证工件来创建可审计的LLM代理,确保其来源可追溯和行为可控。第二篇论文提出了一种受控对比设计,以区分多智能体LLM系统中的安全风险,区分操作重构、规划器行为和委托框架,并发现重构是GPT、Gemini和DeepSeek等模型面临的重大风险,而Claude的抵抗力更强。
-
AI Agent:Loop 与 Harness Engineering 详解
本文区分了构建 AI Agent 的两个关键学科:Loop Engineering 和 Harness Engineering。Loop Engineering 涉及 Agent 重复尝试执行任务,如果管理不当可能导致无限循环。Harness Engineering 则相反,专注于为 Agent 的运行创建安全可控的环境,确保其在没有必要检查的情况下不会继续进行。作者指出,许多团队会混淆这两者,常常在实际需要 Harness 时应用 …
-
通过Claude自动化收件箱来解析AI概念
作者解释了如何通过使用Claude自动化收件箱,从而对几个现代AI概念有了实际的理解。通过使用Claude处理赞助邮件,作者对大型语言模型(LLMs)、代理(agents)、上下文工程(context engineering)、循环工程(loop engineering)、子代理(subagents)、约束工程(harness engineering)和人机协同系统(human-in-the-loop systems)有了深入的了解。…
-
Harness工程:确保AI系统的可靠性
本文介绍了Harness工程的概念,这是确保AI系统可靠性和稳定性的关键学科。它解释了Harness工程如何弥合实验性AI代理演示与能够持续运行的生产就绪系统之间的差距。重点在于构建支持AI代理应对各种操作挑战的强大基础设施。
-
AI工作流的演变显示成本增加和控制减少
AI工作流的演变正朝着更复杂、更难控制的阶段发展,从提示工程开始,逐步发展到上下文工程、约束工程和循环工程。这种进展意味着每次迭代的成本都在增加,人类的监督在减少,可能导致系统不透明和依赖未经审查的做法。
-
AI工程学演进:束带与循环概念涌现
文章讨论了AI工程学术语的演变,从提示工程和上下文工程超越,到2026年人类开发者提出的“束带工程”(harness engineering)和“循环工程”(loop engineering)。束带工程侧重于围绕大型语言模型的确定性运行时层,管理工具调用和执行;而循环工程则涉及设计自主代理循环。作者强调了人类监督和验证在AI开发中的重要性,并以RAPTOR和llloop等个人原型为例来说明这些概念。
-
循环工程成为热门AI技能,引发对其必要性的争论
“循环工程”的概念正成为人工智能领域的一个重要趋势,被一些人称为该领域最热门的技能。这种方法通过在问题空间中探索解决方案,其特点是迭代和潜在的蛮力方法。然而,也有讨论质疑这是否是AI行业真正需要的,一些人认为这代表着朝着更少的人类控制和更多的黑箱方法发展。
-
AI代理:提示词与框架工程在错误修复中的作用
本文区分了AI代理中的提示词工程和框架工程。提示词工程侧重于传达给模型的指令和示例,影响其推理。框架工程则涵盖了周围的系统,包括上下文、工具访问、输出处理和状态管理,充当代理的操作系统。作者认为,失败的表现形式常常相似,但根源在于不同的层面,而普遍的反应是错误地通过修复提示词来解决框架层面的问题。
-
AI Agent开发分化为提示工程、上下文工程和Harness工程
构建AI Agent的工作正超越简单的提示工程而演变。它现在包含三个不同的学科:提示工程用于塑造模型行为,上下文工程用于管理模型有限窗口内的信息,以及Harness工程用于构建周围的软件基础设施。混淆这些角色可能导致代价高昂的错误,例如只关注措辞而忽略数据准确性或安全协议。
-
分析发现AI准确性取决于上下文,而非仅仅是规范
根据一项新分析,AI代理准确性的前沿正从模型和提示转向上下文。仅仅向AI提供一份完善的规范会导致其重播过时信息,因为现实世界系统不可避免地会偏离其初始设计。真正的准确性是通过向AI提供这些漂移的原因来实现的,例如实现变更或操作例外,使其能够接近“今天的真相”。