PulseAugur
实时 04:06:39
实体 run_id

run_id

PulseAugur coverage of run_id — every cluster mentioning run_id across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_250587 ·

    LLM工具调用通过执行收据进行调试

    本文提出了一种通过将每次调用视为带有执行收据的事务来调试大型语言模型(LLM)工具调用的系统。该收据存储在工具适配器中,包含运行ID、工具名称、状态、开始时间、持续时间和输出摘要等最少数据,而不是完整的日志或提示。这种方法旨在提高可追溯性和调试能力,同时不增加成本或噪音,特别是对于需要幂等性以防止重复的操作。

  2. TOOL · CL_207031 ·

    AI 代理:可靠的工具使用和恢复检查点

    本文讨论了一种提高与外部工具交互或需要人工批准的 AI 代理可靠性的技术。作者建议在涉及外部依赖或长时间等待的步骤之前使用简短、集中的检查点。这些检查点应包含最少但足够的信息,例如运行 ID、步骤 ID、目标、标准化输入以及继续执行的确切条件,以及任何产生的证据的位置。这种方法旨在使代理运行更容易暂停和恢复,防止因上下文过时或重复使用工具而引起的问题,并使故障更具局部性和可管理性。

  3. COMMENTARY · CL_190431 ·

    LLM代理:执行前冻结计划以提高可靠性

    作者提出了一种通过在执行前冻结计划来提高LLM代理可靠性的方法。该方法解决了LLM代理已批准的计划与实际执行的计划不同的常见问题,从而导致审计和运营信任问题。提出的解决方案涉及将过程分为三个不同的层:规划、人工批准和执行,其中一个冻结的工件充当后两层之间的边界。建议使用诸如`run_id`、`plan_hash`和`expires_at`之类的关键元数据字段来确保批准和执行步骤的完整性。

  4. TOOL · CL_182689 ·

    LLM邮件审批需要清晰的合同来维持上下文

    本文讨论了LLM驱动的自动化中一个常见的问题,即人工邮件审批会丢失关键上下文,导致执行中的歧义。作者提出了一个用于邮件审批的“最小合同”,包括诸如`run_id`、`plan_hash`、`decision_scope`、`reply_token`和`expires_at`之类的标识符。该合同旨在通过提供稳定、可识别的信息而不是完整的上下文,将人工决策与自动化执行解耦,从而提高可追溯性并减少错误。

  5. TOOL · CL_153119 ·

    LLM代理需要明确的收件箱合同以提高可追溯性

    本文讨论了为LLM代理定义明确的“收件箱合同”以提高可追溯性和降低运营成本的重要性。作者提出,系统的可靠性不仅限于提示和工具调用,还应涵盖每次运行生成的证据。明确定义的收件箱合同,包括run_id、scenario_key、recipient_alias、expected_template、assertion_window和evidence_retention等字段,有助于防止罕见故障并统一团队术语。这种结构化方法确保每次测试运行都有…

  6. TOOL · CL_138328 ·

    LLM邮件审批需要强大的架构来防止漂移 · 跟踪4个来源

    自动化工作流中LLM生成的邮件的核心问题不在于模型本身,而在于审批流程,如果管理不当,可能导致消息漂移。为防止这种情况,需要一个强大的架构,将审批视为正式合同,确保内容一旦被批准,就会被快照并保持不变。这种方法将草稿生成与最终交付分开,使用诸如`run_id`和`policy_version`之类的唯一标识符来保持可追溯性并防止重试更改已批准的消息。这种纪律对于审计、调试和确保一致性至关重要,尤其是在使用临时电子邮件服务进行测试时。