PulseAugur
实时 16:59:34
English(EN) I built an AI dev harness that isn't allowed to trust itself

AI 开发工具优先考虑可验证证据而非速度

作者花了四个月时间开发了一个 AI 开发工具,用于构建可发货的产品,强调对代理生成的工作进行可验证的证据和人工监督。该系统采用五角色循环(策略、执行、批评、评估、运维),使用更强大的模型来执行判断角色,使用更便宜的模型来执行任务,所有这些都由人类操作员指导的编排层进行管理。一个关键特性是冷启动的独立批评者门控,它在没有先前上下文的情况下审查工作,确保在执行不可逆操作(如提交到 Git)之前进行客观评估,而这些操作始终需要明确的人工批准。 AI

影响 这种方法通过关注可验证的输出和人工干预的控制,为构建可靠的 AI 驱动开发工具提供了一个框架。

排序理由 该项目描述了一个定制构建的 AI 开发工具和方法论,而不是一个通用的行业发布或研究论文。

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

AI 开发工具优先考虑可验证证据而非速度

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · Erik Hill ·

    我构建了一个不允许自我信任的AI开发工具

    <blockquote> <p>Scope note (read first): this describes a system I built and operate to develop an <strong>unannounced game</strong>. The game's identity, mechanics, and assets are withheld, and so are the harness's tuned prompts, gate implementations, and internal failure specif…