Agent Determinism Illusions
PulseAugur coverage of Agent Determinism Illusions — every cluster mentioning Agent Determinism Illusions across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
AI harness design: Gates over orchestrators, memo argues
一份工程备忘录提出,AI系统Harness应作为“门”(gate)而非“协调器”(orchestrator),优先考虑停止、拒绝和销毁机制,而非持续完成。该备忘录详细介绍了使用代理任务和GLM-5.2模型,将“门”方法与“协调器”稻草人方法进行比较的实验。结果表明,“门”方法显著减少了错误接受和延迟接受,但引入了可衡量的错误拒绝率。
-
AI验证成本:Probe vs. Prose和绑定映射的探讨
本文深入探讨了“验证器共享您的文本通道”的概念及其对AI系统的影响,特别是在代理确定性和数据处理方面。它引入了“绑定映射”的概念,其中规则由检测器强制执行或明确标记为未绑定,旨在使执行差距可见。作者还探讨了“probe vs. prose”的区别,认为以可执行探针形式编写的条件比以自然语言形式编写的条件更不容易“腐烂”,因为探针是主动运行而不是被动阅读的。
-
Key-space C3系统存在缺陷;提出Bloom过滤器修复方案
一篇技术文章探讨了Key-space C3系统的局限性,该系统是一个旨在管理代理操作中参照可玩性的Bloom过滤器。实验显示,当代理选择一个看似合理但错误的密钥时,C3会错误地通过50%的错误密钥解析。使用DeepSeek-V4 Flash模型进行的进一步测试表明,在解析模糊需求方面的准确率仅为17%。文章提出通过修改C3来验证整个密钥空间而非单个密钥,确保在写入操作后检查所有相关密钥,从而进行修复。
-
拜占庭权威挑战通过见证层和多数表决算法解决
这篇技术文章探讨了分布式系统中拜占庭权威的挑战,其中受损的权威可以向不同观察者呈现冲突的历史。作者提出了一种解决方案,涉及一个具有三个关键属性的见证层:明确的故障边界、受管制的成员资格和见证一致性。这种方法旨在使冲突的观点能够被外部检测到,而不是私下相信,从而解决了密封历史和简单多数表决系统的局限性。
-
AI探测-检测规避测试揭示C3系统漏洞
本文详细介绍了对名为C3的系统的测试,该系统旨在检测AI模型中的探测-检测规避。虽然C3在之前的测试中成功识别了词汇操纵,但这项新研究探讨了一种不同的威胁模型:生产者在只有预言机观察时重写实现以隐藏副作用。测试表明,C3会被这种重写攻击所欺骗,在5种场景中有5种未能检测出来。一个更强的预言机PROD能够检测到5种攻击中的4种,突显了C3当前针对运行时操纵的防御措施的局限性。
-
AI代理验证超越言语,转向代码执行
本文详细介绍了一项实验,该实验测试了用于验证AI代理声明的“第三谓词”,超越了简单的词汇匹配。测试涉及五个场景、三名评估者,并侧重于缓存条目的写入无效化。核心论点是,文本中未明确显现的偏差对于基于词汇的检查(如正则表达式或阅读证据的LLM)是不可见的,只能通过执行代码并观察实际副作用的论证空间检查来捕获,使其能够免疫基于同义词的规避。
-
LLM 验证转向 SkillGate 的确定性文件系统检查
一位名叫 René Zander 的开发者提出了一种 LLM 验证系统的替代设计,将 LLM 裁判的评估方式转变为对文件系统的确定性检查。这种方法在名为 SkillGate 的工具中实现,侧重于验证证据的存在而不是解释模型输出。SkillGate 使用一组在文件系统上运行的纯函数来确保任务完成,从而防止 LLM 默默地通过不正确的输出。
-
大语言模型研究解决智能体确定性和预算限制问题
一篇新的技术论文探讨了大语言模型(LLM)系统中智能体确定性和预算限制所面临的挑战。研究强调,当真实正例的数量超过系统的处理预算时,物品的顺序比具体的触发器定义更为关键。使用 qwen3-0.5b 和 gemma3 等模型的实验表明,当前的单判决输出不足以提供足够的“漏判质量”以使基于位移的触发器生效。该论文还研究了排序机制是否能在升级流中提高性能,发现在特定压力条件下,一个名为 R_hist 的排序器显示出潜力,尽管其有效性仅限于测…
-
新分析挑战AI模型审核升级方法
一项最新分析对使用投票偏差作为将AI模型决策升级到人工审核的主要信号的有效性提出了质疑。作者援引Alexey Spinov的评论,认为该方法错误地将模糊的案例路由,同时允许自信错误的决策自动通过。实验使用了DF v2数据集和qwen3:0.5b等模型来测试替代的升级策略,包括确定性触发器和反向置信度度量,初步结果表明支持这些替代方法。