Tester
PulseAugur coverage of Tester — every cluster mentioning Tester across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI代理成本分析:工作负载决定模型选择
一位游戏工厂项目的作者发现,他们的一款AI代理“构建者”(Builder)尽管执行的生成任务很少,却产生了高昂的成本。该代理向一个顶级模型发送了大量(78万)token,但只收到了少量(5千)输出,这表明它主要用于输入处理而非复杂的生成。通过重新评估每个代理的工作负载,作者决定根据功能重新分配模型:创意任务保留了强大的模型,而主要执行确定性“管道”任务的代理则被转移到更便宜、更快的替代方案。构建者被转移到一个编码模型,测试者(Test…
-
AI集群利用自动化辩论达成共识
TormentNexus 通过实施自动化辩论和共识协议,为多智能体 AI 系统引入了一种新颖的方法。该系统为不同的智能体分配了诸如规划者、执行者、测试者和批评者等专业角色,确保分歧是有原则的,并源于固有的技术张力。当出现冲突时,会启动一个结构化的辩论协议,从断言和证据到反提案,最后到综合和投票,旨在无需人工干预即可解决复杂的技术分歧。
-
AI 代理“The Tester”自动化游戏开发中的视觉 QA
一款名为“The Tester”的新 QA 代理已被开发出来,用于自动化游戏开发流程中的视觉测试。该代理利用 Playwright 进行浏览器交互,并与支持视觉的 AI 模型(特别是 Haiku 和 Sonnet)集成,以评估超越传统功能检查的视觉保真度。The Tester 可以识别美学缺陷,例如不正确的背景颜色或视觉上不准确的主题,这些缺陷可能会被标准的断言方法所忽略,从而确保部署的游戏具有更高的质量。
-
AI代码测试循环得到改进,以提高验证准确性
研究人员开发了一种对抗性测试加固循环,旨在提高AI模型生成代码的验证准确性。该系统使用一个“测试器”模型编写初始测试,一个变异测试过程来识别残留的缺陷,以及一个“批评者”模型来生成专门针对这些缺陷的新测试。研究揭示了先前分析中的一个伪影,该伪影导致了夸大的跨谱系效应,并在后续实验中得到了纠正。改进后的过程在同谱系批评者回合中显示出显著的增量杀伤率,并在跨提供商配置中显示出有希望的试点差异,突显了线束设计在模型比较中的重要性。
-
TormentNexus 通过结构化辩论协议实现 AI 智能体共识自动化
TormentNexus 是一种旨在自动化多智能体 AI 系统之间共识建立的新协议。它通过实施结构化的辩论和共识机制,解决了可能阻碍开发的智能体分歧问题。该协议为规划者、执行者、测试者和批评者等智能体定义了不同的角色,每个角色都有可能导致冲突的具体目标。TormentNexus 将这些分歧形式化为多轮对话,旨在通过结构化的异议、反提案和加权投票来实现机器可读的共识。