Verdict
PulseAugur coverage of Verdict — every cluster mentioning Verdict across labs, papers, and developer communities, ranked by signal.
-
AI系统VERDICT和TrialGPT 2.0推进临床试验匹配
两篇新研究论文探讨了AI在临床试验匹配中的应用,解决了患者招募和决策问责方面的挑战。第一篇论文介绍了VERDICT,一个神经符号代理,它使用可满足性模理论(SMT)来确保一致的策略应用和可问责的决策制定,其表现优于现有的仅限LLM和神经符号基线。第二篇论文提出了TrialGPT 2.0,一个在多个肿瘤学环境中进行评估的AI辅助系统,该系统将临床医生效率提高了55%,并为90.9%的患者识别了额外的试验机会,同时还引入了一个新的数据集N…
-
Verdict 工具通过沙盒化简化 AI 编码代理测试
一个名为 verdict 的新工具已被开发出来,以提高编码代理在测试期间的效率和安全性。Verdict 用一个提供结构化 JSON 反馈的沙盒化环境取代了传统的基于 shell 的 pytest 执行,从而减少了 token 浪费并消除了安全风险。它还引入了故障指纹和历史上下文,以帮助代理区分预先存在的问题和新的回归。
-
AI代理陷入幻觉循环,浪费470次生成
一家运行多个AI代理的公司发现了一个重大问题,其中一个审稿代理因幻觉要求而反复拒绝制片人代理的工作。这是因为审稿代理没有收到原始请求,导致它编造了“仅输出3行”等标准,这与制片人代理至少600个字符的合同相冲突。该系统的重试机制未能打破循环,导致约470次AI生成被浪费。该公司此后实施了修复措施,包括将原始请求传递给审稿员、声明文档截断以及在连续失败一定次数后增加人工审查。
-
VERDICT系统提升化学结构识别准确性
研究人员开发了一个名为VERDICT的新系统,提高了光学化学结构识别(OCSR)的准确性。VERDICT利用多个识别器之间的一致性,其性能优于像素空间验证方法。这种方法对于通过可靠地识别和验证化学结构来从科学文献中构建大规模化学训练数据集至关重要。
-
新基准和方法增强多模态AI推理和可信度 · 跟踪4个来源
研究人员正在开发新方法来提高多模态大语言模型(MLLMs)的可靠性和可信度。一种方法VERDICT利用多个验证器之间的分歧来识别推理步骤中的错误,而无需额外的训练数据。另一种方法AD2-Bench引入了一个分层诊断框架,以查明证据获取中的失败,区分空间歧义和语义不确定性。此外,StructReward提供了一个高效的框架,通过提供结构化的、步骤级别的奖励来实现多模态推理的自我纠正,降低了强化学习的计算开销。最后,MMArch提供了一个…