实体
vérifier
vérifier
PulseAugur coverage of vérifier — every cluster mentioning vérifier across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新的多智能体框架通过冻结验证器增强视频推理能力
研究人员开发了一种新颖的多智能体强化学习框架,用于视频推理任务,例如基于文本的视频问答和时间定位。该方法将一个可训练的“定位器”与一个冻结的“验证器”相结合,以改进相关时间证据的选择。使用此方法训练的一个拥有20亿参数的模型在各种视频推理基准测试中展现了零样本迁移能力,在交并比和答案定位指标上取得了显著的准确性。
-
研究发现,随着模型改进,AI人工审查的有效性会下降
AI模型的人工审查过程,随着模型的改进,可能会适得其反地导致更多错误到达客户。随着模型错误率的降低,审查员会理性地将他们的检测阈值调高,导致他们捕获的剩余错误比例更小。这种现象意味着人工监督的有效性不是审查员的固定属性,而是审查员-模型对的一个特征,需要随着每次模型更新进行重新评估。
-
CPAgents框架增强心血管疾病关联研究
研究人员开发了CPAgents,一个用于心血管表型组关联研究(PheWAS)的新型框架。该系统使用三个协调的代理——分析师(Analyst)、提议者(Proposer)和验证者(Verifier)——从基础影像特征中自动构建和验证可解释的复合表型。在大型心脏影像队列上进行评估,CPAgents显著提高了疾病区分能力,在72种组合中有56种排名靠前,而基线方法为18种,并产生了紧凑、临床可解释的表型公式。