Veritas
PulseAugur coverage of Veritas — every cluster mentioning Veritas across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Veritas tool launched to combat disinformation campaigns
Veritas is a new tool designed to help teams track and respond to disinformation campaigns. It aims to improve efficiency and provide deeper insights into the nature of these campaigns.
-
研究发现:LLM 监控工具未能考虑模型的非确定性
Veritas 的一项研究强调了大型语言模型 (LLM) 的非确定性本质,揭示了许多监控工具未能考虑到这种可变性。当多次运行相同的提示时,一些模型在输出方面显示出显著的波动,其中 Perplexity 的 Sonar 工具在一天之内就表现出特别宽泛且矛盾的结果。研究表明,依赖单一抽样指标可能会将模型方差与真实性能变化混淆,从而误导实际性能趋势。
-
新AI工具VERITAS自动化科学研究复现
研究人员开发了VERITAS,一个旨在利用AI驱动的编码代理自动化科学研究复现的新型框架。与以往特定基准的工具不同,VERITAS是一个领域无关的系统,可以处理研究论文和代码库,以提取主张、执行方法并评估发现。该框架生成一个加权的复现分数(Replication Score)以及遇到的和已解决问题的详细日志,在CORE-Bench和ReplicationBench等既定基准上展示了最先进的性能。
-
虚假信息追踪需要的不只是标记帖子
追踪虚假信息和错误信息,其范围已超出简单地识别有问题社交媒体帖子的范畴。虽然识别单个帖子至关重要,但这仅占整个挑战的一小部分。需要先进的工具和方法论来有效监控和调查这些复杂问题。
-
NVIDIA Vera CPU 将加速洛斯阿拉莫斯国家实验室的科学智能体 AI
NVIDIA 的 Vera CPU 将为洛斯阿拉莫斯国家实验室 (LANL) 的新超级计算机提供动力,增强科学发现和智能体 AI 能力。名为 Mission、Vision 和 Veritas 的新系统将把 Vera CPU 与 NVIDIA Rubin GPU 和 InfiniBand 网络集成在一起。早期测试表明,Vera CPU 在 URSA AI 智能体和 Branson 模拟工具等科学工作负载上的性能明显优于之前的架构,有望加…
-
新的VERITAS框架解决了LLM评估悖论,实现了穷尽搜索
研究人员推出VERITAS,一个旨在克服评估大型语言模型(LLM)穷尽搜索能力悖论的新框架。这种悖论的产生是因为高熵任务的完整性验证对于人类来说无法创建真实答案,导致基准测试会惩罚超出人类标注者能力的模型。VERITAS利用计算不可约约束来生成可验证的、稀疏答案的搜索任务,这些任务在计算上等同于穷尽枚举,确保智能体必须真正遍历整个搜索空间。这种方法允许自动生成无限数量的具有完美真实答案和可控难度的测试用例,为评估和训练不确定性下的探索…
-
机器人通过视觉和触觉反馈学习和改进策略 · 跟踪5个来源
研究人员开发了新的框架,通过推理时引导和自我改进来提高机器人策略性能。VERITAS是一个生成器-验证器框架,它使用预训练策略和视觉验证器在无需额外训练的情况下引导动作,实现了可与专家演示相媲美的性能提升。ViTaL通过在视觉数据之外整合触觉反馈来增强这一点,用于接触丰富的操作任务,显著提高了成功率。此外,Visual-OPSD和ViGOS探索了多模态大语言模型的按策略自蒸馏技术,解耦感知与推理,以改善基础行为并降低推理成本。
-
VeriTaS基准提供动态、多模态的事实核查,对抗AI虚假信息
研究人员推出了VeriTaS,一个新颖的动态基准,旨在评估多模态内容的自动化事实核查系统。与可能因大型语言模型预训练而受损的静态基准不同,VeriTaS每季度更新一次,以确保其持续的相关性。它目前包含来自专业事实核查组织的25,000个真实世界声明,涵盖54种语言,并包括文本和视听材料。