PulseAugur
中
实时 10:51:41
实体 Veritas

Veritas

PulseAugur coverage of Veritas — every cluster mentioning Veritas across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
10
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 11 条
  1. TOOL · CL_245368 ·

    新的VERITAS协议增强了图学习中的隐私和安全性

    研究人员推出了一种名为VERITAS的新协议,旨在增强图学习系统的安全性和隐私性。VERITAS通过实施一种“信任但验证”机制,解决了本地私有图学习协议易受数据投毒攻击的漏洞。该协议对用户数据进行本地扰动,然后使用双边认证来识别和移除恶意节点,最终恢复效用并确保稳健的私有图学习。

  2. SIGNIFICANT · CL_231121 ·

    Anthropic AI 模型在蛋白质设计和金星测绘方面取得突破

    Anthropic 的 AI 模型在科学研究和优化方面展现了强大的能力。Claude Mythos 5.1 在设计蛋白质结合剂方面取得了 50% 的成功率,远高于通常 10-15% 的命中率,其中一些设计显示出十倍的结合亲和力。此外,Claude Fable 5.1 利用 NASA 的历史数据生成了更详细的金星高程图,Mythos 5.1 还优化了多个机器学习模型的 GPU 内核,可能将生物研究的计算成本降低 30-60%。

  3. SIGNIFICANT · CL_231122 ·

    Anthropic 发布 Claude Fable 5.1,性能登顶基准测试,价格更低 · 跟踪 1 个来源

    Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,在八项基准测试中均取得顶级性能,并将某些任务的价格降低了高达 45%。Fable 5.1 在多步推理和遵循风格提示方面有所改进,而 Mythos 5.1 在科学研究和编码方面取得了显著进展,包括蛋白质设计亲和力提高 10 倍,计算生物学任务速度提高 2.5 倍。此次发布还引入了一种新的反蒸馏机制,以防止操纵对话历史和上下文。

  4. TOOL · CL_178967 ·

    Veritas tool launched to combat disinformation campaigns

    Veritas is a new tool designed to help teams track and respond to disinformation campaigns. It aims to improve efficiency and provide deeper insights into the nature of these campaigns.

  5. TOOL · CL_166353 ·

    研究发现:LLM 监控工具未能考虑模型的非确定性

    Veritas 的一项研究强调了大型语言模型 (LLM) 的非确定性本质,揭示了许多监控工具未能考虑到这种可变性。当多次运行相同的提示时,一些模型在输出方面显示出显著的波动,其中 Perplexity 的 Sonar 工具在一天之内就表现出特别宽泛且矛盾的结果。研究表明,依赖单一抽样指标可能会将模型方差与真实性能变化混淆,从而误导实际性能趋势。

  6. TOOL · CL_128678 ·

    新AI工具VERITAS自动化科学研究复现

    研究人员开发了VERITAS,一个旨在利用AI驱动的编码代理自动化科学研究复现的新型框架。与以往特定基准的工具不同,VERITAS是一个领域无关的系统,可以处理研究论文和代码库,以提取主张、执行方法并评估发现。该框架生成一个加权的复现分数(Replication Score)以及遇到的和已解决问题的详细日志,在CORE-Bench和ReplicationBench等既定基准上展示了最先进的性能。

  7. COMMENTARY · CL_116598 ·

    虚假信息追踪需要的不只是标记帖子

    追踪虚假信息和错误信息,其范围已超出简单地识别有问题社交媒体帖子的范畴。虽然识别单个帖子至关重要,但这仅占整个挑战的一小部分。需要先进的工具和方法论来有效监控和调查这些复杂问题。

  8. RESEARCH · CL_103787 ·

    NVIDIA Vera CPU 将加速洛斯阿拉莫斯国家实验室的科学智能体 AI

    NVIDIA 的 Vera CPU 将为洛斯阿拉莫斯国家实验室 (LANL) 的新超级计算机提供动力,增强科学发现和智能体 AI 能力。名为 Mission、Vision 和 Veritas 的新系统将把 Vera CPU 与 NVIDIA Rubin GPU 和 InfiniBand 网络集成在一起。早期测试表明,Vera CPU 在 URSA AI 智能体和 Branson 模拟工具等科学工作负载上的性能明显优于之前的架构,有望加…

  9. TOOL · CL_105010 ·

    新的VERITAS框架解决了LLM评估悖论,实现了穷尽搜索

    研究人员推出VERITAS,一个旨在克服评估大型语言模型(LLM)穷尽搜索能力悖论的新框架。这种悖论的产生是因为高熵任务的完整性验证对于人类来说无法创建真实答案,导致基准测试会惩罚超出人类标注者能力的模型。VERITAS利用计算不可约约束来生成可验证的、稀疏答案的搜索任务,这些任务在计算上等同于穷尽枚举,确保智能体必须真正遍历整个搜索空间。这种方法允许自动生成无限数量的具有完美真实答案和可控难度的测试用例,为评估和训练不确定性下的探索…

  10. RESEARCH · CL_93240 ·

    机器人通过视觉和触觉反馈学习和改进策略 · 跟踪5个来源

    研究人员开发了新的框架,通过推理时引导和自我改进来提高机器人策略性能。VERITAS是一个生成器-验证器框架,它使用预训练策略和视觉验证器在无需额外训练的情况下引导动作,实现了可与专家演示相媲美的性能提升。ViTaL通过在视觉数据之外整合触觉反馈来增强这一点,用于接触丰富的操作任务,显著提高了成功率。此外,Visual-OPSD和ViGOS探索了多模态大语言模型的按策略自蒸馏技术,解耦感知与推理,以改善基础行为并降低推理成本。

  11. RESEARCH · CL_11798 ·

    VeriTaS基准提供动态、多模态的事实核查,对抗AI虚假信息

    研究人员推出了VeriTaS,一个新颖的动态基准,旨在评估多模态内容的自动化事实核查系统。与可能因大型语言模型预训练而受损的静态基准不同,VeriTaS每季度更新一次,以确保其持续的相关性。它目前包含来自专业事实核查组织的25,000个真实世界声明,涵盖54种语言,并包括文本和视听材料。