PulseAugur
实时 05:22:03
实体 BioSecBench-Surveillance

BioSecBench-Surveillance

PulseAugur coverage of BioSecBench-Surveillance — every cluster mentioning BioSecBench-Surveillance across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_230725 ·

    xAI的Grok 4.6在生物安全评估中领先,表现优于同类模型

    xAI的Grok 4.6在LatchBio进行的生物安全评估中表现出卓越的性能。该模型在LatchBio的BioSecBench-Refusal套件上表现出色,显示出区分合法生物研究和危险请求的强大能力,同时在常规生物任务上保持高性能。尽管Grok 4.6在生物监测任务上的表现与其他前沿模型相当,但其对伪装的危险查询的拒绝率却显著更高。

  2. TOOL · CL_156301 ·

    新基准显示AI代理在病原体基因组监测方面存在困难

    一个新的基准BioSecBench-Surveillance已被开发出来,用于评估AI代理在病原体基因组监测中的可靠性。该基准包含100项评估,旨在测试AI代理是否能从原始测序数据和上下文信息中正确推断分析流程。对包括Opus 4.8、GPT-5.5、Opus 4.7和Sonnet 4.6在内的多个AI模型的初步测试表明,即使是表现最好的配置,准确率也仅在50%左右,这凸显了它们在就参考、阈值和过滤器做出关键选择方面的能力挑战。