SciFact
PulseAugur coverage of SciFact — every cluster mentioning SciFact across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新AI工作流增强写作中声明-证据的可追溯性
研究人员开发了一种名为证据账本裁决的新工作流,以提高AI代理所做声明与支持证据之间可追溯性。该系统将每个声明与证据包配对,分配支持关系,并将证据不足、被反驳或证据混合的声明路由回作者进行审查。在超过2300个声明的基准测试中,证据账本裁决系统与基线方法相比,在准确率和F1分数上均有显著提高,展示了其为AI辅助写作创建可审计层的潜力。
-
新协议增强了代理式LLM综合中的引用忠实性
一篇新的研究论文介绍了一个协议和一个保障系统,旨在提高代理式大型语言模型(LLM)系统中引用忠实性检查的可靠性。这些系统,如OpenScholar和PaperQA,综合科学文献并引用其来源,但目前验证这些引用的方法并不一致。所提出的协议和保障旨在使引用验证过程可衡量且有界,确保信息归因于其原始来源的准确性更高。
-
新的SIFT方法提高了LLM事实核查的准确性
研究人员开发了一种名为SIFT(声明条件式重评分)的新方法,以提高使用大型语言模型(LLM)的事实核查系统的准确性。这些系统经常错误地将声明标记为支持,即使提供的证据不能完全证明它们。SIFT通过针对完整声明重新评分提取的证据来解决这个问题,并与WSP(保证支持比例)配对,WSP是一种验证证据是否包含声明的NLI检查。在多个基准上的评估表明,SIFT显著恢复了准确性并提高了事实核查输出的可靠性。
-
小型语言模型在生物医学声明验证方面可媲美GPT-4o/GPT-5
一项新研究表明,使用QLoRA微调Mistral-7B等小型语言模型,在生物医学声明验证任务上的表现可与GPT-4o和GPT-5等大型模型相媲美甚至超越。研究强调,Mistral-7B仅用一小部分成本和训练数据,在F1分数上就超越GPT-4o高达12%。该研究还识别出SciFact数据集中存在一个结构性伪影,该伪影会人为地提高分数,这强调了结构健全的数据对于稳健的跨领域泛化的重要性。