SQuAD2.0
PulseAugur coverage of SQuAD2.0 — every cluster mentioning SQuAD2.0 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究探讨大型语言模型检测无法回答问题的能力
研究人员开发了一种方法来检测大型语言模型(LLM)何时在回答它们无法真正回答的问题,或在对话中过早回应。他们创建了一个新的基准和评估工具,以在六个数据集和六个开源LLM上测试此能力。研究结果表明,无法回答问题的信号在相似数据集之间转移良好,例如涉及数学问题或文本段落中信息缺失的情况,但在转移到其他类型的无法回答问题(如认识论上的“已知未知”)时效果不佳。虽然经过校准的探测器可以在不进行模型微调的情况下准确识别欠指定的回合,但其在最终任…
-
新研究解决LLM量化鲁棒性和不确定性保持问题
两篇新研究论文探讨了在保持其性能和不确定性行为的同时,改进大型语言模型(LLMs)量化的方法。第一篇论文《Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models》提出了一种训练策略,将高斯噪声注入预注意力logit中,其方差由雅可比矩阵弗罗贝尼乌斯范数确定,在图像和文本基准测试中显示出显著的收益。第二篇论文《Target-…
-
新框架优化LLM在抽取式问答中的使用
研究人员开发了一个学习延迟(Learning-to-Defer)框架,以提高使用大型语言模型(LLM)进行抽取式问答(EQA)的效率。该方法智能地将查询分配给专用模型,确保高置信度的预测,同时最大限度地降低计算成本。该框架在SQuADv1和TriviaQA等数据集上进行了测试,证明了其提高了答案的可靠性并显著降低了计算开销,使其适用于可扩展的EQA部署。