SciBERT: A Pretrained Language Model for Scientific Text
PulseAugur coverage of SciBERT: A Pretrained Language Model for Scientific Text — every cluster mentioning SciBERT: A Pretrained Language Model for Scientific Text across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
LLM 在引文功能分类方面得到评估,达到新的 SOTA
一篇新的研究论文评估了几个大型语言模型(LLM)在引文功能分类任务上的表现,旨在改进文献计量分析。该研究使用微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最先进(SOTA)结果,宏 F1 分数达到 73.3%。研究人员还引入了 AC3,这是一个具有七类别标注方案的新型数据集,用于区分引文类型,并探讨了上下文提取变体对分类性能的影响。
-
新研究评估无监督学术合作推荐方法
研究人员评估了基于出版物文本的无监督学术合作推荐方法。该研究比较了 TF-IDF、基于主题的模型(LDA、BERTopic)以及使用 SciBERT 和 Faiss 的基于嵌入的检索。结果表明,即使在出版物重叠减少的情况下,基于主题和基于嵌入的方法也能保持稳定的性能,这表明它们捕捉到了比直接词汇匹配更广泛的相似性。该论文还通过内在的主题模型和事后检索模型探索了可解释性,提供了互补的见解。
-
新的S1-MMAlign数据集提升了AI在科学图文理解方面的能力
研究人员推出了S1-MMAlign,这是一个旨在提高科学研究中多模态理解能力的大规模数据集。该数据集包含来自不同学科的科学论文中的超过1550万个图文对。它采用了一个AI驱动的流程来增强图像与其标题之间的语义对齐,这已被证明可以提高多模态大语言模型在科学推理和视觉指令任务上的性能。