Semantic Scholar
PulseAugur coverage of Semantic Scholar — every cluster mentioning Semantic Scholar across labs, papers, and developer communities, ranked by signal.
-
研究发现:AI生成的文献综述需要人工监督
一篇新发表在arXiv上的研究论文评估了大语言模型(LLMs)在学术工作流程中生成文献综述的有效性。研究发现,虽然LLMs可以提供基础性的概述,并利用更大的上下文窗口整合更广泛的信息,但要达到学术出版标准,人工监督至关重要。研究观察到内容重复、遗漏关键文献以及倾向于描述性而非综合性等问题,这凸显了领域专家对AI生成内容进行批判性评估和完善的必要性。
-
AI模型生成虚构“幽灵作者”,困扰学术出版界
来自三星和华沙大学的一篇新研究论文发现了一种现象:大型语言模型在各种语境下会持续生成相同的虚构专家姓名。这些由AI生成的虚拟人物,如Elena Vasquez和Elias Thorne,出现在数百篇学术论文、文章和书籍的作者列表中,导致学术出版记录被污染。研究发现,这些“幽灵作者”被Google Scholar和Semantic Scholar等聚合器索引,甚至在Zenodo等平台上被分配了数字对象标识符(DOI),这引发了对学术信息…
-
阿拉伯语NLP研究面临可解释性和方言空白,新论文揭示
两篇新论文分析了阿拉伯语自然语言处理(NLP)研究的现状,突出了在可解释性和不同方言覆盖方面存在的显著差距。第一篇论文批评了可解释人工智能(XAI)技术在阿拉伯语中的应用有限,指出其依赖于基本方法并侧重于分类任务,而忽略了特定的语言细微差别。第二篇论文是一项对7000多篇阿拉伯语NLP论文的文献计量学研究,证实了由于LLM的出现,研究在2020年后激增,但也确定了研究不足的领域,特别是针对不同阿拉伯语方言的摘要生成。两项研究都呼吁进行…
-
新定律量化了数十亿规模用户数据的分词需求
研究人员提出了一个“用户行为致密化定律”,用于量化大规模用户表示学习中数据规模与分词容量之间的关系。使用数十亿规模的支付宝数据集进行的试点研究揭示了原始数据扩展的瓶颈,而分词可以缓解这一问题。该定律确定了最小充分分词容量的对数与输入数据大小之间近似线性的关系,为选择分词配置提供了实际指导。此外,还开发了一种名为ALGN的自适应可变长度分词方法,该方法在各种数据源和任务上的性能均优于现有基线。
-
AstroPT 利用星系数据探究 LLM 可解释性
一项新研究提出利用天文数据来更好地理解大型语言模型 (LLM) 的可解释性。研究人员在一个名为 AstroPT 的 Transformer 模型上训练了星系图像,利用天文学中已知的物理关系和概念难度作为受控环境。研究结果表明,概念在训练过程中以可预测的顺序出现,并与其已知难度相呼应,这可能有助于校准 LLM 的可解释性方法。
-
模型上下文协议简化了多源数据集成
模型上下文协议(MCP)提供了一个标准化的数据收集接口,旨在降低集成多个数据源的复杂性。MCP允许开发人员将数据源公开为MCP服务器,然后LLM代理或数据管道等客户端可以统一访问这些服务器,而不是为每个源构建单独的适配器。这种方法简化了多源研究聚合和连续监控等任务,因为用一个数据源替换另一个数据源只需进行小的配置更改,而无需重写管道。虽然MCP会引入一些延迟,但当处理三个或更多数据源时,其优势变得非常显著,提供了灵活性并降低了维护开销。
-
生物医学API的Unicode保真度不一致,影响LLM训练数据
最近对四个主要的生物医学文献API——PubMed E-utilities、Crossref、OpenAlex和Semantic Scholar——进行的审计显示,它们处理Unicode字符的方式存在显著不一致。研究发现,PubMed AbstractText字段经常未能保留印刷标点符号,而OpenAlex系统性地丢失了特殊空白字符。虽然数学符号和希腊字母通常得以保留,但这些字符级别的保真度问题直接影响文本挖掘、文献计量学以及生物医学…
-
AI框架被开发用于追踪研究文献中的数据集使用情况
研究人员开发了一个新的AI框架,用于追踪和分类学术文献中的数据集使用情况,填补了当前研究基础设施的空白。该多任务GLiNER系统联合提取数据集提及、识别关系并对使用上下文进行分类。为了克服标记数据有限的挑战,该方法结合了合成数据生成和基于LLM的再验证,以提高监测数据集引用的准确性和一致性。
-
新的RAG框架增强技术文献推理能力
研究人员开发了TechGraphRAG,一个新颖的、基于代理的检索增强生成(RAG)框架,用于技术文献推理。该系统采用一个13步流程,通过整合查询意图分类、证据评分、带查询重构的代理重试以及外部数据库搜索,超越了传统的RAG。它还利用Neo4j知识图谱来提供关系上下文,并包含用于引用验证和质量评估的自我纠正机制。
-
新基准揭示角色提示对LLM学者推荐的影响
开发了一个新的基准来评估角色提示对用于学者推荐的大型语言模型(LLM)的影响。该研究审计了六个科学学科的43个LLM,分析了语言、地点和角色与任务提示的变化如何影响推荐的技术质量和社会代表性。研究结果表明,虽然模型选择主要影响技术质量,但提示设计显著影响多样性和事实性,特定的地点提示在准确性和同质性方面产生了不同的结果。
-
CiteRadar: 研究人员画像和地理可视化的引文情报平台
研究人员开发了CiteRadar,一个开源平台,旨在分析学术引文并可视化其地理分布。该系统处理一个Google Scholar标识符,生成出版物列表、包含作者元数据的引文论文、排名作者表以及交互式世界地图。CiteRadar通过整合多个数据源并采用新颖的技术进行解析、作者消歧和位置数据提取,解决了现有文献计量工具的局限性。
-
Google DeepMind 利用人工智能加速科学发现和数学研究
Google DeepMind 正在启动利用人工智能加速科学发现的计划,重点关注与印度的合作以及推进数学研究。该公司正在提供 AlphaGenome 和 AI Co-scientist 等前沿人工智能模型的使用权,以实现科学突破,并支持与顶尖研究机构的“人工智能助力数学计划”。此外,Google Research 开发了一个使用 Gemini 的人工智能系统,该系统可以帮助科学家编写专家级的实证软件,用于假设评估,并在多个科学领域展现…