peer review
PulseAugur coverage of peer review — every cluster mentioning peer review across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
JAMA社论建议AI可改善存在偏见的同行评审
《美国医学会杂志》(JAMA) 发表的一篇社论强调了传统同行评审过程中固有的低效率和偏见。该社论建议,可以利用人工智能(AI)来改进同行评审系统,解决不一致、偏见以及低质量或欺诈性研究的发表等问题。
-
人工智能对科学文章和同行评审的影响受到质疑
一位Mastodon用户对科学文章中出现大型语言模型(LLM)的比例没有明显增加表示惊讶,尽管围绕人工智能和同行评审的讨论日益增多。该用户分享了一篇关于人工智能解决学术同行评审危机的潜力的文章链接,强调了其希望和陷阱。
-
消息人士称,人工智能正在压垮科学同行评审 · 跟踪了4个来源
据报道,人工智能正在压垮被认为是科学诚信基石的科学同行评审过程。同行评审的自愿性质,加上提交的论文数量不断增加,正在给该系统带来压力。一个例子是,一位通讯作者处理了数量异常多的稿件,其中许多与AI有关,这引发了对彻底审查的质量和可行性的担忧。
-
人工智能在同行评审中威胁科学完整性,专家警告
在同行评审过程中使用人工智能对其有效性和完整性构成了重大风险。专家们担心人工智能可能会破坏科学评估的基本原则。这引发了对学术出版业未来以及如何保持对研究成果信任的疑问。
-
LLM框架根据方法验证科学论文论点
研究人员开发了一个新框架,通过使用大型语言模型(LLM)来验证论文内的论点,从而加强科学论文的同行评审过程。该系统称为论文内论点验证,评估论文中描述的方法是否充分支持其声称的新颖性。该框架从引言中提取论点,识别相关的方法学证据,并评估支持程度,借鉴了对ICLR 2025论文的人工评审标准。评估表明,LLM生成的评估与人类评审员的担忧(尤其是在新颖性方面)高度一致,BERTScore进一步验证了该框架捕捉这些类似人类观察的能力。
-
大语言模型同行评审:会议指南优于模仿
一项新近发表在arXiv上的研究调查了不同的审稿人指南设计如何影响基于大语言模型(LLM)的自动化同行评审的有效性。研究发现,通过既定实践精炼而成的官方会议指南,其产生的评估结果与人类判断最为一致。相反,旨在模仿人类审稿人的指南效果较差,而严格的评分条目式评分则会降低性能。该研究强调了在自动化同行评审中,主观和整体性评分比强制执行严格的评分条目更有价值。
-
AI同行评审易受仅展示性攻击
近期研究突显了AI辅助科学同行评审系统存在的重大漏洞。研究表明,AI评审员可能通过仅展示性的修改(例如更改摘要或表述方式)而被操纵,而无需改变核心科学内容。这些攻击可能导致评分虚高和接受率增加,引发担忧,即作者可能会为了迎合AI的判断而牺牲科学价值。此外,多模态AI评审员容易受到针对图表和文本的攻击,这需要强大的防御措施和谨慎的人工监督来维护同行评审过程的完整性。