PulseAugur
实时 08:02:09
English(EN) Reviewer Scores Are Not Comparable Across Research Areas in ML Peer Review

研究发现:机器学习同行评审得分在不同主题间不可比较

一篇新发表在arXiv上的立场论文认为,机器学习同行评审中的评审得分在不同研究领域之间是不可比较的。该论文分析了2021-2026年国际学习表征会议(ICLR)的数据,发现即使评审得分相同,一篇论文的录用概率也会因其主题不同而相差高达八倍。作者将这种差异归因于测量设计缺陷而非个人偏见,并指出固定的数值量表将跨社区的质量判断聚合起来,而这些社区的评审群体并不统一。他们建议采用校准的评审信号,并发布按主题分层的录用率作为公平性指标。 AI

影响 突显了机器学习会议同行评审中潜在的系统性偏差,表明需要改进评估指标。

排序理由 这是一篇发表在arXiv上的研究论文,讨论了机器学习同行评审中的方法论问题。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究发现:机器学习同行评审得分在不同主题间不可比较

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Binyan Xu, Fan Yang, Xilin Dai, Kehuan Zhang ·

    机器学习同行评审中的审稿人评分在不同研究领域间不可比

    arXiv:2607.27209v1 Announce Type: cross Abstract: Peer review at ML conferences increasingly relies on reviewer scores as the primary decision instrument. As submissions have scaled from thousands to tens of thousands per year, no systematic audit has examined whether this instru…