一篇新发表在arXiv上的立场论文认为,机器学习同行评审中的评审得分在不同研究领域之间是不可比较的。该论文分析了2021-2026年国际学习表征会议(ICLR)的数据,发现即使评审得分相同,一篇论文的录用概率也会因其主题不同而相差高达八倍。作者将这种差异归因于测量设计缺陷而非个人偏见,并指出固定的数值量表将跨社区的质量判断聚合起来,而这些社区的评审群体并不统一。他们建议采用校准的评审信号,并发布按主题分层的录用率作为公平性指标。 AI
影响 突显了机器学习会议同行评审中潜在的系统性偏差,表明需要改进评估指标。
排序理由 这是一篇发表在arXiv上的研究论文,讨论了机器学习同行评审中的方法论问题。[lever_c_demoted from research: ic=1 ai=1.0]
- area chairs
- arXiv
- community priors
- expert reviewer standards
- ICLR 2021--2026
- International Conference on Learning Representations
- ML Peer Review
- program committees
- quality dilution
- reviewer scores
- review signals
- scoring culture
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →