PulseAugur
实时 02:45:20
实体 Fleiss' kappa

Fleiss' kappa

PulseAugur coverage of Fleiss' kappa — every cluster mentioning Fleiss' kappa across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_185386 ·

    新基准评估LLM在合成数学数据中查找错误的能力

    研究人员推出了MathDebugger,这是一个旨在评估大型语言模型检测和诊断合成数学数据中错误能力的新基准。该基准包含正确和错误的问题数据集,以及带注释的解决方案,在人类注释者之间达成高度一致。对14个大型语言模型和三个过程奖励模型的评估显示,即使是先进的模型在完全饱和MathDebugger方面也面临挑战,尤其是在细粒度错误识别方面。研究还强调了模型解决和验证能力之间的差距,表明明确的错误信息可以指导数据合成和质量控制流程的改进。

  2. RESEARCH · CL_139208 ·

    小型语言模型展现出创造力、诚实性和设计性遗忘

    研究人员已经证明,小型语言模型,特别是拥有1.46亿到30亿参数的模型,可以展现出创造力、诚实性和设计性遗忘。这些基于双曲基底构建的模型,显示出开发值得信赖的伴侣式AI的潜力。一个行为审计模型在检测合规性差距和谄媚、虚构记忆等不良特质方面取得了高精度,在某些评估中表现优于前沿模型。该研究还强调了一个实现设计性遗忘的记忆操作系统,为开发更可靠的AI伴侣指明了方向。

  3. RESEARCH · CL_133121 ·

    SynthAVE使用LLM竞技场进行可扩展的电子商务数据标注 · 跟踪2个来源

    研究人员开发了SynthAVE,一种用于在工业规模上为电子商务属性提取生成和验证合成标签的新颖系统。这种方法解决了对大量产品类型、属性和所需语言进行人工标注的成本过高问题。SynthAVE利用多LLM竞技场框架,其中21种不同的评判配置评估样本,最终标签由多数投票决定。这种集成方法与人类专家达成高度一致(Cohen's \u03kappa = 0.92),证明了其在成本效益高、高质量数据验证方面的有效性。