PulseAugur
中
实时 18:18:55
实体 Fleiss' kappa

Fleiss' kappa

PulseAugur coverage of Fleiss' kappa — every cluster mentioning Fleiss' kappa across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_286849 ·

    研究发现,人类和大型语言模型在社交媒体情感分析方面存在困难

    一篇新发表在arXiv上的研究评估了情感分析工具和大型语言模型(LLMs)在处理社交媒体文本时的表现。研究发现,即使是人类标注员在分类情感时也只能达到中等程度的一致性,这凸显了任务固有的主观性。在评估的工具中,Twitter-roBERTa-base在二元情感分类方面与人类评分的匹配度最高,而Qwen3-32B、GPT-OSS-120B和Llama-4-Maverick-17B等大型语言模型则与人类表现出中等到实质性的一致性,并且它们…

  2. TOOL · CL_259279 ·

    研究发现:词义消歧瓶颈在于标签而非模型

    一篇关于英语词义消歧(WSD)的新论文指出,当前前沿的LLM模型已经非常准确,以至于训练标签的质量已成为基准性能的主要瓶颈。研究人员引入了lexEN,一个修正后的WSD基准,以及SenseBench,一个带有排行榜的评估工具。他们还发布了重新标注的语料库和一个在这些改进标签上训练的强大双编码器模型,证明了生成高质量标签的成本现在是WSD研究的主要限制因素。

  3. TOOL · CL_228747 ·

    新的VFR-Audit框架增强了AI公平性审计的可靠性

    研究人员推出了一种名为VFR-Audit的新框架,旨在评估临床AI应用中公平性审计的可靠性,特别是在预测医院停留时间方面。该框架侧重于判决翻转率(VFR),它量化了在重采样下公平性判决改变的概率。VFR-Audit还报告了队列重采样稳定性、审计规模敏感性和跨医院判决一致性(使用Fleiss' kappa),弥补了现有方法仅考虑指标级不确定性的不足。

  4. TOOL · CL_185386 ·

    新基准评估LLM在合成数学数据中查找错误的能力

    研究人员推出了MathDebugger,这是一个旨在评估大型语言模型检测和诊断合成数学数据中错误能力的新基准。该基准包含正确和错误的问题数据集,以及带注释的解决方案,在人类注释者之间达成高度一致。对14个大型语言模型和三个过程奖励模型的评估显示,即使是先进的模型在完全饱和MathDebugger方面也面临挑战,尤其是在细粒度错误识别方面。研究还强调了模型解决和验证能力之间的差距,表明明确的错误信息可以指导数据合成和质量控制流程的改进。

  5. RESEARCH · CL_139208 ·

    小型语言模型展现出创造力、诚实性和设计性遗忘

    研究人员已经证明,小型语言模型,特别是拥有1.46亿到30亿参数的模型,可以展现出创造力、诚实性和设计性遗忘。这些基于双曲基底构建的模型,显示出开发值得信赖的伴侣式AI的潜力。一个行为审计模型在检测合规性差距和谄媚、虚构记忆等不良特质方面取得了高精度,在某些评估中表现优于前沿模型。该研究还强调了一个实现设计性遗忘的记忆操作系统,为开发更可靠的AI伴侣指明了方向。

  6. RESEARCH · CL_133121 ·

    SynthAVE使用LLM竞技场进行可扩展的电子商务数据标注 · 跟踪2个来源

    研究人员开发了SynthAVE,一种用于在工业规模上为电子商务属性提取生成和验证合成标签的新颖系统。这种方法解决了对大量产品类型、属性和所需语言进行人工标注的成本过高问题。SynthAVE利用多LLM竞技场框架,其中21种不同的评判配置评估样本,最终标签由多数投票决定。这种集成方法与人类专家达成高度一致(Cohen's \u03kappa = 0.92),证明了其在成本效益高、高质量数据验证方面的有效性。