Cohen's kappa
PulseAugur coverage of Cohen's kappa — every cluster mentioning Cohen's kappa across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的ARISE方法增强了小样本生物医学组学数据的特征选择
研究人员开发了ARISE,一种用于小样本生物医学组学数据特征选择的新型集成方法。该自适应框架整合了多种相关性信号,评估类别平衡稳定性,并控制残差信息冗余,特别适用于多类别结果。在对五个分子数据集和各种特征集大小的评估中,ARISE的性能持续优于现有方法,在平衡准确率、宏F1和Cohen's kappa方面均获得最高排名。
-
研究发现LLM A/B测试预测可靠性面临挑战
一篇新的研究论文探讨了大型语言模型在预测网页设计A/B测试结果方面的有效性。研究发现,虽然Gemini 3 Flash模型可以与测试结果达成中等程度的一致,但其预测往往基于非显著性测试。即使只关注统计学上的显著结果,该模型的表现也尚无定论。研究还指出,转化率优化(CRO)领域的人类专家也表现出类似的局限性,他们之间的共识度高于与实际测试结果的一致度,这表明共识本身并不等同于预测准确性。
-
LLM中的孟加拉语数学推理:思维链监督效果喜忧参半
一项名为MathShikkha的新研究,调查了思维链(CoT)监督对于提高在孟加拉语上训练的小型语言模型数学推理能力的有效性。该研究使用GPT-5.4生成的推理过程构建了一个孟加拉语数学推理数据集,并对四种参数量从4B到7B不等的模型进行了微调。结果表明,CoT监督在较大的BanglaMATH基准测试中带来了显著的好处,所有模型的性能提高了20.1-28.1个百分点,而仅答案的微调有时会降低性能。然而,一项人类研究发现CoT在推理有效…
-
新的VIVID基准揭示了AI在越南语中的比喻语言差距
研究人员推出了VIVID,这是一个新的基准,旨在评估AI模型在越南语言和文化中理解比喻语言的能力。该基准包含超过1600个成语和谚语,并使用新颖的LLM-as-a-Judge方法进行评估。初步测试显示存在显著的性能差距,像VinaLLaMA-7B这样的越南语专用模型得分远低于GPT-4o等多语言模型,这表明当前的AI系统缺乏文化敏感性。
-
研究发现大型语言模型捏造用户画像 · 已追踪 2 个来源
一项新的研究论文介绍了一个名为 MirageBench 的数据集和评估框架,用于研究大型语言模型(LLMs)如何捏造用户属性,这种现象被称为过度推断(OI)。研究发现,所有 12 个被评估的模型都表现出普遍的过度推断,捏造了 35%-49% 的声明。引人注目的是,模型的自我评估过度推断与实际测量的过度推断呈负相关,这表明自我监控是衡量个性化忠实度的误导性指标。该研究主张通过外部验证而非模型自我报告来实现值得信赖的个性化。
-
新论文对AI代理的失败模式进行分类并实现自动化跟踪
一篇新论文引入了一个框架,根据模型、框架和用户等组件交互中的起源,对41种代理失败模式进行分类。这种方法将错误归因于组件之间的“缝隙”,特别是模型与其脚手架之间,这与代理问题在实践中如何显现相符。该论文还表明,这种分类模式可以实现自动化,在应用于生产跟踪时,与人类标签的Cohen's kappa值为0.76,从而能够持续监控代理性能。
-
LLM框架提高识别药物不良事件的准确性
一篇新研究论文详细介绍了一个“人在回路”框架,该框架利用检索增强的多智能体大型语言模型(LLM)从临床笔记中识别皮肤免疫相关不良事件(cirAEs)。与单独手动审查相比,该LLM辅助工作流程显示出更高的准确性和评分者间一致性。该框架还显著减少了审查不良事件所需的时间,表明这是一种可扩展且透明的提取此类数据的方法。
-
新的分析性溯因框架增强人机协同
研究人员引入了分析性溯因(Analytic Abduction),一个专注于溯因推理分析模式的新型人机协同框架。该方法通过维护多个候选解释来识别导致复杂观测状态的潜在因素,并仅在满足特定治理条件时才承诺结论。该框架的核心是 \kappa-\tau 装置,它量化了假设之间的认知交互,并根据决策风险设定承诺阈值。该方法旨在提供清晰、共享的协同对象,抵制过早收敛,为决策者提供带有支持性证据的竞争性解释场景。
-
新框架使用 VLM 改进脑电图到图像重建的评估
研究人员开发了一个新框架,用于评估脑电图信号与重建图像之间的连贯性,解决了现有指标(如 SSIM 和 LPIPS)的局限性。该框架利用四个视觉语言模型 (VLM) 来评估感知和语义对齐,生成的分数被提炼成 BCI-连贯性分数 (BCS)。人类验证表明,这种新的 BCS 指标具有高度可靠性,在判断感知-语义可恢复性方面优于传统测量方法。
-
SynthAVE使用LLM竞技场进行可扩展的电子商务数据标注 · 跟踪2个来源
研究人员开发了SynthAVE,一种用于在工业规模上为电子商务属性提取生成和验证合成标签的新颖系统。这种方法解决了对大量产品类型、属性和所需语言进行人工标注的成本过高问题。SynthAVE利用多LLM竞技场框架,其中21种不同的评判配置评估样本,最终标签由多数投票决定。这种集成方法与人类专家达成高度一致(Cohen's \u03kappa = 0.92),证明了其在成本效益高、高质量数据验证方面的有效性。
-
研究发现 LLM-as-judge 工具未能优先考虑人类验证
最近对六种 LLM-as-judge 工具的评估显示,大多数工具优先生成分数,而不是确保分数的可靠性。作者认为,法官根据人类标签进行的验证,通过 Cohen's kappa 等指标衡量,比原始评分性能更关键。DeepEval、Confident AI、Evidently、Braintrust、Promptfoo 和 Future AGI 等工具被审查,发现没有一个默认将法官-人类一致性计算作为其主要功能,将这一关键验证步骤留给了用户。
-
LLM被分析用于药物使用社区中的自我污名支持 · 跟踪2个来源
研究人员开发了分析在线社区(特别是Reddit)中使用药物的个体所表达的自我污名的方法。一项研究创建了一个代码簿,将自我污名分为认知、情感和行为领域,发现行为指标通常先于内化指标出现,并且自我污名是一种综合现象。第二项研究探讨了使用感知个性的LLM提供定制化支持,识别出四种不同的自我污名表达个性。虽然与个性匹配的LLM响应在实现目标行为转变方面显示出潜力,但专家评估者更喜欢非感知个性的基线模型的通用共情,这突显了LLM支持设计中临床对…
-
新框架衡量大学计算机科学课程与全球标准的对齐程度
开发了一个新框架,用于衡量大学计算机科学项目与国际课程指南(特别是 CS2013 和 CS2023)的对齐程度。这个人工干预的流水线将项目和指南表示为结构化语料库,使用语义检索来识别课程与知识单元的匹配项,然后由人工判断进行确认。该研究纵向应用于一个获得认证的理学学士项目,发现该项目覆盖了 CS2013 和 CS2023 大约 50% 的知识单元,并且在过去十年中覆盖率保持一致。虽然能力阐述保持较高水平,但与 CS2013 相比,该项…
-
研究发现,LLM作为评委模型存在显著的可靠性和偏差问题
一项对LLM作为评委模型进行评估的新研究揭示了其在可靠性和有效性方面存在的显著问题。该研究分析了21个评委模型在多个基准测试和超过541,000个判断中的表现,发现像精确匹配一致性这样的常用评估指标系统性地夸大了模型的区分能力。主要发现包括:使用Cohen's kappa与精确匹配相比,分数普遍下降;评委排名在不同基准测试中发生显著变化;以及一种悖论,即某些已部署的评委模型在具有高重测信度的情况下,却存在严重的定位偏差。
-
大型语言模型在识别失语症评估的话语单元方面显示出潜力
一篇新的研究论文探讨了使用指令微调的大型语言模型(LLMs)对失语症话语中的正确信息单元(CIUs)进行分类。研究发现,虽然零样本提示不足,但少样本提示显著提高了 Llama 3.1:8b、qwen2.5:7b 和 mistral:7b 等模型的性能,取得了与人类标注者相当的结果。然而,大型语言模型显示出高召回率但较低的精确率,表明它们倾向于过度分类代币为 CIUs,并且性能随失语症的严重程度而变化。
-
LLM 裁判评估需要数百个标签才能获得可靠结果
最近一篇文章强调了在使用 LLM 作为 AI 模型评估裁判时,需要更大的评估数据集。作者解释说,使用小型临时数据集的常见做法不足以实现可靠的校准。为了使具有中等一致性(Cohen's kappa 为 0.4-0.6)的 LLM 裁判达到 0.10 的 95% 置信区间,大约需要 200-400 个配对标签,这远多于许多团队通常使用的 50 个标签。文章提供了计算这些需求和执行裁判之间统计比较的数学推理和代码示例。
-
LLM系统助力激光粉末床熔融中的可解释缺陷分析
研究人员开发了一种新的决策支持系统,该系统结合了关于缺陷的结构化知识和大型语言模型(LLM),用于分析和指导激光粉末床熔融(LPBF)制造中的缓解策略。该系统利用了集成本体的LLM,其中包含一个包含27种缺陷类型及其因果关系的知识库。它支持自然语言查询以获取缺陷解释和缓解建议,并包括一个多模态图像评估模块,用于解释缺陷图像。评估显示,集成系统取得了0.808的宏平均F1分数,展示了改进的一致性和可解释性。