PulseAugur
中
实时 23:21:44
实体 Cohen's kappa

Cohen's kappa

PulseAugur coverage of Cohen's kappa — every cluster mentioning Cohen's kappa across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
26
90 天内 26
发布 · 30天
0
90 天内 0
论文 · 30天
23
90 天内 23
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/2 页 · 共 27 条
  1. TOOL · CL_286849 ·

    研究发现,人类和大型语言模型在社交媒体情感分析方面存在困难

    一篇新发表在arXiv上的研究评估了情感分析工具和大型语言模型(LLMs)在处理社交媒体文本时的表现。研究发现,即使是人类标注员在分类情感时也只能达到中等程度的一致性,这凸显了任务固有的主观性。在评估的工具中,Twitter-roBERTa-base在二元情感分类方面与人类评分的匹配度最高,而Qwen3-32B、GPT-OSS-120B和Llama-4-Maverick-17B等大型语言模型则与人类表现出中等到实质性的一致性,并且它们…

  2. TOOL · CL_254607 ·

    大型语言模型(LLM)派生权重提升心理测量模型在教育评估可靠性方面的表现

    研究人员开发了一种新的Rater Ising-Potts模型,该模型利用大型语言模型(LLM)嵌入来评估教育评估的可靠性。该模型侧重于评分之间的成对一致性,而不是假设有序的类别阈值。在对构建式反应数据集进行测试时,该模型表现出鲁棒性和可解释性,特别是当使用Top-K剪枝创建语义邻居的稀疏局部网络时,这始终产生了最高的准确率和Cohen's kappa。

  3. TOOL · CL_252064 ·

    新协议评估AI导师对不投入学习的学生的回应

    研究人员开发了一种名为“不投入学习学生模拟器”(DAS2)的新协议,通过模拟五种学习者投入状态:投入、摸鱼、空转、偏离主题和混合状态,来评估AI导师。该协议旨在评估AI导师对不投入学习学生行为的反应,这对于有效的教学策略至关重要。使用ASSISTments09数据集进行的评估表明,DAS2显著缩小了模拟和真实辅导课程在摸鱼和空转状态下的性能差距。虽然微调后的Qwen2.5-7B在响应时间上更接近真实情况,但仅使用提示的GPT-4o生成…

  4. COMMENTARY · CL_249144 ·

    人类评估在大型语言模型质量评估中仍然至关重要

    人类评估对于评估大型语言模型(LLMs)至关重要,因为BLEU分数等自动化指标常常无法捕捉连贯性、创造性和事实准确性等细微的质量。这种方法对于高风险应用至关重要,它使用李克特量表评分和成对比较等方法,通过人类反馈强化学习(RLHF)等技术来引导模型产生期望的行为。人类评估者的一致性通过科恩的Kappa系数等指标进行衡量,确保评估标准清晰且任务定义明确。

  5. TOOL · CL_247864 ·

    新的监督赫布学习算法用于脉冲神经网络,性能优于STDP

    研究人员开发了一种新的无梯度监督学习算法,用于脉冲神经网络(SNN),称为监督尖峰一致性依赖可塑性(Supervised SADP)。该方法直接将类别信息嵌入赫布可塑性计算中,这与先前使用奖励调制的做法不同。在基准数据集上,Supervised SADP 的性能优于奖励调制的尖峰时间依赖可塑性(STDP),在 MNIST 和 Fashion-MNIST 上实现了显著更高的准确率,并且训练速度更快。

  6. COMMENTARY · CL_244659 ·

    研究发现:多智能体AI的失败源于流程而非模型

    多智能体AI系统频繁失败并非由于模型限制,而是由于流程定义不清和智能体间通信问题。一项分析超过1600个执行轨迹的研究发现,约80%的失败源于规范和设计缺陷,或智能体之间的不匹配,而非模型本身。为提高可靠性,开发者应专注于创建详细的流程规范,类似于标准操作程序,并确保智能体能够沟通置信度和来源信息,以防止错误放大。

  7. TOOL · CL_229166 ·

    研究:大型语言模型在说服判断上与人类一致性有限

    一项发表在arXiv上的新研究调查了大型语言模型(LLMs)是否会以类似人类的方式响应说服性论点来更新其信念。研究发现,LLMs与人类判断的一致性仅略有体现,Cohen's kappa得分在0.079到0.178之间。虽然人类和LLMs都能识别强烈的说服线索,但人类更容易受到新颖内容和断言性语言的影响,而LLMs则优先考虑主题相似性和格式。研究还指出,与人类相比,LLMs倾向于低估情感诉求并高估可信度信号,而采取第三人称观察视角会增加…

  8. TOOL · CL_228616 ·

    研究发现:前沿大语言模型在肿瘤学决策基准测试中表现不佳

    一项新的基准测试——肿瘤学决策边界基准测试(ODBB)——已被开发出来,用于评估前沿大语言模型(LLMs)在肿瘤学中的决策能力。研究发现,即使是包括GPT-5.5和Gemini 3.1 Pro Preview在内的先进LLMs,在指南一致性和病例特异性决策方面也面临挑战,所有评估模型在相当一部分项目上都回答错误。在选择指南路径之间存在一个持续存在的盲点,这表明改进需要架构干预,而不是更多训练数据。研究强调,模型质量不再是临床LLM部署…

  9. RESEARCH · CL_227148 ·

    AI在病理学中的模型通过新的基准测试和伪影生成技术获得鲁棒性

    两篇新的研究论文探讨了提高计算病理学中AI模型可靠性和鲁棒性的方法。第一篇论文《计算病理学中伪影检测的可靠基准测试》提出了一种量化基准测试中变异来源的协议,并指出小队列基准测试支持的结论比通常暗示的要弱。第二篇论文《Destroy Me: 自动生成组织病理学图像的伪影》介绍了一个合成真实伪影以训练AI模型的框架,与在无伪影数据上训练的模型相比,在真实世界数据集上表现得到改善。

  10. TOOL · CL_217822 ·

    为不平衡分类问题提出新指标

    一篇新的研究论文介绍了对不平衡分类问题中常用性能指标的鲁棒性改进。作者们证明,当类别不平衡严重时,像 Matthews 相关系数 (MCC) 和 F1 分数这样的现有指标可能会不公平地偏袒忽略少数类别的分类器。提出的改进包括一个调整参数,以适应针对类别不平衡的鲁棒性,确保少数类别的真正率保持远离零。

  11. TOOL · CL_205795 ·

    新的ARISE方法增强了小样本生物医学组学数据的特征选择

    研究人员开发了ARISE,一种用于小样本生物医学组学数据特征选择的新型集成方法。该自适应框架整合了多种相关性信号,评估类别平衡稳定性,并控制残差信息冗余,特别适用于多类别结果。在对五个分子数据集和各种特征集大小的评估中,ARISE的性能持续优于现有方法,在平衡准确率、宏F1和Cohen's kappa方面均获得最高排名。

  12. TOOL · CL_193738 ·

    研究发现LLM A/B测试预测可靠性面临挑战

    一篇新的研究论文探讨了大型语言模型在预测网页设计A/B测试结果方面的有效性。研究发现,虽然Gemini 3 Flash模型可以与测试结果达成中等程度的一致,但其预测往往基于非显著性测试。即使只关注统计学上的显著结果,该模型的表现也尚无定论。研究还指出,转化率优化(CRO)领域的人类专家也表现出类似的局限性,他们之间的共识度高于与实际测试结果的一致度,这表明共识本身并不等同于预测准确性。

  13. TOOL · CL_201679 ·

    LLM中的孟加拉语数学推理:思维链监督效果喜忧参半

    一项名为MathShikkha的新研究,调查了思维链(CoT)监督对于提高在孟加拉语上训练的小型语言模型数学推理能力的有效性。该研究使用GPT-5.4生成的推理过程构建了一个孟加拉语数学推理数据集,并对四种参数量从4B到7B不等的模型进行了微调。结果表明,CoT监督在较大的BanglaMATH基准测试中带来了显著的好处,所有模型的性能提高了20.1-28.1个百分点,而仅答案的微调有时会降低性能。然而,一项人类研究发现CoT在推理有效…

  14. TOOL · CL_183253 ·

    新的VIVID基准揭示了AI在越南语中的比喻语言差距

    研究人员推出了VIVID,这是一个新的基准,旨在评估AI模型在越南语言和文化中理解比喻语言的能力。该基准包含超过1600个成语和谚语,并使用新颖的LLM-as-a-Judge方法进行评估。初步测试显示存在显著的性能差距,像VinaLLaMA-7B这样的越南语专用模型得分远低于GPT-4o等多语言模型,这表明当前的AI系统缺乏文化敏感性。

  15. RESEARCH · CL_184907 ·

    研究发现大型语言模型捏造用户画像 · 已追踪 2 个来源

    一项新的研究论文介绍了一个名为 MirageBench 的数据集和评估框架,用于研究大型语言模型(LLMs)如何捏造用户属性,这种现象被称为过度推断(OI)。研究发现,所有 12 个被评估的模型都表现出普遍的过度推断,捏造了 35%-49% 的声明。引人注目的是,模型的自我评估过度推断与实际测量的过度推断呈负相关,这表明自我监控是衡量个性化忠实度的误导性指标。该研究主张通过外部验证而非模型自我报告来实现值得信赖的个性化。

  16. TOOL · CL_179892 ·

    新论文对AI代理的失败模式进行分类并实现自动化跟踪

    一篇新论文引入了一个框架,根据模型、框架和用户等组件交互中的起源,对41种代理失败模式进行分类。这种方法将错误归因于组件之间的“缝隙”,特别是模型与其脚手架之间,这与代理问题在实践中如何显现相符。该论文还表明,这种分类模式可以实现自动化,在应用于生产跟踪时,与人类标签的Cohen's kappa值为0.76,从而能够持续监控代理性能。

  17. TOOL · CL_160820 ·

    LLM框架提高识别药物不良事件的准确性

    一篇新研究论文详细介绍了一个“人在回路”框架,该框架利用检索增强的多智能体大型语言模型(LLM)从临床笔记中识别皮肤免疫相关不良事件(cirAEs)。与单独手动审查相比,该LLM辅助工作流程显示出更高的准确性和评分者间一致性。该框架还显著减少了审查不良事件所需的时间,表明这是一种可扩展且透明的提取此类数据的方法。

  18. TOOL · CL_147900 ·

    新的分析性溯因框架增强人机协同

    研究人员引入了分析性溯因(Analytic Abduction),一个专注于溯因推理分析模式的新型人机协同框架。该方法通过维护多个候选解释来识别导致复杂观测状态的潜在因素,并仅在满足特定治理条件时才承诺结论。该框架的核心是 \kappa-\tau 装置,它量化了假设之间的认知交互,并根据决策风险设定承诺阈值。该方法旨在提供清晰、共享的协同对象,抵制过早收敛,为决策者提供带有支持性证据的竞争性解释场景。

  19. RESEARCH · CL_143397 ·

    新框架使用 VLM 改进脑电图到图像重建的评估

    研究人员开发了一个新框架,用于评估脑电图信号与重建图像之间的连贯性,解决了现有指标(如 SSIM 和 LPIPS)的局限性。该框架利用四个视觉语言模型 (VLM) 来评估感知和语义对齐,生成的分数被提炼成 BCI-连贯性分数 (BCS)。人类验证表明,这种新的 BCS 指标具有高度可靠性,在判断感知-语义可恢复性方面优于传统测量方法。

  20. RESEARCH · CL_133121 ·

    SynthAVE使用LLM竞技场进行可扩展的电子商务数据标注 · 跟踪2个来源

    研究人员开发了SynthAVE,一种用于在工业规模上为电子商务属性提取生成和验证合成标签的新颖系统。这种方法解决了对大量产品类型、属性和所需语言进行人工标注的成本过高问题。SynthAVE利用多LLM竞技场框架,其中21种不同的评判配置评估样本,最终标签由多数投票决定。这种集成方法与人类专家达成高度一致(Cohen's \u03kappa = 0.92),证明了其在成本效益高、高质量数据验证方面的有效性。