Krippendorff's alpha
PulseAugur coverage of Krippendorff's alpha — every cluster mentioning Krippendorff's alpha across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法通过稀疏反馈高效地个性化生成式用户界面
研究人员开发了一种新颖的方法,通过从稀疏的用户反馈中学习来个性化生成式用户界面(GenUIs)。该方法解决了在生成所有潜在屏幕之前适应界面的挑战,依赖于成对判断来权衡先前用户的偏好,而不是固定的UI属性集。在研究中,这种样本效率高的方法优于预训练的UI评估器和更大的多模态模型,新用户更喜欢通过该方法个性化的界面而不是其他基线。
-
心理健康领域的LLM:可靠性、评估和安全研究 · 追踪4篇文献
一系列研究论文探讨了大型语言模型(LLM)在心理健康应用中的能力和局限性。一项研究评估了Google Gemini 2.0 Flash和OpenAI ChatGPT-4o在医疗诊断方面的表现,发现其一致性完美,但容易受到无关输入的影响,并且上下文感知能力有所不同。另一篇论文介绍了CARE-MH,这是一个用于标准化和提高心理健康LLM评估可复现性的框架。此外,研究还探讨了用于增强数字心理健康干预中LLM安全性的检索增强生成(RAG),表…
-
符号增强提高了神经事实检查器在科学文本上的鲁棒性
研究人员开发了一种名为符号增强的新方法,以提高神经事实检查器的准确性,特别是在处理科学文本方面。这些模型经常在数字和单位方面遇到困难,导致错误会微妙地改变科学主张。新方法解决了规范等价数量(如不同的温度刻度)导致准确性崩溃的特定盲点。通过生成保留标签的增强训练数据,符号增强显著提高了鲁棒性,甚至提高了分布内准确性,且不增加推理成本,即可媲美闭域LLM。
-
新的 TikStance 数据集支持对 TikTok 上的多模态政治立场进行分析 · 已追踪 2 个来源
研究人员推出了 TikStance,这是一个用于分析 TikTok 上政治对话的新数据集。该多模态数据集包含 161 个视频和超过 13,000 条评论,重点关注 Donald Trump、Joe Biden 和 Kamala Harris 等政治人物。TikStance 保留了视听信息和评论线程的分层结构,从而能够在政治话语中实现更细致的立场检测。
-
新框架使用 VLM 改进脑电图到图像重建的评估
研究人员开发了一个新框架,用于评估脑电图信号与重建图像之间的连贯性,解决了现有指标(如 SSIM 和 LPIPS)的局限性。该框架利用四个视觉语言模型 (VLM) 来评估感知和语义对齐,生成的分数被提炼成 BCI-连贯性分数 (BCS)。人类验证表明,这种新的 BCS 指标具有高度可靠性,在判断感知-语义可恢复性方面优于传统测量方法。
-
新方法利用LLM小组衡量数据稀疏地区政治立场
一项新的研究论文提出了一种新颖的方法,通过将大型语言模型视为小组中的个体评分者,来衡量数据有限地区的政治立场。该方法旨在克服现有工具主要在西方政治体系上得到验证的局限性。研究发现,添加轴定义可以提高评分者之间的一致性,在来自不同实验室的九个模型中达到了0.86的Krippendorff alpha系数。该论文还强调,模型之间的分歧可能具有信息量,特别是关于行为者对其国家基本秩序的立场,这表明解释在这些分歧中起着重要作用。