item response theory
PulseAugur coverage of item response theory — every cluster mentioning item response theory across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
利用新的统计方法重新评估AI时间跨度指标
研究人员对AI时间跨度进行了统计分析,该指标代表了AI以50%的概率解决任务所需的人类完成时间。他们利用样条函数和项目反应理论放宽了AI难度与人类完成时间之间线性关系的假设。研究结果表明,任务的AI难度并不总是线性依赖于人类时间,这表明时间跨度的跳跃可能比简单的乘法器所暗示的更容易或更难。该研究还提供了诊断图,以更好地评估这些时间跨度的有效性。
-
反向项目反应理论应用于癌症药物反应数据
研究人员开发了一种新颖的反向项目反应理论(IRT)应用,用于分析碎片化的癌症药物反应数据。该方法将癌症类型视为具有抗性能力的潜在受试者,将药物视为具有逃避难度的项目。该模型应用于大型数据集,能有效估计癌症类型的抗性和药物活性,与更简单的方法相比,在药物有效性排名方面表现出优越的性能,尤其是在数据稀疏的情况下。
-
新方法使用LLM解释自然语言问题难度
研究人员开发了一种新颖的数据驱动方法,可以自动生成和验证自然语言解释,说明为什么某些问题比其他问题更难。该方法利用项目反应理论,根据大量LLM的响应来估计问题难度。通过对比简单和困难的问题,该系统提出并验证了关于导致难度的潜在因素的假设。生成的假设是可解释的、可预测问题难度的,甚至可以用来因果性地改变问题的测量难度,从而提供比简单难度分数更具可操作性的理解。
-
新方法大幅降低AI安全基准测试成本
研究人员开发了一种更有效的方法,利用项目反应理论(IRT)来评估语言模型的安全性。这种心理测量学方法应用于六个常见的安全基准测试,表明IRT比传统的静态方法更能揭示结构性见解并更有效地区分模型。自适应项目选择(为每个模型动态选择相关的测试项目)可以将评估成本降低高达99.9%,同时保持高排名准确性。此外,一种用于选择信息性项目固定子集的实用程序,作为自适应测试的静态替代方案,提供了显著的成本节约。
-
LLM偏好生成与校准研究显示模型不一致性及改进方法
近期研究探讨了大型语言模型(LLM)生成偏好的可靠性和校准性。一项研究发现,虽然LLM在偏好上表现出自洽性,但在不同模型和规模之间存在显著的不一致性,表明提示词措辞的影响不如模型选择大。另一篇论文证明,较小的、冻结的模型可以生成比自身生成更有效的“拒绝”样本用于偏好蒸馏,从而降低计算成本。第三项研究引入了基于评分卡的偏好(Rubric-Calibrated Preferences, RCP),以提高LLM在信息检索中判断的质量和跨查询…
-
新的QC-Stark基准揭示了大型语言模型在量子计算方面的能力差距
研究人员开发了QC-Stark,这是一个旨在评估大型语言模型(LLMs)在11项不同量子计算任务上的新基准。这些任务涵盖了电路构建、调试、编译、纠错和模拟等领域。对10个模型的初步评估显示,不同任务之间的性能存在显著差异,表明整体排名可能会掩盖具体的能力分离。
-
评分标准反应理论通过项目反应建模增强RL奖励
研究人员引入了评分标准反应理论(RRT),这是一种在需要人类判断的强化学习任务中生成奖励的新颖方法。与对评分标准项求和的传统方法不同,RRT采用双参数项目反应模型,从判断模式中推断出标量质量分数。该方法以Qwen3.5-4B模型为证,在各种数据集上,尤其是在医学和科学领域,显示出优于Group Relative Policy Optimization (GRPO)的性能。RRT还通过自适应Fisher选择减少了所需的判断次数,从而提高了效率。
-
IXPLORE算法通过提高准确性增强政治数据分析
研究人员开发了IXPLORE,一种新的理想点估计算法,它将预测准确性与稀疏感知似然函数相结合。这种方法旨在改进政治数据的分析和可视化,特别是对于响应稀疏的用户。与现有的基于模型和机器学习的替代方案相比,IXPLORE在基准数据集上表现出卓越的性能,提供了快速推理和强大的插补能力。该算法可作为PyPI上的Python包使用,并包含一种基于网格的后验推理方法,用于在有界二维潜在空间中进行不确定性量化。
-
MMLU基准审计揭示侧重检索而非推理
一项对大规模多任务语言理解 (MMLU) 基准的新审计显示,其总分主要衡量事实检索能力而非推理能力。研究人员使用项目反应理论分析了 1,000 个语言模型中的 14,042 个 MMLU 测试项目,发现该基准混淆了不同的概念,并且 STEM 和非 STEM 分区之间的难度差异很大。这种不平衡无意中偏袒了针对检索进行优化的模型,可能误导了推理密集型任务的模型选择。
-
BenchMIRT方法揭示LLM基准测试的真实测量内容 · 追踪2个来源
研究人员推出了一种名为BenchMIRT的新方法论,旨在通过分析单个提示来剖析大型语言模型(LLM)在基准测试上的表现。该方法受项目反应理论(IRT)启发,旨在区分构成模型在特定任务得分的各种潜在能力,例如安全性和通用推理能力。通过将多维IRT(MIRT)应用于100个LLM在16个基准测试上的数据,BenchMIRT揭示,一些旨在衡量社会偏见的基准测试(如BBQ)比以往认为的更接近通用推理能力。
-
新的因果建模方法增强了学生能力评估
研究人员提出了一种使用结构因果模型进行学生能力评估的新方法,超越了诸如项目反应理论等传统的心理测量模型。该方法旨在明确支持干预和反事实推理,使教育工作者能够更好地理解提示等干预措施的影响。该方法依赖于专家提取的逻辑信息,而不是概率假设,并通过对学龄学生算法技能评估的数据进行了说明。
-
New approach to educational assessment uses causal modeling
本文提出了一种用于教育评估的结构因果建模方法,超越了传统的项目反应理论。作者提倡一个明确支持干预和反事实推理的框架,使教育工作者能够更好地理解提示等干预措施的影响。虽然该协议需要专家输入结构方程,但它依赖于逻辑信息而非概率假设,并通过算法技能评估的数据进行了说明。
-
新的IRT框架揭示了大型语言模型在跨语言安全方面的差距
一篇新的研究论文提出了一个新颖的框架,用于分析大型语言模型(LLM)在非英语语言中的安全护栏为何会失效。提出的多群体项目反应理论(IRT)模型,名为MultiJail,旨在区分语言无关的安全鲁棒性、提示难度和跨语言安全差距等因素。该研究分析了61种模型配置和10种语言的190万个响应,发现安全退化并非仅与低资源语言有关,一些模型在英语中的表现反而更差。该框架实现了0.940 AUC的高预测准确率,为跨语言安全评估提供了一种更细致的方法。
-
LLM校准研究提出新方法以提高基准可比性和域外泛化能力
两篇新研究论文提出了改进大型语言模型(LLM)校准的方法。第一篇论文介绍了一个基于项目反应理论(IRT)的框架,该框架使用锚点项目来校准新基准,即使模型在不同数据集上随时间进行评估,也能实现可比的分数。第二篇论文提出了一种双层优化方法,在训练过程中修改模型参数以最大化预测分布的熵,直接针对过度自信问题并提高域外泛化能力。
-
新研究发现:大型语言模型(LLM)的跨难度泛化能力有限
一篇新发表在arXiv上的研究论文,调查了大型语言模型(LLM)在不同任务难度下的泛化能力。该研究利用项目反应理论(IRT)和LLM输出来客观评估示例难度,发现跨难度泛化能力通常有限。仅在容易或困难数据上训练,并不能持续提高在整个难度范围内的性能,这凸显了在LLM的训练和评估数据集中包含多样化难度水平的必要性。
-
大型语言模型难以准确评估项目难度,低估学习者的复杂挑战
近期研究表明,虽然大型语言模型(LLMs)可以以中等准确度预测项目难度级别,但它们在识别真正困难的项目时却力不从心。研究发现,LLMs 倾向于低估因误解而对学习者构成挑战的项目难度,这种现象被称为“简单陷阱”。这表明当前的 LLMs 可能在近似课程难度而非认知难度,从而在教育评估和自适应系统中带来偏见的风险。
-
新方法量化LLM基准测试中的不确定性
研究人员开发了一种名为Laplace-PSN-IRT的新方法,用于量化大型语言模型(LLM)基准测试中的不确定性。该方法使用后验拉普拉斯近似,在不重新训练现有模型的情况下提供贝叶斯后验推断。该方法能够进行校准的不确定性量化,实现置信区间和模型之间的概率比较,并提供比以往点估计方法更稳定的项目难度度量。
-
AI代理演进与基准排名面临审查 · 跟踪2个来源
一篇新的arXiv论文表明,自动演进的AI代理脚手架并不总是优于简单的搜索方法,对新任务的泛化能力有限。此外,研究表明,当在少量系统上进行测试时,AI模型的项目反应理论(IRT)排名可能不可靠,这可能会破坏行业比较。
-
新研究探索自适应大语言模型评估和自我改进技术 · 追踪10个来源
研究人员正在开发新的方法来评估和改进大语言模型(LLMs)。一种名为ATLAS的方法使用项目反应理论,显著减少了准确评估LLM所需的项目数量,需求减少高达90%。另一项研究将信号检测理论应用于衡量LLM的元认知效率,揭示置信信号和准确性并不总是对齐,并且在不同模型之间存在显著差异。此外,一个名为“Double Ratchet”的框架与LLM代理技能共同演进评估指标,即使在最初没有可靠指标的情况下也能实现自我改进。
-
新的基准测试评估葡萄牙语文本嵌入模型,揭示性能差距
发布了两个新的基准测试 MTEB-PT 和 MTEB-PT(巴西葡萄牙语),专门用于评估葡萄牙语的文本嵌入模型。这些基准测试解决了现有评估中葡萄牙语代表性不足的问题,而现有评估通常依赖于翻译的数据集或多语言平均值。新的基准测试包含大量葡萄牙语原生任务,涵盖语义文本相似性、分类、检索和重新排序等多个类别。初步评估表明,模型性能高度依赖于任务,并且在多语言基准测试上的排名并不能可靠地预测葡萄牙语特定性能,这凸显了进行原生语言评估的必要性。