PulseAugur
实时 05:14:27
实体 D-study

D-study

PulseAugur coverage of D-study — every cluster mentioning D-study across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_235123 ·

    新协议标准化 LLM 品牌推荐审计

    研究人员引入了 Dice Roll 方法,这是一种用于审计大型语言模型(LLM)品牌推荐的标准化协议。该方法解决了当前审计实践中缺乏标准化的问,而当前审计实践通常涉及重复相同的提示来评估随机变异。该协议将响应方差分解为采样和提示措辞等组成部分,并根据效应量和可推广性目标,为探索性、确认性和严格审计的迭代次数提供指导。

  2. TOOL · CL_143758 ·

    新框架评估人工智能驱动的作文评分的可靠性

    研究人员引入了一个新的条件泛化框架来评估自动化作文评分系统的可靠性。该框架将编码器架构和评分头家族视为可接受的测量条件集合,超越了简单的聚合可靠性估计。通过根据熵定义的响应层级来条件化证据,研究表明,虽然总体可靠性保持较高水平(Phi 约 0.76),但在不同的层级上会适度下降,这表明基于响应复杂性的决策研究有不同的要求。

  3. TOOL · CL_152473 ·

    新框架评估AI评分在不同条件下的可靠性

    引入了一个新的条件泛化框架,用于评估自动化评分系统的可靠性,特别是在自动化作文评分等环境中。该框架将不同的编码器架构和评分头族视为测量条件的集合,超越了简单的聚合可靠性估计。通过比较分析预测和经验扫描,该框架诊断了实现的配置集合,并根据熵定义的响应层级来提供证据。在计时L2写作上的演示显示,该系统具有聚合可靠性(Phi约0.76),在不同熵层级上的可靠性保持较高但略有下降,表明决策研究要求不同。