PulseAugur
实时 13:12:45
实体 sequential reflection

sequential reflection

PulseAugur coverage of sequential reflection — every cluster mentioning sequential reflection across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_241148 ·

    新基准 RevPropBench 测试 LLM 在对话中的修订传播

    研究人员推出了 RevPropBench,这是一个旨在评估大型语言模型 (LLM) 在通过对话交互生成工件时的修订传播能力的新基准。该研究探索了测试时计算的经济高效方法,在 GPT OSS 20B、GPT-OSS 120B、GPT 5.4 Mini 以及各种 Qwen3.5 模型上测试了九种不同的修订技术。结果表明,基线方法的准确率在 68.3% 到 93% 之间,从三个选项中并行采样被证明是最具成本效益的方法,准确率提高了 9.7%。