研究人员推出了 RevPropBench,这是一个旨在评估大型语言模型 (LLM) 在通过对话交互生成工件时的修订传播能力的新基准。该研究探索了测试时计算的经济高效方法,在 GPT OSS 20B、GPT-OSS 120B、GPT 5.4 Mini 以及各种 Qwen3.5 模型上测试了九种不同的修订技术。结果表明,基线方法的准确率在 68.3% 到 93% 之间,从三个选项中并行采样被证明是最具成本效益的方法,准确率提高了 9.7%。 AI
影响 该基准可能会带来更强大的 LLM 工件生成和对话式人工智能系统中的修订能力。
排序理由 该集群包含一篇介绍 LLM 能力评估新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- arXiv
- GPT 5.4 Mini
- GPT OSS 120B
- GPT OSS 20B
- Hugging Face
- JSON
- large-language models
- Qwen3.5-122B
- Qwen3.5-27B
- Qwen3.5:9b
- RevPropBench
- sequential reflection
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →