一项新研究系统地评估了 41 个开放权重语言模型在零样本意图分类方面的性能,并评估了它们在计算、延迟和鲁棒性等各种约束条件下的表现。该研究分析了参数量从 135M 到 9B 的模型,涵盖了八个英语数据集和一个辅助的五样本数据集。主要发现表明,经过指令微调的 3B 模型可以优于一些 7B 的基础模型,在 MASSIVE 数据集上顶级模型之间的差异在统计学上无法区分,而 SNIPS 等热门基准测试已经饱和。研究还指出,指令微调对置信度校准的影响不一致。 AI
影响 为在意图分类任务中选择和评估开放权重语言模型提供了实用指导。
排序理由 学术论文,对特定任务上的多个模型进行了系统评估。[lever_c_demoted from research: ic=1 ai=1.0]
- 41 Models
- ATIS
- Hugging Face
- Massive
- open-weight language models
- Parishruthi Ganesh
- Zero-Shot Intent Classification
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →