研究人员推出了 FrenchNews-7,这是一个用于按编辑部对法国新闻文章进行分类的新基准测试。该基准测试结合了来自多个出版商的大量法国新闻语料库和一个源自 URL 的七类分类体系。经过微调的 CamemBERT 模型取得了最佳性能,优于仅使用标题的输入以及 GPT-OSS-120B、Mistral Small 3.2 和 Llama-3.3-70B Instruct 等零样本大型语言模型。研究发现,虽然“体育”和“国际”等类别可以可靠地分类,但“经济”和“社会”类别带来了挑战,这表明分类器性能的局限性,而不仅仅是编辑边界的模糊性。 AI
影响 为评估大型语言模型在法国新闻分类方面的性能建立了一个新基准,突出了当前模型在处理细微的编辑边界方面存在的困难。
排序理由 该集群描述了一篇介绍基准数据集和模型评估的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- CamemBERT
- CamemBERT-base
- FrenchNews-7
- GPT-OSS 120B
- Hugging Face
- Llama 3.3 70B Instruct
- Mistral Small 3.2
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →