开发了一个新的基准测试 MyanmarChemCalc-Bench,用于测试大型语言模型在英语和缅甸语化学计算方面的性能。该基准测试显示,尽管 Claude 等顶级模型取得了满分,但运行可靠性问题(如速率限制)可能会扭曲排行榜排名。初步研究表明,通过适当的数字格式化,当前的前沿模型在教科书式的化学问题上两种语言的表现相当。 AI
影响 表明前沿模型可以通过适当的提示工程来处理低资源语言的专业任务。
排序理由 针对特定领域任务的大型语言模型性能的新基准测试和评估。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →