一项基准挑战提交评估了大型语言模型在用户使用不同语言的软件文档时,翻译界面标签的效果。研究发现,模型经常返回错误语言版本的标签,其中英文页面问题最为突出。然而,GPT-6 Astra和Claude Opus-5等特定模型表现更强,并且对系统提示进行微小调整显著提高了Gemini Flash的准确性。 AI
影响 凸显了多语言AI应用的关键可用性问题,可能影响用户体验和采用率。
排序理由 该项目描述了一个基准测试及其评估大型语言模型在特定任务上性能的结果。[lever_c_demoted from research: ic=1 ai=1.0]
- AI Extension Builder
- Claude Opus-5
- Gemini Flash
- GoodBarber
- GPT-5.5
- GPT-6 Astra
- Kaggle
- MTM-Bench
- Qwen3 235B
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →