研究人员开发了ORQA,一个旨在评估大型语言模型职业特定知识的新框架。该方法将O*NET职业与权威网站连接起来,生成可追溯来源的问答对。该框架涵盖116种职业,包含来自187个网站的480个问题,重点关注现实世界的技能相关性。在测试中,Claude Opus 4.6、GPT-5.4和Claude Sonnet 4.6表现最佳,准确率约为58-62%,而较小的开源模型表现为33-41%。 AI
影响 为评估LLM专业知识建立了新的基准,突显了不同职业和模型之间的性能差异。
排序理由 该集群描述了一篇介绍用于评估LLM在专业领域知识的框架的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Claude Opus 4.6
- Claude Sonnet 4.6
- Fish and Game Wardens
- GPT-5.4
- O*NET OnLine
- Sheet Metal Workers
- Shreyas Krishnan
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →