PulseAugur
实时 06:48:20
English(EN) Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

大语言模型根据警方叙述对事故编码准确性进行基准测试

一项新研究对六个前沿大语言模型(LLMs)从警方叙述中提取结构化事故数据的能力进行了基准测试,并将其性能与官方事故编码进行了比较。该研究使用了来自阿肯色州的 5,587 份致命事故叙述,发现虽然 GPT-5.5 High 在大语言模型中显示出最高的同意率,但简单的总是多数基线达到了更好的原始同意率。在不同事故属性上的性能差异很大,与非机动车关系和事故方式比光照条件或路面状况更容易编码。研究表明,应根据属性特定基础和透明基线以及人工审查来评估大语言模型在事故编码中的部署。 AI

影响 为大语言模型从非结构化文本中提取结构化数据的性能提供了基准,适用于交通安全和数据分析领域的应用。

排序理由 学术论文,展示大语言模型在特定任务上的基准测试结果。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

大语言模型根据警方叙述对事故编码准确性进行基准测试

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Sudhir Bharati, Rajendra K C Khatri, Sudip Bharati ·

    使用警方事故叙述对标官方事故数据库编码的前沿大型语言模型

    arXiv:2607.29064v1 Announce Type: cross Abstract: Police crash narratives contain information that may supplement structured crash databases, but manual review is labor-intensive and it remains unclear how well large language models (LLMs) reproduce official crash coding. This st…