对49个运营来源的调查显示,在欺诈检测和信任与安全工作流中部署大型语言模型(LLMs)的证据存在显著差距。尽管LLMs越来越多地被提议用于这些任务,但现有文献大多侧重于模型性能,而非延迟、成本和对抗性风险等实际运营限制。这项调查对欺诈检测、调查支持和内容审核的来源进行了编码,发现与欺诈相关的论文通常报告的是离线任务性能,而不是至关重要的每次决策指标。为了解决这个问题,该研究引入了FORTE,一个用于组织LLMs在这些工作流中角色的框架,以及一个最低部署证据清单,以指导未来为实现LLMs的稳健集成所需的研究。 AI
影响 强调了在敏感运营工作流中部署LLMs的关键证据差距,指导未来研究关注实际部署考量。
排序理由 该项目是一篇调查论文,分析了现有研究并确定了LLM部署的证据差距。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →