研究人员开发了DARKSIDE,一种通过形式化排除项链并对指代对象进行分类来审计大型语言模型(LLM)连贯性的新方法。该方法旨在防止LLM将无意义的输入具象化到其输出中。DARKSIDE通过创建累积排除项的显式数据结构和一个分类命名指代对象为“有保证”、“未证实”、“误归属”或“捏造”的保函轴,并设置升级规则来标记不安全输出。 AI
影响 该方法可以通过识别和标记无意义或捏造的信息来提高LLM输出的可靠性。
排序理由 该集群包含一篇详细介绍LLM连贯性审计新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →