一篇新研究论文提出,像ChatGPT这样的大型语言模型中不希望出现的行为,例如生成有害或重复内容,可以被理解为一种“多体临界动力学”。该研究表明,这些临界点源于确定性解码过程中代币之间的复杂相互作用,导致在竞争性输出盆地之间发生“首次通过过程”。研究人员认为,这种行为代表了一种可预见的工程风险,而非不可预测的AI故障,这对AI危害的法律和社会评估方式产生了重大影响。 AI
影响 提出了一个理解和潜在缓解LLM中可预测故障的框架,影响AI安全和法律评估。
排序理由 关于AI行为和安全的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →