一项通过单词长度编码句子的艺术项目揭示,大型语言模型(LLM)不一定能从这些编码消息中恢复预期的含义。与最初的假设相反,对同一编码消息的独立解读显示出高于随机的同意度,但这种同意度并不高于对不同消息的解读。该实验强调了在衡量模型同意度时,基线可能产生误导的三种方式,尤其是在依赖自洽性或多数投票集合的流程中。 AI
影响 表明 LLM 的解读可能更多地是关于投射和偏见,而不是真正理解编码信息。
排序理由 该条目讨论了一项关于 LLM 行为和同意度的实验,属于对 AI 能力的评论,而不是直接的发布或研究里程碑。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →