一篇新论文探讨了代码世界模型(即在代码上训练的AI系统)中“封闭模式”的概念。该研究描述了这些模型可以了解的内容以及它们在定义明确的“采样门”内运行时潜在的错误成本。研究使用了一个最小环形仪器和跨三个模型系列的LLM合成,来展示一个名为“gamma”的参数如何影响模型的行为,其范围从无害到代价高昂或立即被证伪。主要发现表明,危险与模型范围的拓扑结构有关,修复受参数和传感器限制,缓解策略必须与错误的维度和方向相匹配。 AI
影响 这项研究通过识别和减轻AI模型在理解代码方面潜在的漏洞,可能有助于构建更健壮、更安全的AI模型。
排序理由 学术论文发表在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →