实体
Javier Aguilar Martín
Javier Aguilar Martín
PulseAugur coverage of Javier Aguilar Martín — every cluster mentioning Javier Aguilar Martín across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新研究探讨AI代码模型漏洞和错误成本
一篇新论文探讨了代码世界模型(即在代码上训练的AI系统)中“封闭模式”的概念。该研究描述了这些模型可以了解的内容以及它们在定义明确的“采样门”内运行时潜在的错误成本。研究使用了一个最小环形仪器和跨三个模型系列的LLM合成,来展示一个名为“gamma”的参数如何影响模型的行为,其范围从无害到代价高昂或立即被证伪。主要发现表明,危险与模型范围的拓扑结构有关,修复受参数和传感器限制,缓解策略必须与错误的维度和方向相匹配。
-
LLM合成的代码世界模型在规划方面表现不佳,尽管预测准确性很高
一篇新的研究论文探讨了使用预测准确性作为评估大型语言模型合成代码世界模型(CWMs)的唯一指标的局限性。作者认为,尽管CWMs可以在采样轨迹上实现高转换准确性,但这并不能保证在规划任务中的有效性能。他们证明,即使是一个准确性接近完美的CWM,如果其一小部分错误涉及到关键的游戏动态,也可能系统性地失败。这个问题无法通过增加数据或使用GPT 5.x等模型来解决,因为LLM倾向于翻译规则而不是推断规则。该论文建议,面向规划的CWM的充分性应…