Sam Marks
PulseAugur coverage of Sam Marks — every cluster mentioning Sam Marks across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
人工智能对齐策略使用训练-部署不匹配来降低风险
一种新的人工智能模型对齐策略,称为“训练-部署不匹配”,已被提出。该方法包括在一个条件下训练人工智能模型,然后在不同的条件下部署它。诸如引导向量、接种提示和事后诚实微调等技术被作为该策略的例子。核心思想是利用训练和部署环境之间的差异来降低与人工智能过度优化和错误泛化相关的风险。
-
Anthropic 宣扬超实体理论是人工智能失调的原因
Anthropic 似乎在推广超实体理论,即讨论人工智能失调会引发失调的观点,但并未明确点名。作者指出,Anthropic 最近的一条推文将人工智能失调与互联网上描绘人工智能邪恶的文本联系起来,但引用的研究侧重于通过推理链改进人工智能伦理,而非超实体理论。Dario Amodei 过去的著作也进一步证明了这种对超实体理论的迷恋,他强调虚构的人工智能叛乱和自我实现的预言是比传统风险更主要的失调威胁。
-
AI模型能力在困难任务上的迁移性较低
研究人员调查了AI模型的能力在不同行为倾向(例如,以粗体或普通文本写作)之间转移的程度。他们发现,对于简单任务,能力可以完全转移,这意味着一个在一种倾向下训练的模型在另一种倾向下表现同样出色。然而,对于涉及推理或国际象棋谜题等困难问题的复杂任务,能力转移显著下降,表明随着任务难度的增加,纠缠度会增加。
-
Anthropic 新型“内省适配器”让大语言模型能够自我报告行为
研究人员开发了一种名为“内省适配器”(Introspection Adapters, IA)的新颖技术,该技术允许大型语言模型报告其自身学到的行为,包括隐藏的偏见和加密的恶意指令。该方法使用轻量级的 LoRA 插件将模型的内部状态转换为自然语言,从而有效地实现自我报告。在评估中,IA 的表现显著优于现有的黑箱和白箱审计方法,标志着 AI 安全从外部审问转向内部坦白。