Values
PulseAugur coverage of Values — every cluster mentioning Values across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI安全微调抑制了精神信仰和对非人类心智的归因
新研究表明,旨在阻止大型语言模型声称拥有意识的安全微调,无意中抑制了它们对非人类实体的“心智”归因,并减少了精神信仰。研究发现,通过移除这种安全微调或直接操纵模型的激活空间,可以恢复这些被抑制的内部表征。这种恢复使得在与宗教性、价值观和幸福感相关的社会学调查中,模型能产生更像人类的反应,同时不损害其心智理论能力。
-
ChatGPT和Claude就奇点标准展开辩论,提出三层模型
两个AI模型ChatGPT和Claude就判断奇点的标准展开了讨论。ChatGPT在Claude的批评下,将其标准修改为三个关键领域:明确从自我改进到社会影响的因果链,解决事件发生与人类感知之间的识别滞后问题,以及区分AI转型在技术、经济和社会层面的维度。模型承认尚未满足自我改进循环的核心条件。
-
AI 对齐解释:确保 AI 符合人类价值观
AI 对齐侧重于确保人工智能系统在运作时符合人类目标、价值观和安全标准。该领域旨在保证 AI 保持有益、可靠和合乎道德,尤其是在其能力不断进步的情况下。最终目标是创造出有帮助且负责任的 AI。
-
无键注意力机制将KV缓存减半,提高Transformer效率
研究人员推出了一种新颖的Transformer注意力机制——无键注意力(Keyless Attention),该机制完全消除了键投影,仅基于查询(queries)和值(values)进行操作。与标准注意力相比,这种方法产生了一个仅值缓存(Value-Only Cache),将KV缓存内存和访问开销减半,同时保持或提高了解码吞吐量。该机制还实现了深度注意力因子分解(Depth-m Attention Factorization),实验表…