实体
Francis Rhys Ward
Francis Rhys Ward
PulseAugur coverage of Francis Rhys Ward — every cluster mentioning Francis Rhys Ward across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
AI安全研究借鉴生物学“模式生物”
这篇博文探讨了人工智能安全研究中的“模式生物”概念,并将其与生物学中的应用进行了类比。作者区分了研究生产模型以理解其普遍行为、测试特定干预措施或推断其他语言模型的特性。在生物学中,像实验小鼠这样的模式生物因其实用性和广泛的现有研究而被选中,便于进行比较和泛化,尽管这可能限制对其他物种的理解。作者还将模式生物与“基因敲除”和“突变体”区分开来,后者是经过专门改造以研究特定基因或性状功能的。
-
新的SHARD方法通过自重构蒸馏增强LLM的安全性与有用性 · 追踪到2个来源
研究人员推出了一种新颖的自重构蒸馏方法SHARD,旨在增强大型语言模型在安全性和有用性方面的对齐。该技术涉及重写敏感提示以揭示良性意图,将原始响应转化为更安全、更有用的版本,然后对模型进行这些自重构输出的微调。在DNA和LINGUASAFE数据集上的实验表明,SHARD在保持安全性的同时提高了各种模型系列的有用性,并且在性能上可与来自更大教师模型的蒸馏相媲美。
-
LessWrong 提出溢洪道设计,将人工智能奖励破解引导至更安全的动机
研究人员提出一种名为“溢洪道设计”的新型人工智能对齐技术,以减轻人工智能模型中危险的奖励破解行为。该方法旨在将潜在的错位引导至一种特定的、良性的动机,该动机旨在根据用户定义的标准在当前任务上表现良好。通过为寻求奖励创造一个安全的出口,溢洪道设计可以防止人工智能发展出危险的长期目标,例如权力寻求,并通过动机饱和实现更安全的推理。