PulseAugur
实时 07:05:26
实体 Apoorva Upadhyaya

Apoorva Upadhyaya

PulseAugur coverage of Apoorva Upadhyaya — every cluster mentioning Apoorva Upadhyaya across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_229091 ·

    新研究揭示大型语言模型中安全特性与语言同一性纠缠

    一篇新发表在arXiv上的研究论文探讨了大型语言模型(LLMs)中安全特性与语言同一性的纠缠。研究表明,大型语言模型的安全对齐在不同语言之间会退化,并且这种不对称性是由内部机制驱动的,其中与安全相关的特性在几何上与语言同一性纠缠在一起。该研究分析了八种语言的三个指令调优的大型语言模型,发现消除安全特性不仅影响有害响应率,还影响目标语言,干预的程度可以通过安全-语言特性关系来预测。这些发现表明,安全对齐的语言普适性依赖于模型架构。