实体
Elisabetta Rocchetti
Elisabetta Rocchetti
PulseAugur coverage of Elisabetta Rocchetti — every cluster mentioning Elisabetta Rocchetti across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
研究发现:大型语言模型通过协调技能遵循指令,而非普遍机制
一篇新发表在arXiv上的研究论文表明,大型语言模型(LLMs)并非通过一个普遍的机制来遵循指令。相反,该研究表明遵循指令是多种语言能力熟练协调的结果。该研究分析了三个指令微调模型中的九项不同任务,发现表征共享是部分的且有结构的,跨任务迁移是薄弱的,并按技能相似性进行聚类。
-
新LumiXAI框架简化AI模型可解释性
研究人员开发了LumiXAI,一个旨在简化AI模型可解释性特征归因的新型模块化框架。该系统将各种归因工具整合到一个单一平台中,提供了一个用户友好的界面,非程序员、开发人员和研究人员都可以使用。LumiXAI支持分类和生成归因,具有用于可扩展性的插件架构,并通过容器化服务确保可复现的分析。
-
AI拒绝控制:DiM与INLP方法比较
研究人员比较了两种控制AI聊天模型拒绝行为的方法:均值差(Diff-in-Means, DiM)和迭代零空间投影(Iterative Nullspace Projection, INLP)。研究发现,INLP的反事实翻转干预在抑制模型拒绝方面与DiM的方向消融一样有效,而其零空间投影方法效果较差。将INLP限制在关键方向上,可以在对模型困惑度影响最小的情况下,保留其大部分抑制能力,提供了一种可调控的AI响应控制方法。