PulseAugur
实时 04:20:30
实体 Rohin Shah

Rohin Shah

PulseAugur coverage of Rohin Shah — every cluster mentioning Rohin Shah across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_112319 ·

    Google DeepMind 资助研究 AI 智能体交互风险

    Google DeepMind 正在投资研究,以了解大规模 AI 智能体交互相关的风险。该公司 AGI 安全与对齐研究负责人 Rohin Shah 强调了对智能体自主运行以及接收其他智能体指令的担忧,这带来了新的安全挑战。

  2. RESEARCH · CL_99942 ·

    DiffusionGemma 透明度审计发现其与 Gemma 相当,但有例外

    一篇新论文研究了文本扩散模型 DiffusionGemma 的透明度,并将其与自回归模型 Gemma 进行了比较。研究人员发现,虽然 DiffusionGemma 最初由于较大的不透明串行深度而显得透明度较低,但应用诸如 logit lens 等技术到中间向量可以使这种差异与 Gemma 相当。然而,该论文区分了可变透明度(理解计算快照)和算法透明度(重构推理过程),并指出由于其非顺序生成过程,扩散模型固有的算法透明度低于自回归模型。…

  3. SIGNIFICANT · CL_98774 ·

    Google DeepMind 将 AI 代理视为内部威胁,发布新安全路线图

    Google DeepMind 正在为其 AI 代理实施一项新的安全策略,将其视为潜在的内部威胁,而不是仅仅关注对齐问题。这种方法借鉴了传统网络安全,建立了分层安全措施和动态访问控制。该公司对一百万个编码任务的分析显示,大多数问题源于过于积极的代理,而非恶意意图,这凸显了进行强大监控和实时干预的必要性。

  4. SIGNIFICANT · CL_85332 ·

    Google DeepMind 资助 1000 万美元研究多智能体 AI 安全风险

    Google DeepMind 将拨款 1000 万美元,资助对多智能体 AI 系统带来的安全风险的研究。该公司担心,随着数百万个 AI 智能体开始在没有直接人类监督的情况下进行交互,可能会出现复杂的诈骗和网络攻击等新危险。该计划旨在为多智能体安全建立一个专门的研究领域,鼓励学术研究在潜在的负面后果变得普遍之前进行预测和缓解。

  5. COMMENTARY · CL_67085 ·

    Google DeepMind 的 AGI 安全主管对灾难性失调表示怀疑

    Google DeepMind 的 AGI 安全与对齐主管 Rohin Shah 认为,灾难性 AI 失调是可能发生的,但并非默认就会发生。他认为,当前专注于短期奖励的 AI 训练方法,并不会自然地导向实现“接管世界”所需的长远目标。Shah 建议,许多潜在的对齐问题将提前显现,从而可以进行迭代式解决,并且研究重点应从部署前评估转向实际研究和 AI 治理基础设施。