PulseAugur
中
实时 00:05:28
实体 safety

safety

PulseAugur coverage of safety — every cluster mentioning safety across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 13
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. COMMENTARY · CL_269856 ·

    AI 灾难警告促使人们更加关注 AI 风险与安全

    人们对人工智能潜在的负面影响的担忧日益增加,导致了更多关于 AI 风险的讨论和研究。这种日益增长的认识促使 AI 开发社区更加关注安全措施和伦理考量。

  2. MEME · CL_261177 ·

    AI被提议为解决无家可归、气候和安全问题的方案

    一位Mastodon用户倡导使用AI解决方案来解决无家可归、气候变化和安全问题。该帖子重点介绍了一个视频,并建议开源太阳能可以成为AI驱动解决方案的一部分。

  3. COMMENTARY · CL_222035 ·

    加拿大的人工智能警务侵蚀公众信任,引发隐私担忧

    人工智能警务方法正在侵蚀加拿大公众对执法部门的信任。人们对这些技术可能损害隐私和安全的担忧正在浮现。人工智能在警务中的使用引发了关于其对司法和公众对当局信心的影响的重大伦理问题。

  4. TOOL · CL_216438 ·

    LLM评估:方法与指标的全面回顾

    本文全面回顾了大型语言模型(LLM)的评估,涵盖了关键概念和方法。它强调了各种评估指标和方法的重要性,包括基准测试、数据集和人工评估。文章强调了需要强大的评估框架来确保模型的性能、准确性、安全性和公正性。

  5. TOOL · CL_214084 ·

    审查发现美国放射学中的基础模型缺乏验证和安全性

    一项审查美国放射学中基础模型的叙述性综述,发现了其验证和安全协议方面的重大不足。该研究强调需要更严格的测试,以确保这些模型在临床上具有实用性和安全性,从而保障患者护理。

  6. TOOL · CL_212075 ·

    新方法优化 LLM 评估小组以提高效率和准确性

    一篇新的研究论文提出了一种优化大型语言模型(LLM)评估小组选择和部署的方法。该方法将评判小组设计为一个条件化角色分配问题,根据审计集和成本估算不同评判员的目标相对角色。这形成了一个策略,规定何时删除冗余评判员、添加互补评判员、有条件地路由专家,以及在验证收益减少时停止流程。该方法在推理、代码、安全和数学等多个领域进行了测试,证明了其在创建 LLM 评估的可重用和可审计调用计划方面的有效性。

  7. COMMENTARY · CL_197122 ·

    在追求通用人工智能(AGI)之际,OpenAI 流失 3 位关键人工智能安全领域领导者

    在最近几周内,三位杰出的人工智能安全领域领导者离开了 OpenAI,这引发了人们对该公司在追求通用人工智能(AGI)过程中对安全承诺的担忧。Superalignment 团队的联合负责人 Jan Leike 辞职,他表示“安全与功能和产品之间的文化”以及安全考虑常常被快速开发所忽视。他的离职紧随 OpenAI 前首席科学家兼联合创始人 Ilya Sutskever 之后,以及著名人工智能研究员 Geoffrey Hinton(他离开 …

  8. SIGNIFICANT · CL_173232 ·

    Google 发布 Gemini Robotics 2.0,提升灵活性和安全性

    Google 发布了 Gemini Robotics 2.0,这是其人工智能驱动的机器人计划的又一进展。新版本专注于提高机器人的灵活性和安全性。该开发旨在使机器人能够以更高的精度执行更复杂的物理任务,并降低事故风险。

  9. RESEARCH · CL_143331 ·

    研究:训练时长影响大型语言模型合并效果

    一篇新的研究论文探讨了专家训练时长对将多个专家模型合并成一个更强大的大型语言模型的效果的影响。该研究挑战了在模型达到最佳验证损失时进行合并的标准做法,发现某些合并方法,特别是基于稀疏化的方法,在专家训练超出此点后表现更好。这表明应联合考虑训练时长和合并方法的选择以获得最佳结果,这与随机森林中高方差学习者的益处有相似之处。

  10. RESEARCH · CL_135184 ·

    MAESTRO框架通过模拟专家依赖性来改进MoE模型剪枝

    研究人员开发了MAESTRO,一个新颖的结构化剪枝框架,旨在解决Mixture-of-Experts (MoE)语言模型的部署瓶颈。与使用局部启发式方法的先前技术不同,MAESTRO将专家激活轨迹建模为马尔可夫链,以捕捉跨层依赖性,提供全局感知的关键度启发式。该方法显著提高了性能保持率,在50%压缩机制下,性能优于现有方法高达10.61%,并在安全、偏见和伦理等多样化任务中展现出更一致的泛化能力。

  11. TOOL · CL_129619 ·

    新的Sentinel管道审计AI代理MCP服务器的安全风险

    一个名为Sentinel的新审计管道已被开发出来,用于保护模型上下文协议(MCP)服务器,这些服务器允许AI代理与外部工具进行交互。该管道采用六层方法,首先对源代码进行静态分析,检查已知漏洞、许可证合规性和硬编码的秘密。然后进行基于模式的行为分析和一个主动探测,发送对抗性输入以检测潜在的数据泄露、命令注入或SSRF漏洞。最后,它利用gVisor沙箱将MCP服务器与主机内核隔离,防止内核级别的攻击。

  12. RESEARCH · CL_128998 ·

    稀疏自编码器:AI可解释性的希望与陷阱

    研究人员正在探索稀疏自编码器(SAE)用于机制可解释性,旨在揭示大型语言模型中的不同概念。一种新方法,结构化稀疏自编码器($S^2AE$),通过对图像块进行分组并应用结构化稀疏正则化,提高了视觉-语言模型中的概念一致性。另一项研究强调了正确设置SAE中L0超参数的关键重要性,因为不正确的值可能导致特征无法解开底层模型概念。此外,一篇观点论文认为,虽然SAE可能在已知概念方面遇到困难,但它们在发现未知概念方面非常强大,在公平性、安全性和…

  13. RESEARCH · CL_117429 ·

    新的自动驾驶模型使用世界模型进行更安全、更鲁棒的规划 · 跟踪 2 个来源

    两篇新的研究论文介绍了用于端到端自动驾驶的先进世界建模技术。OWMDrive 专注于 4D 占用世界模型,用于多步 3D 占用预测,以指导基于扩散的规划,旨在实现更具前瞻性和鲁棒性的轨迹生成,尤其是在挑战性场景中。ExploreVLA 将世界建模与强化学习相结合,以实现超越专家演示的策略探索,使用未来图像生成作为密集世界建模目标和新颖性检测的内在奖励信号。

  14. COMMENTARY · CL_109129 ·

    OpenAI 的人工智能垄断地位受到内部纷争和竞争的威胁

    一篇 Reddit 帖子讨论了 OpenAI 可能因内部问题和竞争而失去其人工智能垄断地位。该帖子强调了对公司方向的担忧,提到了 Jan Leike 和 Ilya Sutskever 等关键人物的离职,并将 OpenAI 的状况与 Microsoft 和 Google 等竞争对手进行了对比。帖子认为,内部冲突和对安全优先事项的偏离可能会损害 OpenAI 的领先地位。