Google DeepMind 开发了一种新颖的方法来对先进的 AI 模型进行双盲评估,以防止 AI 代理或开发人员作弊。该方法利用 Google Cloud 的 Confidential Computing 创建一个安全环境,其中测试提示和模型权重均不向任何一方透露。该试点项目与新加坡 AI Laboratory 和 MLCommons 等合作伙伴合作,旨在确保 AI 模型性能评估的完整性和可信度。 AI
影响 增强了对 AI 基准测试的信任,可能加速经过验证模型的采用。
排序理由 该集群描述了一个主要 AI 实验室开发的新 AI 模型评估方法,并将其作为一个试点项目进行介绍。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — sigmoid.social 阅读 →
- Confidential Computing
- Gemini 2.5 Flash Lite
- Google Cloud
- Google DeepMind
- MLCommons
- OpenMined
- Singapore AI Laboratory
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →