AVERI、Google DeepMind、OpenMined 和 MLCommons 之间的一项重要合作促成了首次对专有语言模型进行的双盲评估。这一里程碑式的事件涉及技术和制度创新,以确保恰当的AI治理。此次评估专门测试了 Google DeepMind 的 Gemini 2.5 Flash-Lite 模型。 AI
影响 此次评估为专有AI模型的严格、无偏见的测试树立了先例,并可能影响未来的AI安全和治理标准。
排序理由 该集群描述了首次对专有语言模型进行的双盲评估,这是一个研究里程碑。[lever_c_demoted from research: ic=1 ai=1.0]
在 X — Miles Brundage (AGI policy) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →