Google DeepMind 已为其 Gemini 模型引入了代理式视频理解能力,使其能够更有效地分析视频。Gemini 现在可以跨越文本记录、音频和帧进行推理,动态调整帧率以定位关键时刻,而不是处理整个文件。此增强功能对于长格式内容尤其有益,使用的 token 数量最多可减少 88%,在处理时长较长的录制内容时效率提升最为显著。该功能将通过 Google AI Studio 中的 API 逐步推广到 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,并将很快在 Gemini 应用中提供。 AI
影响 提高了 AI 模型中视频分析的效率,有望降低长格式内容的成本并提高其性能。
排序理由 这是对现有模型的特性更新,并非新模型发布或重大的研究突破。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →