Gemini Audio
PulseAugur coverage of Gemini Audio — every cluster mentioning Gemini Audio across labs, papers, and developer communities, ranked by signal.
-
Google为Gmail、Docs和Keep推出AI语音功能
Google已正式为其Google AI订阅用户推出了名为Gmail Live、Docs Live和Keep Live的AI语音功能。这些功能最初在Google I/O 2026上预览,允许用户使用自然语言语音命令与他们的电子邮件、文档和笔记进行交互。Gmail Live可以搜索电子邮件并回答后续问题,Docs Live通过从各种来源提取信息来协助起草和构建文档,Keep Live则有助于将想法整理成列表和笔记。这些功能的可用性因订阅…
-
Google 的 Gemini 3.5 Transcribe 通过多语言支持增强语音转文本功能
Google 推出了 Gemini 3.5 Transcribe,这是一款先进的 AI 音频模型,旨在改进语音识别和转录。该新模型可以将非结构化语音转换为格式化文本,自动检测超过 85 种语言,并准确地将语音归属给最多三位说话者,并提供词级时间戳。Gemini 3.5 Transcribe 还可以学习自定义词汇和独特拼写,并将很快集成到 Chrome 中,用于任何网页字段,使用户能够通过语音命令进行回复和提示 Gemini。
-
Google 更新 Gemini 音频转录功能;Meta 解决儿童成瘾索赔
Google 通过新的 Gemini 3.5 模型增强了其 Gemini 音频转录功能,该模型现在可以识别专业术语并支持超过 85 种语言。此次更新包括 Gemini 3.5 Live,提供先进的实时转录功能。另外,Meta 将与美国大多数州达成和解,赔偿金额高达 180 亿美元,并将对 Facebook 和 Instagram 进行重大更改,以解决有关儿童成瘾和用户欺骗的问题。
-
Google Gemini 3.5 增强音频转录功能,可移除填充词
Google 已更新其 Gemini 音频模型,加入了 Gemini 3.5 的功能,提高了 85 多种语言和专业术语的转录准确性。新的 Gemini 3.5 Transcribe 模型可自动移除“嗯”和“啊”等填充词,格式化文本,并可适应自定义词汇。此次更新还包括 Gemini 3.5 Live 和 Live Experimental,用于改进语音聊天和复杂任务的实时叙述。这些功能正在向 macOS Gemini 应用用户、Andr…
-
Google Vids 通过更多定制和动作增强 AI 头像
Google Vids 已显著增强了其面向 Workspace 用户的 AI 头像功能,将预设头像库从 23 个扩展到 53 个,并增加了对 16 种新语言的支持,总数达到 24 种。此次更新还引入了使用 Nano Banana Pro 创建自定义头像的功能,并提供 30 多种不同的语音选项。一项关键的新功能允许用户通过文本提示来指挥头像,使其能够执行行走或与上传的图像进行交互等动作,从而使它们在生成的视频中成为更具动态性的叙事者。