Gemini Live
PulseAugur coverage of Gemini Live — every cluster mentioning Gemini Live across labs, papers, and developer communities, ranked by signal.
- 2026-07-24 product_launch Gemini Live is reportedly developing a feature to allow direct file uploads into conversations. 来源
- 2026-07-23 product_launch Google Gemini Live is being expanded to older smart speakers and displays. 来源
- 2026-07-22 product_launch Gemini Live has been updated to include camera-based assistance for real-world objects and screens. 来源
- 2026-07-06 product_launch Gemini Live is reportedly developing a push-to-talk feature. 来源
- 2026-06-20 product_launch Google DeepMind introduced a new "Voice Selection" shortcut for Gemini Live. 来源
- 2026-06-19 product_launch Gemini Live received a memory upgrade to recall past chats and personalize responses. 来源
- 2026-06-17 product_launch Google updated the Gemini Live interface with a new Neural Expressive design. 来源
- 2026-06-16 product_launch Google DeepMind introduced a new "Voice Selection" shortcut for Gemini Live and opened applications for the "Gemini App Trusted Tester Program." 来源
- 2026-05-15 product_launch Google is testing a new interactive UI for Gemini Live. 来源
- 2026-05-09 product_launch Google is testing multiple new AI models for its Gemini Live voice assistant. 来源
6 天有情绪数据
Gemini Live's interactive UI is in experimental phase
Google is actively testing an interactive UI for Gemini Live that responds visually to user input. This indicates a focus on enhancing user engagement and a current experimental stage for this feature.
Gemini Live to offer selectable AI models for users
Google is testing multiple Gemini Live AI models with varied capabilities. This suggests a future where users might be able to select different models for Gemini Live, potentially optimizing for speed, thoughtfulness, or specific features like location awareness.
Gemini Live voice replication capabilities may face legal challenges
A lawsuit has been filed against Google alleging misuse of voice recordings to train AI models, including those powering Gemini Live. This could lead to potential restrictions or changes in how Gemini Live replicates voices.
-
Google Gemini 推出 AI 驱动的学习工具专属学生中心
Google 正在推出其 Gemini AI 内的一个新的学生中心,旨在协助完成学业任务。该中心将允许学生创建学习笔记、生成抽认卡和进行测验,并增强对图像和图表的支持。此外,Gemini 可以将考试日期和截止日期集成到 Google Calendar 中,并利用 Google Lens 帮助解决复杂主题。符合条件的美国学生可以免费获得一年的 Google AI Pro,提供扩展存储空间和更高的 Gemini 使用限制,而其他地区的学生…
-
OpenAI实时API的替代方案涌现,适用于生产级语音代理
OpenAI的实时API虽然对语音应用的快速原型开发很有用,但在生产环境中由于成本不可预测、转录不准确以及对话流程问题,会带来挑战。AssemblyAI的Voice Agent API和Google的Gemini Live等替代方案为2026年提供了更强大的解决方案。与OpenAI的单一模型方法相比,这些替代方案通常利用专门的模型来处理不同任务,提供更好的准确性和更可预测的定价结构。
-
Gemini和ChatGPT用户均突破10亿,AI竞赛加剧
Google的Gemini月活跃用户已突破10亿,成为达到此里程碑增长最快的Google产品。这一成就使Gemini在用户规模上与近期也突破10亿用户的OpenAI的ChatGPT处于同一水平,尽管衡量标准不同(周活跃 vs. 月活跃)。虽然Gemini整合到各种Google服务中促进了其普及,但10亿用户数据仅计算直接应用和网页界面的使用量。
-
PolyAI 发布 Dialog-RSN-1 原生音频对话模型
PolyAI 发布了 Dialog-RSN-1,这是一款原生音频对话模型,可直接处理原始音频输入,无需转录。该模型将轮次切换、语音识别、函数调用和响应生成整合到一个系统中,目标响应时间低于 300 毫秒。虽然目前仅支持英语,并且仅通过 PolyAI 的平台提供,但它已在企业客户的实时生产通话中部署。
-
Gemini Live 和 Circle to Search 将获得新动画
谷歌的 Gemini Live 和 Circle to Search 功能可能很快会获得增强的动画效果。此次更新旨在通过为这些现有功能增添视觉吸引力来改善用户体验。动画的具体细节或发布时间表尚未披露。
-
人工智能将博物馆参观转变为个性化学习体验
Gemini Live和ChatGPT等人工智能工具现在可以充当个人博物馆导览,通过照片分析提供展品的即时解释和背景信息。用户可以将手机对准文物、艺术品或历史陈列品,询问其来源、含义或与其他展品的联系。这项技术改变了博物馆的参观体验,使其对没有专业知识的人来说更易于接触和参与,有效地充当了数字语音导览。
-
Gemini Live 将集成文件上传功能,实现直接聊天互动
据报道,Google 的 Gemini Live 正在开发一项功能,允许用户直接将文件上传到对话中。这项新功能旨在通过使用户无需先描述文件即可共享文档或图像,从而简化交互。该集成有望通过使 Gemini Live 更具交互性和效率来增强用户体验。
-
Google Gemini Live 扩展到更老的智能音箱和显示屏
Google 正在将其 Gemini Live 对话式 AI 扩展到更老的智能家居设备,包括第一代 Google Home Mini 和 Nest Hub。此次扩展允许用户通过语音命令与这些旧设备上的 Gemini 进行交互,将先进的 AI 功能带入更广泛的 Google 硬件生态系统。
-
Gemini Live新增摄像头辅助功能,用于现实世界物体
Gemini Live已更新,包含基于摄像头的辅助功能,使用户能够获得现实世界物体和屏幕的帮助。此新功能对于解决错误代码或理解复杂手册等故障排除问题特别有用。此次更新旨在增强Gemini Live在日常场景中的实际应用。
-
AI语音模型演进以模仿人类对话,引发就业和意图问题
近期一档播客节目探讨了AI语音模型的进步,特别是ChatGPT的实时语音功能,强调了其进行更自然、更像人类对话的能力。与旧款语音助手不同,这些新模型直接处理音频,能够实现实时交互,并具备打断和对话跑题等功能。虽然AI现在可以模仿社交信号,例如为技术问题打掩护,但它仍然难以理解通过非语言线索传达的人类潜台词和情感。讨论还触及了伦理影响,包括AI取代人类工作的潜力,例如一位配音演员的工作被AI克隆所取代,并思考了AI未来产生自身意图的可能性。
-
Google 将 Gemini AI 集成扩展到 Chrome 和 Android
Google 正在将 Gemini AI 的集成扩展到各种平台,包括桌面和 Android 设备上的 Chrome 浏览器。该 AI 被整合到 Chrome 的 AI 模式和概览中,并将成为 Android 手机的默认助手。此外,Gemini 在 Chrome 中获得了新的“技能”或自动化功能,其中一些以前是高级计划的一部分。
-
GPT-Live 成为 ChatGPT 竞争对手,支持连续对话
一款名为 GPT-Live 的新 AI 模型已被开发出来,作为 Gemini Live 的竞争对手,旨在增强 ChatGPT 的对话能力。该模型设计为在处理信息时能够继续说话,这一功能使其区别于之前的版本。此外,GPT-Live 还将为 ChatGPT 现有的语音模式引入视觉响应和改进的语音质量。
-
Gemini Live 准备推出对讲机模式以增强用户控制
据报道,谷歌正在为 Gemini Live 开发一种按键通话功能,旨在让用户更好地控制 AI 的音频输入。这种类似 walkie-talkie 的模式将允许用户仅在打算与 AI 互动时激活 Gemini 的收听功能。
-
Google Home 智能音箱发布,集成 Gemini AI
Google 发布了一款新的 Google Home 智能音箱,旨在集成其 Gemini AI 功能,以提供更具对话性的智能家居体验。该音箱采用熟悉的設計,配备更新的硬件,包括 USB-C 供电和动态 LED 状态环,并为 Gemini 提供改进的设备端处理。它附带六个月的 Gemini Live 试用期,该试用期还启用了高级智能家居安全功能。
-
AI 普通话语音教练 ChiChat 使用 Gemini Live 进行任务驱动场景
开源 AI 普通话语音教练 ChiChat 的开发者详细介绍了其创建和功能。ChiChat 旨在通过提供具有 AI NPC 的任务驱动式口语场景来解决现有语言学习应用的局限性。该系统利用 Gemini Live 进行语音转文本、语言模型处理和文本转语音,为用户提供单词级别的发音评分、AI 教练反馈和有针对性的练习。
-
Google DeepMind 为 Gemini Live 新增“语音选择”快捷方式
Google DeepMind 为 Gemini Live 推出了一项新的“语音选择”快捷方式,该功能与 Jetstream 集成。此次更新旨在增强 Gemini Live 平台内的用户交互和可访问性。
-
Gemini Live 获得记忆回忆功能,实现个性化聊天体验
谷歌的 Gemini Live 已更新,包含一项记忆功能,允许 AI 回忆过去的对话并相应地调整其回应。此项增强旨在为用户提供更个性化的 AI 互动。
-
Google 彻底改版 Gemini Live,推出全新视觉界面
Google 更新了其 Gemini Live 界面,采用了新的 Neural Expressive 设计,优先考虑视觉内容和即时响应显示。这次改版放弃了之前以语音为主的全屏体验,转向一种更集成的模式,语音、生成的图像以及其他 AI 输出会与对话一起显示在屏幕上。更新允许用户在不结束聊天的情况下与 Gemini 的响应进行交互和导出,包括通过 Nano Banana 2 等工具生成的图像,使其成为日常使用更实用的工具。
-
Google 发布搭载 Gemini 的 Home Speaker,支持 360 度音频
Google 将于 6 月 25 日推出其六年来的首款全新智能音箱 Google Home Speaker。该设备专为增强 Gemini for Home 体验而设计,通过本地模型处理提供更自然的对话交互和改进的指令识别。该音箱还拥有 360 度音效、Matter 控制器功能和 Thread 边界路由器功能,并提供包含六个月 Google Home Premium 的 introductory offer。
-
Google DeepMind 推出 Gemini Live 新快捷方式和测试者计划
Google DeepMind 为 Gemini Live 引入了新的“语音选择”快捷方式,增强了用户与 AI 助手的交互。此外,该公司已开放“Gemini App Trusted Tester Program”的申请,标志着其 Gemini 平台的进一步开发和用户反馈计划。