ChatGPT Voice
PulseAugur coverage of ChatGPT Voice — every cluster mentioning ChatGPT Voice across labs, papers, and developer communities, ranked by signal.
- 2026-08-03 product_launch OpenAI has updated ChatGPT Voice with a new architecture for faster, more natural conversations. 来源
- 2026-07-23 product_launch OpenAI is expanding the availability of ChatGPT Voice to iOS devices via the Codex feature. 来源
- 2026-07-23 product_launch OpenAI launched the ChatGPT Voice feature within its desktop application, enabling voice control and multi-agent coordination. 来源
- 2026-07-23 product_launch OpenAI launched ChatGPT Voice integration into its desktop applications. 来源
- 2026-07-08 product_launch OpenAI announced the next generation of its ChatGPT Voice feature. 来源
4 天有情绪数据
-
OpenAI 的 GPT-Live 可实现全双工、无间断的 ChatGPT 语音对话
OpenAI 开发了 GPT-Live,这是 ChatGPT 的一项新语音基础设施,可实现全双工、无间断的对话。该系统允许 AI 同时收听和说话,消除了传统语音助手常见的尴尬停顿和中断。GPT-Live 将实时音频处理与网页搜索或工具调用等较慢任务分离开来,确保了更自然、更具响应性的对话体验。底层架构用 Go 重写,以提高延迟一致性,GPT-Live 负责管理语音交互,而其他模型则负责更深层次的推理。
-
AI语音应用获得溯源功能,可证明音频来源
随着AI语音应用融入各行各业,AI音频溯源正成为开发者日益关注的关键问题。挑战不仅在于创造逼真的合成语音,还在于证明其离开生成应用后的来源和完整性。OpenAI已将其SynthID水印扩展到ChatGPT Voice和OpenAI API的音频,而Google DeepMind也在研究和部署音频水印。一个强大的溯源工作流程需要的不仅仅是水印,还包括嵌入式信号、附加元数据以及日志和同意记录等操作证据,以确保生成的音频可验证、更难被滥用,…
-
OpenAI总裁Greg Brockman:打字是计算中的一个临时阶段
OpenAI押注语音是计算的未来接口,总裁Greg Brockman认为目前的点击和打字方法仅仅是一个临时阶段。该公司已将语音模型集成到ChatGPT中,旨在提高软件工程等任务的生产力。此举使OpenAI能够在不断发展的人机交互格局中与Anthropic和Google Gemini等竞争对手竞争,并可能挑战Apple和Amazon现有的智能家居设备。
-
OpenAI 增强 ChatGPT 语音功能,实现实时聆听和更快响应
OpenAI 通过重建其语音堆栈,增强了 ChatGPT 语音功能,使其能够进行更自然、更快速的对话。新架构允许系统在说话时进行聆听,通过专用快速通道处理音频以获得即时响应。更深层次的推理和工具使用是异步处理的,确保对话流畅不中断,并将启动时间从六次网络往返减少到一次。
-
OpenAI 将 ChatGPT 语音功能引入桌面应用,支持复杂指令
OpenAI 已将 ChatGPT 语音功能集成到桌面应用程序中,允许用户通过语音命令与 AI 进行交互。此次更新支持在电脑上执行更复杂的、多步骤的指令和任务,利用了最近推出的 ChatGPT-Live 语音模型。桌面版本相比其移动版本提供了增强的功能,包括控制 AI 代理、在应用程序内执行操作,甚至访问 macOS 上的屏幕内容。
-
Black Forest Labs 发布 FLUX 3 Video,性能超越 Gemini Omni 和 Grok Imagine
Black Forest Labs 发布了 FLUX 3 Video,这是一款多模态流模型,据称在视频生成能力方面超越了 Gemini Omni 和 Grok Imagine 等现有模型。该模型提供广泛的功能,包括文本到视频、图像到视频、视频到视频生成以及多语言对话,并计划推出开放权重开发者版本。此外,Black Forest Labs 还宣布了 FLUX3-mimic,该模型展示了在工业环境中驱动机器人和预测其影响的能力。
-
OpenAI 将 ChatGPT Voice 扩展到 iOS Codex,Android 支持即将推出
OpenAI 正在扩展 ChatGPT Voice 的可用性,允许用户通过 iOS 设备上的 Codex 功能使用配对的远程访问。Android 支持预计在不久的将来推出。用户对 GPT-Live 功能表示赞赏,认为它能够增强与 ChatGPT 的对话并支持后台使用,但也有一些用户对这些功能的缓慢推出表示不满。
-
ChatGPT Voice 集成到桌面应用中实现语音控制
OpenAI 已将其 ChatGPT Voice 功能集成到 macOS 和 Windows 的桌面应用程序中。此次更新允许用户通过语音命令控制他们的计算机并在 ChatGPT Work 或 Codex 中管理多个代理。该功能由 GPT-Live 提供支持,可在应用程序内实现同步监听、说话和任务协调。该功能现已向 Plus、Pro、Business、Edu 和 Enterprise 计划的全球用户推出。
-
OpenAI 为小型企业扩展 ChatGPT 并推出高级语音功能
OpenAI 推出了面向小型企业的新产品,包括 ChatGPT Work 和一项旨在帮助企业家实现工作流程自动化并提升其 AI 技能的小型企业计划。该公司还在扩展其语音功能,将先进的 GPT Live 技术集成到 ChatGPT 桌面应用程序中。这项新的语音功能支持免提、连续对话和任务完成,将其效用扩展到软件程序员,并可能为未来的硬件设备提供支持。
-
OpenAI 通过 GPT-Live 增强 ChatGPT 语音功能,Google 推出 Video Remix
OpenAI 推出了 GPT-Live,这是旨在增强 ChatGPT 中自然人机交互的新一代语音模型。此次升级旨在使对话更加流畅,让 AI 能够同时进行倾听、说话甚至在线研究,从而减少中断,使交互感觉更像人类。此外,Google 正在为其 AI 订阅用户推出“Video Remix”功能,允许用户使用 Gemini Omni 在 Google Photos 中重新构想视频。
-
OpenAI 发布下一代 ChatGPT Voice
OpenAI 宣布了其 ChatGPT Voice 功能的下一代版本。该公司通过 X 平台的一篇帖子分享了此次更新,并附带了一个直播活动的链接。
-
OpenAI 发布 GPT-Live,实现更自然的 ChatGPT 语音交互
OpenAI 推出了 GPT-Live,这是专为更自然的人机交互设计的新一代语音模型。这些先进的语音功能现已集成到 ChatGPT Voice 中,提升了用户体验。GPT-Live 的推出旨在使与 AI 的对话更加流畅和直观。
-
硅谷员工拥抱AI语音听写,抛弃键盘
越来越多的硅谷员工开始使用AI驱动的语音听写工具,这种现象被称为“语音化”(voicepilling)。这种从传统打字方式的转变,源于人们相信与技术对话能显著提高生产力,因为人类的语速远快于打字。虽然一些早期使用者报告效率有所提高,但另一些人发现该技术不可靠,并倾向于通过打字来有条理地组织思路。