gpt-realtime
PulseAugur coverage of gpt-realtime — every cluster mentioning gpt-realtime across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
PolyAI 发布 Dialog-RSN-1 原生音频对话模型
PolyAI 发布了 Dialog-RSN-1,这是一款原生音频对话模型,可直接处理原始音频输入,无需转录。该模型将轮次切换、语音识别、函数调用和响应生成整合到一个系统中,目标响应时间低于 300 毫秒。虽然目前仅支持英语,并且仅通过 PolyAI 的平台提供,但它已在企业客户的实时生产通话中部署。
-
用户讨论使用 GPT Realtime 进行自动化候选人面试
一位 Reddit 用户正在询问使用 GPT Realtime 自动化候选人面试的潜在缺点。他们正在考虑将该服务用于技术劳务招聘,估计每次通话成本约为 1.50 美元,其中包括 Twilio 和 API 使用费。
-
Avatarin部署全天候零售代理,采用OpenAI的GPT-Realtime
Avatarin利用OpenAI的GPT-Realtime技术开发了一个全天候多语言零售代理。该代理为山田电机(Yamada Denki)的购物者提供支持,在上线的前两周内,已有3万人使用。用户反馈普遍积极,92%的调查受访者表示体验良好。
-
Loka 使用 Amazon Nova 2 Sonic 构建低延迟语音助手
Loka 使用 AWS 的语音到语音模型 Amazon Nova 2 Sonic 开发了一个对话式 AI 语音助手。这种新方法对音频进行端到端处理,捕捉了传统基于文本的流程中丢失的细微差别,并显著降低了延迟。该系统在大语言模型音频基准测试(Big Bench Audio)上取得了高分,优于 Gemini 2.5 Flash Native Audio 和 GPT Realtime 等竞争对手,同时还提供了大规模部署的成本效益。
-
语音AI技术栈日趋成熟:适用于生产环境的顶级STT、TTS和编排平台
对2026年5月语音AI技术的分析显示,语音识别(STT)、语音合成(TTS)和编排平台取得了显著进展,使得语音助手成为生产环境中可行的工程问题。作者强调,各个组件的成熟度,特别是在降低延迟方面,使得语音交互更加自然和响应迅速。该分析按特定用例对顶级选择进行了分类,例如流式转录、语音质量和平台集成,并强调优化每个层是成功部署的关键。
-
xAI 的 Grok-Voice-Think-Fast 1.0 语音模型创下新基准,驱动 Starlink
xAI 发布了 grok-voice-think-fast-1.0,这是一款专为实时全双工语音代理设计的新型语音模型。据报道,该模型在 tau-voice 基准测试中取得了 67.3% 的得分,超过了 Gemini 和 GPT Realtime 等竞争对手。它已被用于增强 Starlink 的实时电话业务,旨在改进客户支持和企业应用。
-
推出 gpt-realtime 和 Realtime API 更新
OpenAI 发布了 GPT-4.1,这是其 API 的新模型系列,在编码、指令遵循和长上下文理解方面提供了显著改进,性能优于 GPT-4o 等先前模型。该公司还推出了更小、更快的 GPT-4.1 mini 和 GPT-4.1 nano 变体。此外,OpenAI 推出了其最先进的语音到语音模型 gpt-realtime,旨在提供具有增强自然度和指令遵循能力的可靠语音代理,并更新了其 Realtime API。