GPT Transcribe
PulseAugur coverage of GPT Transcribe — every cluster mentioning GPT Transcribe across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
OpenAI 发布 GPT-6 Astra,微软推出 MAI-Transcribe-2,英伟达收购 Hugging Face
OpenAI 发布了其新的旗舰模型 GPT-6 Astra,该模型已达到关键网络安全级别,并显示出比前代模型在抵抗越狱和提示注入方面有所改进。该模型在从不熟悉的环境中创建符号世界模型和进行规划方面也展现了先进的能力。与此同时,微软推出了 MAI-Transcribe-2,这是一款语音识别模型,声称在速度、准确性和成本效益方面优于 OpenAI 和 Google 等竞争对手。此外,英伟达已确认以 129.3 亿美元收购 Hugging …
-
在巴巴多斯报纸上训练的AI模型在本地语境识别方面显示出潜力
研究人员正在探索领域自适应预训练,以提高音频模型在特定地区的准确性,并以巴巴多斯为例。通过在大量巴巴多斯报纸档案语料库上训练Qwen3-Omni模型,目标是让模型能够理解本地语境,例如标准模型经常识别错误的地点名称、机构和文化活动。虽然初步结果显示在提高本地实体知识探测得分方面有希望,但对实际音频转录准确性的影响仍在调查中。
-
OpenAI 发布 GPT Transcribe 和 Live Transcribe,但准确性落后于竞争对手
OpenAI 推出了两款新的语音识别模型 GPT Transcribe 和 GPT Live Transcribe,可通过其 API 访问。虽然这些模型比其前代产品有所改进,但与 ElevenLabs、Google 和 Mistral AI 的产品相比,它们的错误率仍然更高。性能差距表明,虽然 OpenAI 在推进其音频处理能力,但其他公司目前在语音转文本准确性方面处于领先地位。
-
xAI 发布 Grok Build 模型,OpenAI 增加转录模型,Kimi K3 开源
xAI 已为其 SuperGrok Heavy 订阅用户推出名为 Build 的早期测试模型。同时,OpenAI 推出了两款新的转录模型 GPT-Live-Transcribe 和 GPT-Transcribe,旨在提高在不同音频条件和语言下的上下文理解能力和准确性。此外,拥有 2.8 万亿参数的 Kimi K3 模型已开源。
-
OpenAI为API推出新的上下文感知转录模型
OpenAI已推出两个新的API转录模型:GPT-Live-Transcribe用于实时、低延迟音频,GPT-Transcribe用于异步任务。这两个模型都旨在更好地理解上下文,从而提高在各种语言、口音和嘈杂环境中的准确性。开发者可以提供上下文信息、关键词和语言偏好,以进一步提高转录质量。