ElevenLabs Scribe v2
PulseAugur coverage of ElevenLabs Scribe v2 — every cluster mentioning ElevenLabs Scribe v2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AssemblyAI 详解实时音频实体提取准确性
AssemblyAI 详细介绍了其对实时音频的实体提取能力,强调了以高准确率捕获电话号码和电子邮件地址等关键信息的挑战。该公司强调,传统的词错误率可能具有误导性,而特定的实体错误率是评估性能的更好指标。其 Universal-3.5 Pro Realtime 模型直接处理音频流,格式化 '@' 和 '.com' 等实体,并通过提供代理上下文来提高准确性。
-
AssemblyAI 将 Universal-3.5 Pro Realtime 与 Agora 集成以构建语音代理
AssemblyAI 发布了一份指南,详细介绍了如何将其 Universal-3.5 Pro Realtime 语音转文本模型与 Agora 的实时音频传输平台集成。此次集成允许开发人员在不修改客户端代码的情况下,为 Agora 通话添加低延迟、区分说话人的转录功能。该过程涉及一个 Python 服务器机器人,该机器人加入 Agora 频道,捕获原始音频,并将其流式传输到 AssemblyAI 的 WebSocket 端点进行转录。据…
-
xAI发布Grok Voice Think Fast 2.0,准确率提升2倍 · 跟踪4个来源
xAI发布了Grok Voice Think Fast 2.0,这是一款先进的语音到语音模型,相比前代产品有了显著提升。该新模型提供了增强的智能、对话能力和工具使用可靠性,与Deepgram Nova 3和ElevenLabs Scribe v2等模型相比,转录准确率提高了高达2倍。Grok Voice Think Fast 2.0在嘈杂环境中的表现也更出色,并将推理直接集成到语音中,从而实现更快的工具调用和更流畅的用户交互,计划于2…
-
AssemblyAI 对 STT 延迟进行基准测试,优先考虑准确性而非原始速度
AssemblyAI 发布了实时语音转文本 (STT) 延迟的基准测试,强调最低延迟并不总是等同于语音代理的最佳性能。该公司认为,“足够快且准确”优于“最快但错误”,因为语音代理需要速度和准确性之间的平衡,以避免误解关键信息。AssemblyAI 强调了首次令牌时间 (TTFT) 和完成回合时间 (TTCT) 等关键指标,并强调了生产环境中 P95 延迟相对于中位数 (P50) 延迟的重要性。据报道,其 Universal-3.5 P…
-
Hugging Face 对双语客户语音助手的 ASR 进行基准测试
Hugging Face 开发了一个基准测试,用于评估自动语音识别 (ASR) 系统在处理代码切换语音(即个人在句子中途切换语言)方面的能力。这对于服务双语客户群体的语音助手至关重要。该基准测试涵盖了西班牙语-英语和法语-英语等语言对,并使用了 HR 和 IT 服务管理场景。表现最佳的模型包括 ElevenLabs Scribe V2、Gemini 3 Flash 和 Assembly AI Universal 3-Pro,结果使用词…
-
语音识别系统在语种转换语音上的基准测试
一项新的基准研究评估了五种商业自动语音识别(ASR)系统在语种转换语音上的表现,特别关注阿拉伯语、波斯语和德语与英语的混合。该研究引入了一个使用GPT-4o和Gemini 1.5 Pro对转录文本进行评分的新型流程,将LLM成本降低了91%,并采用BERTScore作为比传统词错误率(WER)更可靠的某些语种对的度量标准。ElevenLabs Scribe v2成为表现最佳的系统,在所有测试的语种对中实现了最低的WER和最高的BERTScore。