Character Error Rate
PulseAugur coverage of Character Error Rate — every cluster mentioning Character Error Rate across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
视觉语言模型在历史文献OCR中表现出细微的幻觉
一篇新的研究论文分析了视觉语言模型(VLM)在转录历史文献方面的性能。研究发现,尽管它们在字符错误率(CER)和单词错误率(WER)等标准指标上优于传统的OCR系统,但它们表现出细微但关键的故障模式。这些模式包括生成虚假内容和进行语义替换,这些替换在不显著影响CER/WER的情况下改变了含义,尤其影响了命名实体。该研究强调,需要采用评估方法来评估语义可靠性,而不仅仅是字符准确性,以满足档案转录的需求。
-
Whisper模型微调以实现鲁棒的阿萨姆语语音识别
研究人员开发了一个微调版本的Whisper模型,以改进阿萨姆语的自动语音识别(ASR)。该微调模型在Mozilla Common Voice 24.0-Assamese语料库上进行训练,并使用Tesla 4 GPU针对资源受限环境进行了优化,其性能显著优于零样本基线。新系统在词错误率(WER)、字符错误率(CER)、匹配错误率(MER)和词信息丢失(WIL)方面实现了大幅降低,同时在语义评估的BLEU和METEOR分数方面也有显著提高。
-
研究发现:大型语言模型无法翻译韩语盲文
一项新的研究论文揭示了最先进的大型语言模型(LLMs)在翻译韩语盲文方面存在严重的无障碍性缺陷。尽管人们期望这些模型能够通过文本表示来处理盲文,但研究发现其输出持续表现不佳且不稳定。研究表明,当前的大型语言模型缺乏对盲文的感知分词以及韩语和盲文模式之间的强有力对齐,这凸显了系统性的局限性。
-
新的 RLHF 框架改进了越南语历史手稿翻译
研究人员开发了一种新的多模态人类反馈强化学习 (RLHF) 框架,用于将历史汉喃手稿翻译成现代越南语。该方法利用手稿图像的视觉信息和对齐的汉喃文本来提高翻译质量,解决了页面退化和并行数据有限等挑战。该框架集成了多个语言模型和视觉编码器,实验表明,在 BLEU-4 和 BERTScore 等各项指标上,直接偏好优化 (DPO) 的表现优于近端策略优化 (PPO) 和卡方优化 (KTO),证明了偏好优化在低资源历史翻译中的有效性。
-
Qwen-ASR-1.7B适配多语种双人语音识别 · 跟踪2个来源
研究人员为MLC-SLM 2026挑战赛开发了一个系统,该系统将Qwen3-ASR-1.7B模型适配于多语种、双人对话语音。该系统将说话人日志前端与适配后的ASR模型集成,处理语音活动、说话人嵌入和音频分割。适配技术包括监督微调、使用合成语音的LoRA微调以及GRPO强化学习,这些技术共同将开发集上的词错误率降低了6.83个百分点,并在评估集上达到了17.97 tcpMER。
-
新数据集和CRNN模型推动乌尔都语手写文本识别
研究人员推出了Urdu Katib Handwritten Dataset (UKHD),这是第一个历史乌尔都语手写文本行的离线数据集。该数据集旨在解决乌尔都语手写文本识别 (UHTR) 资源稀缺的问题。研究还评估了各种基于CRNN的模型,确定CNN-BGRU-CTC在乌尔都语Katib手写识别方面最有效,实现了较低的字符和单词错误率。
-
新范式通过将错误与人类感知相关联来改进ASR指标
研究人员提出了一种用于评估自动语音识别(ASR)系统的新范式,旨在改进现有的词错误率(WER)和字符错误率(CER)等指标。所提出的方法结合了选定的指标来生成最小编辑距离(minED),该距离与人类感知有更好的相关性,并考虑了语言和语义信息。这种方法允许从人类的角度更细致地研究转录错误的严重性。
-
LLM偏好优化提升TTS准确性和用户个性化
研究人员开发了新的方法来使大型语言模型(LLM)与用户偏好保持一致。一种方法TKTO专注于文本到语音系统,实现了数据高效的Token级优化,以提高发音准确性并减少错误。另一个框架POPI通过将过程分解为偏好摘要生成器和响应生成器来解决LLM个性化问题,从而实现用户特定的输出并减少上下文开销。