whisper tiny
PulseAugur coverage of whisper tiny — every cluster mentioning whisper tiny across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
离线语音翻译系统可在边缘设备上自我校正
研究人员开发了一个离线语音到语音的翻译系统,该系统可以在Jetson Nano边缘设备上运行,并在无需重新训练的情况下自行校正翻译。该系统利用了Whisper-tiny ASR模型和OPUS-MT翻译器,并使用多语言BERT模型作为质量评估门控来触发二次校正。在英-西班牙语翻译上的实验表明,最小贝叶斯风险解码显著提高了翻译质量,而质量评估模型作为门控比作为排序器更有效,从而节省了内存。
-
新研究探究音频条件化大语言模型中的声学信息丢失
研究人员调查了音频条件化语言模型为何常常无法利用韵律和情感等关键声学线索。他们的研究发表在arXiv上,在一个Qwen3.5-4B语言模型管道中测试了包括Whisper-Tiny、Whisper-Small、EnCodec、DAC-VAE和WavTokenizer在内的各种音频编码器。研究结果表明,仅更换编码器并不能完全解决问题,因为在情感识别和声音描述等任务中,Whisper变体仍然是最有效的。进一步的分析表明,虽然区分性的声学信息…
-
13M ASR Conformer 模型在低成本微控制器上运行
一位开发者成功地在低成本 ESP32-S3 微控制器上实现了一个拥有 1310 万参数的自动语音识别 (ASR) conformer 模型。通过蒸馏和量化,该模型被压缩到仅占用 14MB 的闪存和 256KB 的 SRAM,使其能够转录 8 秒的音频。尽管推理速度仍然较慢,但这比之前的尝试有了显著的进步,开发者提倡进行更多关于模型效率的研究,以使人工智能在经济实惠的硬件上更加普及。
-
新的REDDIT框架纠正ASR模型中的时间戳漂移
研究人员开发了REDDIT,一个新颖的训练后框架,旨在修复自回归自动语音识别(ASR)系统中的时间戳不准确问题。该方法解决了时间戳漂移问题,即解码的时间轴偏离实际音频,尤其是在长无语音片段中。REDDIT采用两阶段过程,使用模型自身的重放上下文和冻结的基础分布来编辑时间戳目标,同时还包含一个精炼阶段。这种方法在不引起其他ASR功能灾难性遗忘的情况下成功纠正了时间戳漂移,这一点在Whisper-tiny模型上得到了证明。
-
新的REDDIT框架可在不遗忘模型的情况下纠正ASR时间戳漂移
研究人员开发了REDDIT,一个新颖的训练后框架,旨在纠正自动语音识别(ASR)系统中的时间戳漂移,而不会导致灾难性遗忘。该方法使用基于重放的分布编辑技术,通过重放模型自身的解码器上下文来精炼时间戳,同时保留非时间戳标记的分布。该框架在Whisper-tiny上将长间隔mIoU从38.7%提高到95.0%,参数更新极少,同时显著减少了域外时间戳错误。