Christos Petrocheilos
PulseAugur coverage of Christos Petrocheilos — every cluster mentioning Christos Petrocheilos across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
通过迭代工程开发出生产级希腊语-英语语音识别器
研究人员详细介绍了开发 Sophea(一个双语希腊语-英语自动语音识别系统)的广泛工程过程。团队在满足九个生产质量门槛方面面临挑战,特别是平衡希腊语嘈杂环境下的性能与英语语言识别的准确性。通过一个六阶段的数据管道、使用 ROVER 的模型集成以及对音频滤波器的仔细校准,他们成功构建了一个通过所有门槛的系统,将重叠语音的词错误率降低了 29%。最终的模型 sophea/asr-k1 在英语测试集和真实世界的希腊语流量上均显示出有希望的结果。
-
针对低资源语言微调的大语言模型显示出流畅性提升,而非准确性提高 · 跟踪到2个来源
一篇新论文探讨了针对低资源语言微调大型混合专家(MoE)模型,发现虽然准确性基准显示改进很小,但监督微调(SFT)显著增强了模型在目标语言中进行推理的能力。具有可验证奖励的强化学习可以进一步优化这些模型,修复格式不正确和意外语言泄露等问题,尽管即使没有明确的准确性提升,在低资源语言中的核心推理习惯仍然存在。该研究强调了传统准确性指标在评估此类适应性方面的局限性,并提出了新的行为维度进行测量。
-
NVIDIA 的 Nemotron 模型通过新基准适应现代希腊语
研究人员已将 NVIDIA 的 Nemotron 检索模型改编为更好地处理现代希腊语,填补了当前人工智能在该语言方面的能力空白。该研究涉及挖掘希腊语语料库、训练检索模型以及微调生成组件,从而显著提高了检索准确性和基础生成能力。还引入了一个名为 HERA 的新基准,以促进未来希腊语检索增强生成系统的研究。