PulseAugur
实时 10:49:05
实体 Khmer

Khmer

PulseAugur coverage of Khmer — every cluster mentioning Khmer across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 8
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. RESEARCH · CL_202680 ·

    柬埔寨工人外流给泰国脆弱的劳动力模式带来压力 · 跟踪到1个来源

    由于大量柬埔寨工人外流,泰国劳动力模式正面临巨大压力,据估计自去年边境冲突以来已有78万人离开。此次外流影响了多个行业,而留住现有工人(尤其是来自缅甸的工人)的努力被证明是不足的。合法引进新劳动力的挑战因持续的冲突、缅甸的出口管制以及旅行和经纪费用的增加而加剧,凸显了依赖邻近性和低成本的劳动力的脆弱性。

  2. RESEARCH · CL_199488 ·

    泰语、高棉语、韩语和埃塞俄比亚文字的OCR挑战详述

    像泰语、高棉语、韩语和埃塞俄比亚语这样的文字的光学字符识别(OCR)面临着不同于标准拉丁字母文本的独特挑战。泰语OCR由于词语之间没有空格,在词语分割方面存在困难,需要基于词典的方法。高棉语OCR面临堆叠的辅音下标和可能被标准识别模型丢失或误解的小型变音符号的问题。韩语OCR因历史上混合使用谚文和汉字而变得复杂,在有限的谚文数据集上训练的模型可能会错误地替换汉字。埃塞俄比亚文字是一种音节文字,其字符家族内部存在系统性的混淆,这意味着错…

  3. TOOL · CL_185268 ·

    新的MERaLiON-GR模型在多种语言上实现了最先进的性别识别

    研究人员开发了MERaLiON-GR,这是一种新颖的语音性别识别模型,能够对英语和多种东南亚语言的性别进行分类。该模型基于MERaLiON-SpeechEncoder-2(一种基于Conformer的Transformer)构建,并利用低秩自适应(LoRA)进行高效微调。在包括中文、马来语、泰米尔语、泰语、越南语、印度尼西亚语和高棉语在内的各种评估模式和语言中,MERaLiON-GR的表现优于Vox-Profile和大型Audio-L…

  4. TOOL · CL_154998 ·

    语言模型微调以翻译无空格的高棉语

    一个语言模型被微调以翻译高棉语,这是一种单词之间没有空格的语言,使用了8000个句子和单个GPU的数据集。该过程涉及调整WordPiece和字节对编码等分词方法,这些方法通常用于像标准中文、英文和日文这样的有空格的语言。这项实验探讨了GPT-3和Bert等模型处理此类语言挑战的能力。

  5. TOOL · CL_154405 ·

    新研究比较AI在多语言极化检测中的策略

    研究人员对SemEval-2026任务9的多语言极化检测进行了22种语言的比较研究。该研究评估了通才模型、特定语言的专才模型以及集成策略。虽然像XLM-RoBERTa这样的通才模型在分词器对齐时表现良好,但特定语言的专才模型在柬埔寨语和奥里亚语等具有独特书写系统的语言上表现出显著的改进。该团队开发了一个语言自适应框架,该框架根据开发性能动态地在通才模型、专才模型和集成模型之间进行选择,实现了0.796的总体宏平均F1分数。

  6. RESEARCH · CL_135189 ·

    新语料库应对越南少数民族语言的自然语言处理挑战

    研究人员开发了CKTN,这是一个新的语料库和基准,旨在解决越南少数民族语言(特别是占族、高棉语和岱依-农语)在自然语言处理资源稀缺的问题。该语料库包含44,367份文档和2400万个子词标记,突显了现有多种语言编码器由于脚本和标准化差异而在这些语言上遇到的困难。开发了一种新颖的脚本感知适应方法,包括词汇增强和校准替换标记预训练,以提高模型性能并减少碎片化,从而获得更强的分类结果。

  7. RESEARCH · CL_111604 ·

    LoRA 微调提升了低资源高棉语 TTS 的质量

    研究人员开发了一种方法来提高高棉语和韩语等低资源语言的文本到语音(TTS)质量。通过使用单个低秩自适应(LoRA)适配器微调 2.4B 参数的 VoxCPM2 模型,他们将高棉语的平均意见得分(MOS)从 3.85 显著提高到 4.23。这种适配器仅训练了模型参数的一小部分,证明了其效率。该技术对于基础模型最初表现不佳的语言效果最好,而对于基础模型已经处理得很好的韩语,则没有显示出任何好处,甚至出现了性能下降。

  8. RESEARCH · CL_79576 ·

    新方法为亚洲文化背景调整大型语言模型安全测试

    一篇新研究论文介绍了一种针对东亚和东南亚文化背景的大型语言模型(LLMs)进行文化适应性红队测试的方法学。研究发现,直接翻译英文基准测试会严重低估LLM的风险,而经过文化适应性调整的提示语能带来更高的攻击成功率。该研究强调,安全评估有必要根据特定的文化细微差别进行调整,而不是仅仅依赖语言翻译。

  9. RESEARCH · CL_43996 ·

    递归切块在柬埔寨语农业文献RAG中表现优异

    研究人员评估了四种文本切块策略,用于一个检索增强生成(RAG)框架,并使用了柬埔寨语农业文献。研究发现,基于字符的递归切块方法,切块大小为300个字符,表现最佳。该方法实现了最低的L2距离和最高的答案相关性及柬埔寨语交并比(IoU)得分,与基于句子的方法相比有显著改进。

  10. RESEARCH · CL_44001 ·

    研究对高棉语问答的RAG模型进行基准测试

    一项新研究探讨了检索增强生成(RAG)在高棉语中的有效性,高棉语是一种资源匮乏、非拉丁字母的语言。研究人员对三种用于密集检索的嵌入模型进行了基准测试,发现BGE-M3是表现最佳的模型。然后,他们评估了五种生成模型,注意到没有单一模型在所有指标上都表现出色,其中Qwen3.5-9B在忠实度和上下文相关性方面领先,Qwen3-8B在事实正确性方面领先,SeaLLMs-v3-7B-Chat在答案相关性和正确性方面领先。