Malay
PulseAugur coverage of Malay — every cluster mentioning Malay across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
多语言AI支持机器人需要复杂的路由,而不仅仅是翻译
构建多语言支持机器人,尤其是在东南亚等地区,是一个复杂的路由挑战,而不是简单的翻译任务。关键问题包括在用户混合使用语言时准确检测语言,理解不同语言需要不同大小的模型(例如,阿拉伯语或泰米尔语的模型比英语的模型更大),以及在单个对话轮次中实现每一步路由,以使用适当的模型层级来完成分类或合成等任务。此外,数据驻留法规,如新加坡的《个人数据保护法》,要求在区域内进行推理,这符合自然对话的延迟要求。
-
新的MERaLiON-GR模型在多种语言上实现了最先进的性别识别
研究人员开发了MERaLiON-GR,这是一种新颖的语音性别识别模型,能够对英语和多种东南亚语言的性别进行分类。该模型基于MERaLiON-SpeechEncoder-2(一种基于Conformer的Transformer)构建,并利用低秩自适应(LoRA)进行高效微调。在包括中文、马来语、泰米尔语、泰语、越南语、印度尼西亚语和高棉语在内的各种评估模式和语言中,MERaLiON-GR的表现优于Vox-Profile和大型Audio-L…
-
马来西亚大学录取规定引发多语制辩论
马来西亚政府出台了新的大学录取规定,允许来自华文独立中学等非主流机构的学生使用统一考试证书(UEC)申请公立大学。此政策调整旨在承认马来西亚的多语制教育体系,但引发了争论。马来民族主义团体认为,这一变化可能会削弱国家课程和马来语的地位。
-
新数据集对阿拉伯语对话中的LLM进行文化推理基准测试
研究人员开发了一个名为ArabCulture-Dialogue的新数据集,以解决缺乏丰富的文化对话数据来评估阿拉伯语大型语言模型(LLM)的问题。该数据集涵盖了13个阿拉伯语国家,包括现代标准阿拉伯语(MSA)和不同日常生活主题的当地方言。使用该数据集进行的实验显示,在文化推理、翻译和生成等任务中,LLM在方言阿拉伯语上的表现明显不如MSA。
-
新的MSA算法利用模型历史高效地从LLM中遗忘数据
研究人员推出了一种名为模型状态算术(MSA)的新型算法,旨在高效地从大型语言模型中移除特定数据点的影响。与计算上不可行的完全重新训练不同,MSA利用历史模型检查点来抵消不需要的数据的影响。实验表明,MSA在各种基准测试和模型上表现具有竞争力,并且通常优于现有的数据遗忘方法。