Modern Standard Arabic
PulseAugur coverage of Modern Standard Arabic — every cluster mentioning Modern Standard Arabic across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
LLMs show significant weakness in Arabic dialects beyond MSA
Recent benchmarks like the Saudi dialect evaluation and EDRAC highlight that current LLMs perform poorly on various Arabic dialects, not just MSA. This suggests a systemic issue in how models are trained or evaluated for the diversity of Arabic language use.
Culturally grounded AI evaluation is emerging for Arabic multimodal tasks
The ImageEval 2026 task, with its focus on culturally grounded Arabic multimodal AI evaluation (including AynVQA and CRAI-Bench), shows a trend towards assessing AI's cultural accuracy in Arabic contexts, moving beyond simple language translation or comprehension.
New benchmarks for Arabic dialects will spur specialized LLM fine-tuning
The development of benchmarks like the Saudi dialect evaluation and EDRAC, which specifically target Arabic dialects, indicates a growing need for better performance in these areas. We hypothesize that this will lead to increased efforts in fine-tuning existing LLMs or developing new ones specifically for dialectal Arabic applications.
-
古兰经文本映射和诵读验证器发布
研究人员开发了一种新的方法,用于在奥斯曼体和标准阿拉伯语拼写形式之间映射古兰经文本,解决了由Unicode字符U+0670引起的差异。这项工作包括一个2,290对单词的映射和一个七步标准化流程,实现了90.9%的经文对齐。在此基础上,创建了一个确定性的、不依赖LLM的验证器,用于评估古兰经诵读的准确性,在测试套件上达到了98.4%,并在所有测试的阿拉伯语ASR转录本中正确识别了经文。
-
新的 AlphaMWE 语料库揭示了大型语言模型在多词表达式翻译中的盲点
研究人员开发了 AlphaMWE 语料库,用于测试大型语言模型(LLMs)在机器翻译方面的能力,特别关注多词表达式(MWEs)。该研究评估了 31 个不同语言对的机器翻译系统,包括英语到中文、波兰语、德语以及几种阿拉伯语方言。使用 BLEU 和 BERT-score 等指标进行的自动评估,以及后续的人工评估,都揭示了比喻性语言和多词表达式仍然是大型语言模型的挑战,并且汇总分数可能会掩盖特定语言的错误。
-
人工智能客服因可访问性问题被起诉
一位患有多系统萎缩的 Mastodon 用户正在寻求法律咨询,起诉那些使用人工智能和自动语音客服的公司。该用户因言语障碍,难以使用仅有人工智能的客服系统,并且通过 ADA 提示要求人工协助的请求均未成功。该用户打算提起诉讼,迫使这些公司满足 ADA 请求或提供直接的人工支持。
-
新的EDRAC基准测试旨在评估阿拉伯语方言阅读理解能力
研究人员推出EDRAC,这是一个旨在评估机器在各种阿拉伯语方言中阅读理解和问答能力的新基准。该基准解决了方言阿拉伯语相对于现代标准阿拉伯语资源不足的问题,而现代标准阿拉伯语通常是现有问答数据集的重点。EDRAC包含来自口头交流的499个段落和近5000个问答对,涵盖五种主要方言:埃及方言、摩洛哥方言、阿联酋方言、叙利亚方言和沙特阿拉伯方言。对以阿拉伯语为中心和多语言的大型语言模型的初步基准测试显示,语义答案质量与方言准确性之间存在显著…
-
新基准揭示大型语言模型在沙特方言和文化细微差别方面存在困难
研究人员开发了一个新的基准来评估大型语言模型在沙特方言和文化细微差别方面的表现,超越了传统的现代标准阿拉伯语(MSA)评估。该基准包含31个专家编写的提示,结果显示,像Claude Opus-5、Gemini 3.7、GPT-5.6和Kimi K3等当前最先进的模型表现不佳,得分在42.7%到53.1%之间。一个重要的发现是,模型主要因扭曲语域和语用细微差别(模糊框架)而失败,而不是完全的幻觉。
-
ImageEval 2026 任务着眼于具有文化背景的阿拉伯语多模态人工智能评估
ImageEval 2026 共享任务专注于具有文化背景的阿拉伯语多模态评估,包含两个主要部分。AynVQA 解决了英语和现代标准阿拉伯语的口语视觉问答和幻觉检测问题,而 CRAI-Bench 评估了文本到图像生成模型的文化准确性。共有十四个团队参赛,其中十二个提交了详细的系统描述,概述了零样本提示和视觉语言模型微调等各种方法。
-
开发出深度学习系统用于《古兰经》发音错误纠正
研究人员开发了一个深度学习系统,用于自动检测和纠正《古兰经》诵读中的发音错误。该系统采用了一种新颖的方法,使用自定义的《古兰经》语音脚本(QPS)来编码特定的Tajweed规则,超越了标准的语音表示。这项工作引入了一个包含848小时音频的大型数据集和一个名为qdat_bench的基准数据集,以评估在实际诵读错误上的性能。
-
新的 ASAS 基准揭示了阿拉伯语 LLM 存在显著的安全漏洞
名为 ASAS 的新基准已被开发出来,用于评估阿拉伯语大型语言模型 (LLM) 的安全性。该基准包含 801 个跨八个安全类别的、经过人类策划的提示,结果显示大多数经过测试的模型无法防御一半的不安全提示。武器和非法物质等高风险类别显示出显著的安全漏洞,其中直接攻击和混淆攻击最为有效。研究还发现,语言对齐在不同语言之间不易转移,并且自动安全判断器的表现不如人工标注员。
-
发布新的阿拉伯语方言安全基准
研究人员推出了ArabicDialectSafety,这是一个旨在评估不同方言的阿拉伯语内容安全性的新数据集。该数据集包含六种阿拉伯语变体的25,071个提示,并标注了方言和七个危害类别。与大型语言模型相比,微调后的MARBERTv2在安全分类方面表现更优,取得了较高的Macro-F1分数。研究还发现,在表示层面整合方言信息最为有效,尽管资源较少的马格里布方言表现有所滞后。
-
MiniMax AI 和 Fireworks AI 开源推理内核
MiniMax AI 和 Fireworks AI 已联合发布旨在加速推理速度的开源内核工作。此次合作的重点是使底层计算组件可访问,并强调不仅模型权重,内核代码也应开源。发布的存储库包括 MiniMax MSA 和 Fireworks 内核,为处理大型模型的开发人员提供了工具。
-
Minimax M3 视觉和阿拉伯语支持已合并到 llama.cpp
Minimax M3 大型语言模型现已将视觉支持集成到 llama.cpp 库中。此合并由一个拉取请求发起,还将现代标准阿拉伯语 (MSA) 的支持纳入了 llama.cpp 框架。这些更新增强了本地 LLM 部署的功能。
-
SemiAnalysis:黄仁勋的委员会方法阻碍了美国开源AI的进步
SemiAnalysis 批评黄仁勋的开源AI委员会式训练方法,认为它扼杀了创新并导致群体思维。分析表明,与中国的模式类似,实验室之间的独立竞争能促进更大的进步。具体来说,Kimi K3 据称优于 NVIDIA 的 Nemotron 3 Ultra,而 Mistral AI 的参与据称阻碍了 Nemotron 的预训练。作者主张成立独立的竞争委员会,以推动数据、训练和评估方面的进步。
-
New CTC method improves diacritic restoration for Arabic speech transcripts
研究人员开发了一种高效的、非自回归的方法,使用连接主义时间分类(CTC)来恢复阿拉伯语音文本中的音标。该方法通过从无音标文本创建字符级音标格,在解码过程中加入硬约束,将假设限制在有效的音标形式内。在古典阿拉伯语和现代标准阿拉伯语数据集(特别是ArVoice和ClArTTS)上的评估表明,与更复杂的多模态基线相比,音标错误率显著降低,突出了性能和效率的提升。
-
阿拉伯语大型语言模型可通过神经元分析引导至方言
研究人员探索了在无需微调的情况下,将阿拉伯语大型语言模型(LLMs)引导至生成特定方言的方法。该研究识别出编码方言特定特征的稀疏神经元群体,并证明操纵这些神经元可以影响模型输出。此外,还应用了向量引导方法,在推理过程中提取和注入方言特定激活方向,为基于可解释性的方言生成控制提供了一个框架。
-
阿拉伯语大型语言模型无需重新训练即可被引导使用特定方言
研究人员开发了无需额外训练即可控制阿拉伯语语言模型方言输出的方法。通过分析神经元级别的表示,他们识别出编码方言特征的特定神经元群体,从而能够进行操作以引导模型的输出。此外,还使用了一种向量引导方法,在推理过程中提取和注入特定于方言的激活方向,为管理大型语言模型中的方言知识提供了一种原则性的方法。
-
OCI 的 AI 扩展挑战和降本工具出现
Oracle Cloud Infrastructure (OCI) 在扩展 AI 工作负载方面面临挑战,其现代标准阿拉伯语 (MSA) 产品提供的局限性凸显了这一点。虽然 AI 代理正在导致数据库蔓延,但它们也被探索为潜在的解决方案。文章涉及各种与 AI 相关的主题,包括 AI 代理的安全性、AI 在网络安全领域的持续斗争,以及开发用于降低 AI 运营成本的工具,例如 Netflix 开源的 Project Headroom。
-
新研究探索用于大型语言模型的混合和稀疏注意力机制
研究人员正在探索优化大型语言模型中注意力机制的新方法,特别是用于处理长上下文。例如,HydraHead架构沿头轴混合了全注意力(FA)和线性注意力(LA),识别关键的FA头并协调分布差异。另外,StreamKL提供了一种快速且内存高效的方法来计算注意力蒸馏的Kullback-Leibler散度,减少了HBM占用空间,并支持在单个GPU上进行长上下文蒸馏。其他研究包括基于域分解的分层注意力和距离自适应表示,后者为远距离标记分配较低的维度…
-
MiniMax AI 庆祝社区对 M3 开源权重的贡献
MiniMax AI 正在庆祝开源社区对其 M3 开源权重所做的贡献。mlx-vlm 项目已集成对 MiniMax M3 的支持,包括对现代标准阿拉伯语的实现。此集成在 M3 Ultra 512GB 系统上进行了测试,实现了每秒 24 个 token 的处理速度,峰值内存使用量约为 240GB。
-
MiniMax AI发布开源M3模型,支持100万上下文
MiniMax AI发布了其新的开源模型MiniMax M3,该模型具备先进的编码和智能体能力。该模型支持原生图像和视频输入,可以与计算机交互,并拥有100万token的上下文窗口。M3的一个关键创新是其MSA稀疏注意力架构,旨在提高性能。
-
MiniMax AI发布开源M3模型,支持100万上下文
MiniMax AI发布了其新的开源模型MiniMax M3,该模型拥有100万token的上下文窗口和先进的功能。该模型采用了名为MSA的新型稀疏注意力架构,其中包括专用的预填充和解码内核。它支持NVIDIA Hopper和Blackwell架构上的BF16和MXFP8格式,通过前缀缓存和分块预填充实现了长上下文的高效服务。