Arabic
PulseAugur coverage of Arabic — every cluster mentioning Arabic across labs, papers, and developer communities, ranked by signal.
- instance of English 90%
- developed Russian 90%
- used by Connectionist temporal classification 90%
- instance of Mohamed Bayan Kmainasi 90%
- instance of Araberta 90%
- used by Marbert 90%
- used by English 70%
- instance of Hindi 70%
- instance of Standard Chinese 70%
- developed large-language models 70%
- used by large-language models 70%
- instance of Japanese 70%
10 天有情绪数据
-
SHADOW AI 提出紧凑型混合架构以实现多语言智能
Black Shadow Team 提出了一个名为 SHADOW AI 的新实验性 AI 架构,旨在以比当前大型语言模型更紧凑的设计实现多语言语言理解和推理。这种混合神经符号方法将信息分离为字节、语义、符号和结构表示,从而实现神经学习和结构化推理之间的协作。SHADOW AI 强调语言独立性、符号意识、内部动态状态、模块化推理和紧凑的架构,目标是减少计算需求和外部检索依赖。
-
StanceEval 2026 任务采用先进的大语言模型进行阿拉伯语社交媒体立场检测
StanceEval 2026,一项专注于阿拉伯语社交媒体立场检测的共享任务,已落下帷幕,共有 20 个团队提交了系统描述论文。该任务涉及识别作者对给定主题的立场是赞成、反对还是中立,并设有两个跨目标泛化赛道。表现最佳的系统采用了各种大语言模型和微调技术,取得了比基线模型高得多的分数,其中一个赛道甚至在未见过目标上的表现优于相关目标。
-
神经符号框架改进阿拉伯语句法歧义消解
研究人员开发了一种新颖的神经符号框架来解决现代标准阿拉伯语(MSA)中的句法歧义。该方法通过将歧义消解构建为一个决策任务,整合了生成式句法原理和AraBERT Transformer模型。明确构建并评估了语言学上合理的替代方案,在未见过的数据上达到了高准确率。该框架证明了形式句法表示可以在神经模型中有效操作化,以实现可控且可解释的自然语言处理。
-
新摩洛哥塔马齐特语语音数据集发布,用于人工智能研究
研究人员开发了TutlAit v1,这是一个新的众包摩洛哥塔马齐特语语音数据集,解决了该语言标记音频数据稀缺的问题。该数据集包含阿拉伯语转录和地区口音标签,通过定制的Web应用程序收集。TutlAit v1包含超过13,000个音频文件,总计约21小时,重点关注Atlas和Souss方言,可用于语音识别、翻译和口音识别任务。
-
新数据集WASIL增强了阿拉伯语大型语言模型口语交互能力
研究人员推出了WASIL,一个旨在改善阿拉伯语口语与大型语言模型(LLMs)交互的新数据集。该数据集包含超过8,500轮真实场景下的口语交互,附带音频、自动语音识别(ASR)假设、助手响应和用户反馈,其中14.2%的交互被标记为不满意。WASIL还包含一个2,000轮的测试集,涵盖现代标准阿拉伯语和四种主要方言,并附有可回答性标注,以区分ASR错误和真正的无法回答。该资源旨在通过区分语音识别问题和模型固有的能力,来促进对LLM语音助手的更好评估。
-
TTLab 在 Daleel 2026 上发布 STAR-Ar 用于阿拉伯语论点识别
TTLab 的研究人员开发了 STAR-Ar,这是一种新颖的 BERT-BiLSTM-CRF 架构,专为阿拉伯语文本中的论点识别而设计。该系统已提交给 Daleel 2026 共享任务,该任务侧重于识别和分类阿拉伯语辩论和社论中的论证话语单元。STAR-Ar 模型在测试数据上取得了 73.7 的 F1 分数,证明了将 Transformer 嵌入与转换约束相结合在此任务上的有效性。分析显示,仅在社论上训练的模型表现不如在辩论上训练的模…
-
BARRAC框架将英语情感分析适配阿拉伯语方言,超越GPT-4o
研究人员开发了BARRAC,一个新颖的框架,它将一种英语方面情感分析方法适配到阿拉伯语方言的分类任务中。BARRAC用阿拉伯语的语言学装置替换了英语特有的组件,并采用了两阶段训练过程。在五个阿拉伯语方言数据集上进行评估时,BARRAC取得了63.93%的平均宏F1分数,比之前最先进的方法提高了3%,并在五项任务中的四项上优于GPT-4o。
-
新方法基于伊斯兰伦理创建人工智能对齐数据
研究人员开发了一种方法论,用于基于专家定义的规范框架为语言模型创建对齐数据,并将其应用于伊斯兰伦理传统。在一年内,七位领域专家生成了约 2.8K 个监督微调(SFT)示例和 5.4K 个偏好对(阿拉伯语和英语)。使用这些数据训练的模型显示出改进的对齐度,专家评估在超过 51% 的情况下更倾向于 SFT 训练的模型而非基线模型,尽管添加偏好数据并未带来统计学上的显著改进。
-
新基准揭示阿拉伯语大型语言模型响应中的文化差距
一项名为 AraBehave 的新基准已被开发出来,用于评估大型语言模型(LLMs)在阿拉伯文化背景下的适宜性。该基准包含 1,600 多个提示和人类判断,揭示文化适宜性包含两个不同的组成部分:规范立场和基于事实的文化准确性。像 Gemini 这样的通用模型虽然具有很强的基于事实的准确性,但它们通常采取文化上不适宜的规范立场。相反,以阿拉伯语为中心的模型可能采取预期的立场,但会受到虚构的宗教内容或引述错误经文的影响。研究表明,立场很容…
-
新指南AraMIP助力阿拉伯语隐喻识别
研究人员开发了AraMIP,一个用于标注阿拉伯语隐喻的新指南,该指南建立在MIPVU框架之上。该程序适应了阿拉伯语的特定语言特征,区分了隐喻(Isti'arah)、转喻(kinaya)和明喻(tashbih)。对300个句子的试点数据集进行了标注,突显了形态复杂性和标注者缺乏标准化资源等挑战。这项工作旨在为阿拉伯语中的比喻语言建立标准化实例,为更大的标注数据集和进一步研究铺平道路。
-
多语言AI支持机器人需要复杂的路由,而不仅仅是翻译
构建多语言支持机器人,尤其是在东南亚等地区,是一个复杂的路由挑战,而不是简单的翻译任务。关键问题包括在用户混合使用语言时准确检测语言,理解不同语言需要不同大小的模型(例如,阿拉伯语或泰米尔语的模型比英语的模型更大),以及在单个对话轮次中实现每一步路由,以使用适当的模型层级来完成分类或合成等任务。此外,数据驻留法规,如新加坡的《个人数据保护法》,要求在区域内进行推理,这符合自然对话的延迟要求。
-
领域特定预训练提升了Transformer在阿拉伯语-英语语码转换上的性能
一项发表在arXiv上的新研究探讨了领域特定预训练对Transformer模型分析阿拉伯语-英语语码转换的影响。研究评估了MARBERT和XLM-RoBERTa(以BERT为基线)在社交媒体语篇中对语用功能进行分类的表现。研究结果表明,在独立测试集上,MARBERT的宏F1得分显著优于XLM-RoBERTa,达到了0.85,而XLM-RoBERTa为0.52。研究得出结论,对于专门的语用任务,领域特定预训练的简介比单独的多语言覆盖对T…
-
强制英语的LLM通信会带来显著的性能损耗
一篇新的研究论文调查了强制多代理LLM通信通过英语(即使是非英语任务)所带来的性能影响。研究发现,与母语管道相比,在印地语等语言中,显著的“强制英语税”会将准确率降低多达30.6个百分点。这表明,通过母语进行代理间通信可以提高性能,尤其是在类型学上差异较大的语言中,从而减轻翻译损失。
-
AI模型在日语和阿拉伯语/乌尔都语翻译任务中的争论
Reddit用户正在寻求翻译任务的最佳AI模型推荐。一位用户正在寻找一个能够翻译日语轻小说并拥有24GB显存的本地模型。另一位用户正在寻找一个价格实惠但质量高的模型,用于英语到阿拉伯语和英语到乌尔都语的翻译,他之前曾成功使用Claude 3 Sonnet,但现在正在探索GPT-4和GPT-3.5等替代方案,并将其与Google Translate和DeepL进行比较。
-
Nuha-Speech计划构建阿拉伯语语音大模型,拥有150万+问答样本
研究人员推出了Nuha-Speech项目,旨在开发通用阿拉伯语语音大语言模型(speech-LLMs)。该计划通过创建一个包含超过150万个训练样本的大规模阿拉伯语语音问答(SQA)语料库,解决了阿拉伯语在多语言语音大模型中代表性不足的问题。该语料库被用于微调Qwen Omni模型变体,并设计了一个全面的评估框架,以在资源有限的情况下为阿拉伯语语音大模型建立基础性基础设施。
-
新的E-CONAN基准旨在推进阿拉伯语自然语言推理
研究人员推出了E-CONAN,这是一套旨在提高阿拉伯语自然语言推理能力的新基准。这些基准由两个数据集E-CONAN-2和E-CONAN-3组成,它们是从自动翻译、人工验证、手工制作和新闻标题句子对的混合体中创建的。在零样本分类设置中,使用这些基准评估了九个最先进的多语言预训练模型和五个大型语言模型,结果表明E-CONAN在评估和微调模型泛化能力方面具有价值。
-
Transformer 在多语言可读性评估中模仿传统模型
研究人员分析了基于 Transformer 的模型和基于传统特征的模型在多语言可读性评估方面的处理方式。他们发现,虽然 Transformer 模型取得了高准确率,但其内部特征表示在阿拉伯语、英语、法语、印地语和俄语等多种语言上与传统模型一致。这种一致性延伸到表面、句法和词汇特征,以及欧洲语言共同参考框架的序数结构。然而,一致性的程度因模型家族、语言和所检查的具体层而异。
-
AI认知筛查模型对多语种使用者存在显著偏见
arXiv上发表的一项新研究发现,用于基于语音的认知筛查的AI模型存在显著的假阳性偏差,尤其影响英国的多语种人群。研究发现,与单语英语使用者相比,包括Whisper、Wav2Vec 2.0和NeMo在内的模型将多语种使用者错误地标记为认知障碍的可能性高出约2.5倍。这种偏差在记忆、流畅性和阅读任务中更为明显,并且在模型使用DementiaBank等现有数据集进行训练时会加剧,这凸显了在医疗保健领域公平部署AI的迫切需求。
-
新的YallaMorph基准测试LLM的阿拉伯语形态生成能力
研究人员推出了YallaMorph,这是一个旨在评估大型语言模型在阿拉伯语形态生成能力方面表现的新基准。该基准解决了LLM虽然能生成流利的阿拉伯语,但在准确的形态句法控制方面常常遇到困难的挑战。YallaMorph涵盖了广泛的阿拉伯语形式,包括动词、名词、形容词及其附着和无效配置,总计超过60万条。初步评估表明,对于当前的LLM而言,阿拉伯语形态生成仍然是一项艰巨的任务,尤其是在处理复杂或不太常见的形式时。
-
新的 AlphaMWE 语料库揭示了大型语言模型在多词表达式翻译中的盲点
研究人员开发了 AlphaMWE 语料库,用于测试大型语言模型(LLMs)在机器翻译方面的能力,特别关注多词表达式(MWEs)。该研究评估了 31 个不同语言对的机器翻译系统,包括英语到中文、波兰语、德语以及几种阿拉伯语方言。使用 BLEU 和 BERT-score 等指标进行的自动评估,以及后续的人工评估,都揭示了比喻性语言和多词表达式仍然是大型语言模型的挑战,并且汇总分数可能会掩盖特定语言的错误。