Bangla
PulseAugur coverage of Bangla — every cluster mentioning Bangla across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
SHADOW AI 提出紧凑型混合架构以实现多语言智能
Black Shadow Team 提出了一个名为 SHADOW AI 的新实验性 AI 架构,旨在以比当前大型语言模型更紧凑的设计实现多语言语言理解和推理。这种混合神经符号方法将信息分离为字节、语义、符号和结构表示,从而实现神经学习和结构化推理之间的协作。SHADOW AI 强调语言独立性、符号意识、内部动态状态、模块化推理和紧凑的架构,目标是减少计算需求和外部检索依赖。
-
新的BERT-CNN-BiLSTM模型推进了孟加拉语新闻标题分类和情感分析
研究人员开发了一种新颖的BERT-CNN-BiLSTM框架,旨在同时对孟加拉语新闻标题进行分类和情感分析。该混合迁移学习模型在包含9000多个标题的BAN-ABSA数据集上进行了测试,并与基线模型相比表现出优越的性能。该研究探讨了处理不平衡数据的两种实验策略,其中一种方法分别产生了81.37%和64.46%的标题和情感分类准确率,在低资源环境下为孟加拉语文本分类树立了新的最先进水平。
-
新的OCR方法提高了手写孟加拉语文本的识别率 · 跟踪2个来源
研究人员开发了专门针对手写孟加拉语文本的光学字符识别(OCR)新方法。一项研究侧重于使用SSD与MobileNetV2以及Faster R-CNN与InceptionResNetV2等深度学习模型进行单词识别,使用集成模型达到了92.61%的F1分数。第二项研究解决了从转录的孟加拉语段落中进行与颜色无关的单词分割问题,报告了91.20%的F1分数,并强调了其在智能手机拍摄图像上的适用性。
-
新的机器学习框架可从孟加拉语语音检测帕金森病
研究人员开发了 BenSParX,一个新颖的可解释机器学习框架,用于从孟加拉语对话语音中检测帕金森病。该框架填补了一个关键空白,因为此前不存在针对孟加拉语(一种有超过 2.3 亿人使用的语言)的帕金森病语音数据集。BenSParX 集成了多样化的声学特征、先进的机器学习分类器和 SHAP 分析以实现可解释性,达到了 95.67% 的准确率、95.62% 的 F1 分数和 0.990 的 AUC。该系统在其他语言的现有数据集上也表现出强…
-
新研究探究开放式大语言模型中英孟性能差距
一篇新的arXiv论文调查了开放式大语言模型(LLMs)中英语和孟加拉语之间性能差异的原因。研究人员开发了一个一致的流程将8个英语基准测试翻译成孟加拉语,并评估了10个开放式大语言模型。研究发现,脚本碎片化(分词器将孟加拉语的字母音节分解成更小的部分)和评估格式遵循是导致性能差距的因素。虽然孟加拉语文本比英语消耗更多的token,但这种成本和序列长度与模型得分仅显示出弱相关性。
-
新数据集追踪孟加拉国起义期间孟加拉语的危机情绪
研究人员开发了 UNRESTSENT200K,这是一个包含约 200,000 条孟加拉语 Facebook 和 YouTube 评论的新数据集,这些评论与 2024 年 7 月至 8 月的孟加拉国起义有关。该数据集旨在评估低资源语言中的危机情绪分析,涵盖了事件的五个不同阶段,包括互联网中断和随后的洪水危机。该研究对包括微调编码器以及经过或未经过 LoRA 调优的大型语言模型 (LLM) 在内的各种模型进行了基准测试,发现父帖子的上下文…
-
新孟加拉语句功能分类语料库已开发
研究人员开发了一个包含 10,000 句孟加拉语的新语料库,这些句子被手动分为陈述句、疑问句、祈使句和感叹句四种功能,以解决孟加拉语句功能分类资源有限的问题。该研究评估了各种特征表示,包括词袋模型 (Bag-of-Words)、TF-IDF 和 Word2Vec,以及经典的机器学习分类器和集成模型。结合 TF-IDF 特征的双层集成模型取得了最高性能,准确率和宏 F1 分数均为 0.95,证明了稀疏词汇表示和集成学习在此自然语言处理任…
-
新的提示技术提高了低资源手语指令的生成效率
研究人员开发了一种名为“带符号参数注入”(SPI)的新方法,以改进低资源手语的指令文本生成。该技术将特定的手语参数(如手形和动作)直接整合到视觉语言模型的提示中。该方法使用新创建的孟加拉手语指令生成(BdSLIG)数据集进行了评估,证明了对资源匮乏的手语在零样本(zero-shot)方面的性能有所提升。
-
新的IndicTriMix方法改进了混合语文本中的语言识别
研究人员开发了一种名为IndicTriMix的新方法,用于识别混合语文本中的语言,这种文本在社交媒体上很常见。该方法将语言识别视为一个序列标注问题,并对MuRIL和XLM-RoBERTa等基于Transformer的模型进行微调。该系统在涉及印地语、古吉拉特语和孟加拉语的数据集上进行了评估,证明了在标记级别预测语言标签的有效性。该团队还发布了微调模型和基准数据集,以支持该领域的未来研究。
-
Srijika 系统为九种印度文字生成 OpenType 字体
研究人员开发了 Srijika,一个旨在为包括天城文、泰米尔文和孟加拉文在内的九种印度文字创建可安装 OpenType 字体的创新系统。Srijika 不从头开始生成字体,而是重塑模板字体中现有的字形轮廓,确保复杂字符组合和变体的连贯性。该系统生成多种字体,通过质量检查,并展示了字形序列的准确再现,评估显示其与更简单的基线相比具有有效性。
-
新基准数据集面向孟加拉语方言的LLM开发
名为5-Dialects-BN的新基准数据集已发布,以解决区域孟加拉语方言在大型语言模型中资源匮乏的问题。该数据集包含横跨五种主要方言(吉大港、巴里萨尔、诺阿卡利、锡尔赫特和兰加尔普尔)的6,000个手动标注条目。每个条目都包含方言文本、罗马音转写、英文翻译、标准孟加拉语翻译和主观性标签的对齐标注,旨在提高LLM在低资源、方言多样化语言上的性能。
-
大语言模型助力低资源语言信息检索数据集创建,但跨语言复用面临挑战
研究人员开发了一个BETA标注框架,用于构建低资源信息检索(IR)的多语言数据集。该框架利用多个大语言模型(LLMs),通过一致性和多数表决进行检查,然后进行人工评估以确保标签质量。研究还调查了通过机器翻译复用其他低资源语言的IR数据集的可行性,结果显示存在显著差异和语义保留问题,影响了跨语言数据集复用的可靠性。研究结果既揭示了大语言模型辅助低资源信息检索数据集创建的潜力和局限性,也为构建更可靠的基准提供了指导。
-
新的MMTClinic基准测试LLM在多语言临床时间序列数据上的表现
研究人员推出了MMTClinic,这是一个旨在评估大型语言模型(LLM)在临床时间序列数据上表现的新基准。该基准包含文本、医学影像和生理信号,涵盖五种语言(英语、印地语、孟加拉语、马拉地语和泰米尔语)的30,000个问答对。MMTClinic旨在评估LLM在关键临床任务上的能力,如死亡率预测、心率预测和SOFA评分估算,评估结果显示模型、语言和数据模态之间存在显著的性能差异。
-
新数据集探究大模型对孟加拉语习语的理解能力
一项新的研究论文介绍了一个大规模的孟加拉语习语基准数据集,旨在提高大型语言模型(LLMs)对低资源语言中习语的理解能力。该研究评估了包括 Phi-4-mini-instruct、Kimi-K2-32b-instruct 和 Gemini 2.5-Flash 在内的多个 LLMs,在释义、跨度检测和含义识别等任务上的表现。结果显示,模型表现各异,每个模型在不同领域都有其独特的优势,这表明目前没有一个 LLM 能全面掌握孟加拉语习语。
-
新的基准测试评估AI对模因中文化背景的理解能力
研究人员开发了两个新的基准测试MemeCULT-1K和MemeBridge,以评估和改进多模态模型对文化背景和幽默感的理解。MemeCULT-1K专注于孟加拉语、英语和印地语的南亚模因,研究表明,虽然提供文化背景可以提高各种模型的性能,但开源模型在更广泛的文化知识差距方面挣扎得更厉害。MemeBridge解决了模因解读中的双向文化差距,特别从中国和美国的视角考察了美国模因,并证明使用该数据集进行微调可以提高LLM在跨文化理解方面的性能。
-
研究发现:孟加拉语头条新闻常出现负面情感框架
研究人员分析了孟加拉语新闻头条,以了解低资源媒体中使用的情感基调和情感框架。他们使用 Gemma 3-4B 模型进行零样本推理,处理了 300,000 条头条新闻,发现愤怒、悲伤、失望和恐惧等负面情绪普遍存在。一项小型验证研究表明,该模型的估计是有用的,但并非决定性基准。该研究提出了一个偏见敏感的新闻界面,以帮助读者识别不同新闻来源的情感框架模式。
-
BanglaMed-QA系统上线,旨在改善孟加拉语使用者的医疗服务可及性
研究人员开发了BanglaMed-QA,一个旨在提供孟加拉语医疗支持的新型问答系统。该系统利用了涵盖多个医疗类别的4400多个问答对的知识库,并整合了领域特定的语言工具,如词根词典和词性标注。评估显示,在自动化测试中达到了95%的F1分数,并获得了高的人类满意度评分,表明其有潜力弥合孟加拉语使用者的医疗信息鸿沟。
-
新的孟加拉语远程医疗数据集DocTalkBN发布,用于医学NLP研究
研究人员推出DocTalkBN,这是一个新数据集,包含超过557小时的孟加拉语专家远程医疗对话。这个多模态数据集包含配对的音频和文本,涵盖了1,515次多轮患者通话和26个医学专业领域的10,274次问答交流。与源自书面内容或合成数据的现有数据集不同,DocTalkBN保留了低资源语言中真实医疗互动的自然流程和口语特征。该数据集还包括三个下游任务的基准:医学分诊分类、建议安全评估和医学命名实体识别,并对各种大型语言模型进行了初步评估。
-
BanglaMamba:状态空间模型为孟加拉语假新闻检测提供高效替代方案
研究人员探索了使用基于 Mamba 的状态空间模型 (SSM) 来检测孟加拉语假新闻,并提出了一个名为 BanglaMamba 的新模型。该方法旨在为基于 Transformer 的模型(如 BanglaBERT)提供一种计算效率更高的替代方案,后者因其二次复杂度而在处理长文档时遇到困难。虽然 BanglaBERT 在特定数据集上取得了最高性能,但 BanglaMamba 在推理速度和内存使用方面显著优于自定义 BERT 模型,并取得…
-
量化对不同模型的孟加拉语任务LLM性能影响不同
一项新研究系统评估了训练后量化对孟加拉语(一种低资源语言)大型语言模型(LLM)的影响。研究人员在五个孟加拉语自然语言理解基准测试中,测试了Qwen-2.5-7B、LLaMA-3.1-8B和GPT-OSS-20B这三个模型系列在全精度和各种量化格式下的表现。研究结果表明,量化对不同模型架构的影响差异很大,GPT-OSS在推理任务上准确性损失显著,而Qwen和LLaMA表现出韧性,有时甚至优于全精度版本。这项研究表明,虽然量化对于在资源…