PulseAugur
实时 14:37:52
实体 Bangla

Bangla

PulseAugur coverage of Bangla — every cluster mentioning Bangla across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
24
90 天内 63
发布 · 30天
0
90 天内 0
论文 · 30天
20
90 天内 57
层级分布 · 90 天
主题
关系
情绪 · 30 天

16 天有情绪数据

最近 · 第 1/4 页 · 共 63 条
  1. TOOL · CL_216030 ·

    发布用于电信客户服务的合成孟加拉语语音数据集

    研究人员开发了一个专为电信客户服务应用定制的合成孟加拉语语音数据集。该数据集包含 10,000 对音频-文本,总计约 26.82 小时的语音,并根据 CC-BY-4.0 许可在 Hugging Face 上公开提供。合成语音使用 OmniVoice 生成,重点关注语音克隆和自动语音识别 (ASR) 训练的标准化。使用经过微调的 Whisper ASR 模型进行的评估表明,文本-音频一致性很强,词错误率 (WER) 和字符错误率 (CER) 较低。

  2. TOOL · CL_213671 ·

    Gemma 3 在孟加拉语分词效率方面优于 Llama 3.2

    对不同 AI 模型分词效率的比较显示,在处理各种语言方面存在显著差异。Llama 3.2 需要八个 token 来表示一个孟加拉语单词,而 Google 的 Gemma 3 模型仅用一个 token 即可完成。这凸显了领先 AI 架构在多语言处理优化方面的不同水平。

  3. TOOL · CL_211514 ·

    开发者为孟加拉国电子商务构建多语言AI

    一位开发者为孟加拉国的Tonu's Shop电子商务平台创建了TonuAI,一个专门的对话式AI系统。该系统旨在通过处理来自描述、规格和数据库等各种来源的产品数据,帮助客户找到护肤品。TonuAI采用多语言关键词评分方法,处理客户用孟加拉语、孟加拉式英语和英语提出的查询,并且还可以同时处理多意图问题,例如同时询问产品推荐、价格和配送信息。

  4. TOOL · CL_210381 ·

    新基准揭示大型语言模型中的跨语言偏见

    一项名为INCLUDE的新基准已被开发出来,用于评估大型语言模型(LLMs)在各种印度语言中的社会文化偏见。目前,大型语言模型的安全对齐主要集中在英语上,这可能导致在多语言环境中使用这些模型时产生潜在危害。INCLUDE基准包含2,604个英语、印地语、孟加拉语、马拉地语、泰米尔语和混合英语(Hinglish)的提示,用于评估十个大型语言模型。结果表明,在开源模型中,孟加拉语表现出最高的平均偏见;而在开源模型中,英语偏见最低,但在闭源…

  5. TOOL · CL_206311 ·

    BabelSteering 方法利用英文信号增强多语言大语言模型安全性

    研究人员开发了 BabelSteering,一种提高大型语言模型多语言安全对齐能力的新方法。该技术使用英文安全信号来指导模型在其他语言中的行为,作为一种轻量级的推理时干预。在八种语言上的评估表明,BabelSteering 在不显著影响任务效用的情况下,能有效提高对有害请求的拒绝率,表明这是一种将安全措施推广到全球的实用方法。

  6. TOOL · CL_206289 ·

    新的RAG框架增强了孟加拉语MCQ生成和答案预测

    研究人员开发了一种新颖的、具有结构感知能力的检索增强生成(RAG)框架,旨在改进孟加拉语等低资源语言的学术选择题(MCQ)生成和答案预测。该框架将孟加拉语教科书建模为分层图,并使用图神经网络进行段落检索,为大型语言模型提供聚焦的上下文。实验表明,该方法在问题生成和答案预测的相关性和准确性方面均优于标准的密集检索方法。

  7. TOOL · CL_206283 ·

    新数据集赋能小型离线孟加拉语-英语辅导模型

    研究人员开发了TRACE-BN,一个用于将孟加拉语-英语辅导能力迁移到小型离线语言模型的.该系统使用由Gemini 3.5 Flash Lite生成的课程引导结构化辅导痕迹,以教授初级孟加拉语使用者英语。然后,使用具有4位量化的LoRA将此行为迁移到低于1B的模型Qwen3-0.6B,显著提高了其在翻译、语法解释、错误诊断和练习匹配方面的性能。

  8. TOOL · CL_206276 ·

    研究发现,RAG 检索性能因查询类型和语言而异

    一篇新发表在 arXiv 上的研究调查了检索增强生成(RAG)架构的有效性,特别是在孟加拉国农业咨询服务的背景下。研究强调,总体检索分数可能会掩盖不同查询类型和语言条件下显著的性能差异。对于孟加拉语的农业查询,BM25 和 Hybrid RRF 表现强劲,但与正式的安全查询相比,密集检索方法在处理农民的口语化查询时遇到了困难。研究还发现,嵌入任务配置和段落长度会极大地改变报告的 R@10 分数,这凸显了在低资源 RAG 评估中按语言和…

  9. TOOL · CL_213746 ·

    新数据集TRACE-BN提升了孟加拉语使用者的英语辅导效果

    研究人员开发了TRACE-BN,一个旨在通过提供结构化的辅导痕迹来教授孟加拉语使用者英语的新数据集。这些痕迹包括语法解释、错误识别和针对性练习,最初由Gemini 3.5 Flash Lite生成,然后迁移到一个较小的模型Qwen3-0.6B以供离线使用。经过微调的低于10亿参数的模型在翻译准确性和辅导组件质量方面表现出显著的改进,并得到了人工评审员的验证。

  10. COMMENTARY · CL_199357 ·

    AI产品本地化:营收地域比说话者数量更重要

    在将AI产品推向全球市场时,仅仅关注语言的说话者数量是错误的。文章认为,市场营收、支付基础设施和购买力比纯粹的说话者数量更为关键。此外,关键人群中的英语熟练程度以及英语在网络内容和训练数据中的普遍性意味着,除了核心几种语言之外,本地化为多种语言的好处正在减少。

  11. RESEARCH · CL_199755 ·

    孟加拉语KBQA框架HybridRAG-BN在竞赛中拔得头筹

    研究人员开发了HybridRAG-BN,一个专为孟加拉语知识库问答(KBQA)设计的、新颖的检索增强框架。该框架结合了混合检索方法(包括BM25和BGE-M3嵌入)以及用于答案生成和验证的微调Gemma 4 31B Instruct模型。该系统还包含一个使用DuckDuckGo的后备机制,用于处理未解决的查询。HybridRAG-BN在一次竞赛中取得了第一名,其token级F1分数分别为0.71654和0.72912,证明了其有效性。

  12. TOOL · CL_198159 ·

    新的孟加拉语翻译系统连接12种地区方言

    研究人员开发了一种新颖的多方言神经机器翻译系统,旨在解决孟加拉语方言差异带来的重大挑战。该系统可以在12种地区孟加拉语方言之间进行翻译,而无需中间标准语言。经过微调的BanglaT5模型利用权重分解低秩适配(DoRA),取得了最先进的性能,优于NLLB-200和mBART-50等大型模型。该项目还汇编了迄今为止最大的孟加拉语多方言平行语料库,并发布了一个优化的模型开放访问的Web应用程序,以促进数字包容性。

  13. COMMENTARY · CL_197462 ·

    孟加拉语大语言模型支持滞后是由于数据稀缺,而非需求不足

    尽管孟加拉语拥有大量母语使用者,但其在大语言模型中的支持程度却远落后于使用者较少的语言。这种差距并非源于需求不足,而是由于可爬取、机器可读的文本数据稀缺。主要原因之一是历史上使用了自定义字体,将孟加拉语字符映射到ASCII,导致大量旧的数字内容对网络爬虫和语言检测工具不可见。虽然现代孟加拉语出版物使用Unicode,但历史语料库仍包含这些遗留数据,影响了模型训练。

  14. TOOL · CL_193335 ·

    孟加拉语数学推理研究:思维链监督的益处因模型强度而异

    一项新研究“MathShikkha”调查了思维链(CoT)监督在提高小型语言模型(SLMs)孟加拉语数学推理方面的有效性。该研究使用GPT-5.4生成的推理构建了一个数据集,发现虽然CoT监督并未显著提高较强SLMs的领域内推理准确性,但它显著增强了一个较弱的4B模型。然而,在一个更大的基准测试中,CoT在所有模型上都显著优于仅答案微调,并保持或提高了领域外准确性。

  15. RESEARCH · CL_193712 ·

    分词溢价为非英语语言制造人工智能成本障碍 · arXiv cs.CL

    一项发表在arXiv上的新研究介绍了分词公平性审计(TEA),这是一个旨在衡量大型语言模型对不同语言分词差异的基准。研究发现,与英语相比,孟加拉语、印地语和约鲁巴语等语言的语义等效内容可能需要更多的分词,这会影响API成本、延迟和有效上下文窗口长度。这种分词溢价因模型和分词器而异,凸显了依赖人工智能工具的服务欠缺语言社区可能面临的经济和功能障碍。

  16. TOOL · CL_201679 ·

    LLM中的孟加拉语数学推理:思维链监督效果喜忧参半

    一项名为MathShikkha的新研究,调查了思维链(CoT)监督对于提高在孟加拉语上训练的小型语言模型数学推理能力的有效性。该研究使用GPT-5.4生成的推理过程构建了一个孟加拉语数学推理数据集,并对四种参数量从4B到7B不等的模型进行了微调。结果表明,CoT监督在较大的BanglaMATH基准测试中带来了显著的好处,所有模型的性能提高了20.1-28.1个百分点,而仅答案的微调有时会降低性能。然而,一项人类研究发现CoT在推理有效…

  17. TOOL · CL_187313 ·

    新的孟加拉手语识别模型针对移动设备部署进行了优化

    研究人员开发了一个新的孟加拉手语(BdSL)识别系统,该系统专为在个人设备上部署而设计。该系统包括一个包含超过10,000张专家验证的BdSL手势图像的数据集,以及一个轻量级的、基于注意力的卷积神经网络。该模型在各种基准测试中实现了高精度,并且针对效率进行了优化,与在ImageNet上预训练的模型相比,所需的参数和计算资源显著减少。该系统能够在具有小占位面积的商品智能手机上运行。

  18. TOOL · CL_185430 ·

    孟加拉语稀疏少样本语言模型实现 90% 的稀疏度

    研究人员开发了 BnBERT-iPET,这是一种专门针对孟加拉语的稀疏少样本语言建模的新方法。该方法利用彩票 टिकट 修剪实现 90% 的稀疏度,显著降低了计算需求和内存占用。在孟加拉语下游任务上,该修剪后的模型在性能上可与 Bangla Electra 和 Indic-BERT 等大型最先进模型相媲美。

  19. TOOL · CL_183293 ·

    新的BanglaWild基准评估OCR和VLM的孟加拉语场景文本识别能力

    研究人员推出了BanglaWild,这是一个新的基准,旨在评估光学字符识别(OCR)系统和视觉语言模型(VLM)的孟加拉语场景文本识别能力。该基准包含2,535张图像,并附有详细的转录和错误注释。评估显示,同一家族中较大的模型并不总是优于较小的模型,而视觉识别错误是大多数系统中错误的主要来源,这挑战了此前对孟加拉语OCR的假设。

  20. TOOL · CL_183249 ·

    语言模型安全对齐在低资源孟加拉语贬损性言论中失效

    一篇新发表在arXiv上的研究论文,调查了大型语言模型(LLMs)在处理低资源语言时的安全对齐问题,特别关注孟加拉语中的贬损性言论。研究发现,语言模型在准确理解和遏制孟加拉语中的有害内容方面存在困难,表现出显著的理解缺陷,同时保持高令牌泄露率。研究强调,目前基于高资源语言的安全对齐方法,对于低资源场景来说是不够的,因为模型优先考虑表面线索而非实际有害意义。诸如思维链(Chain-of-Thought)推理和专家角色设定等技术进一步加剧…