Devanagari
PulseAugur coverage of Devanagari — every cluster mentioning Devanagari across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
预训练提高了天城文 OCR 效率,大幅减少了转录需求
arXiv 上发表的一项新研究调查了手写天城文识别系统注释的效率。研究人员发现,监督合成预训练显著减少了获得有用识别器所需的转录词数。具体来说,使用此方法仅需 81 个转录词即可达到 0.50 的字符错误率 (CER),而随机初始化则需要 355 个词,代表了 4.40 倍的标签乘数。研究还探讨了仅迁移编码器的影响,并观察到在某些预算范围内,掩码图像建模会产生负迁移效应。
-
Srijika 系统为九种印度文字生成 OpenType 字体
研究人员开发了 Srijika,一个旨在为包括天城文、泰米尔文和孟加拉文在内的九种印度文字创建可安装 OpenType 字体的创新系统。Srijika 不从头开始生成字体,而是重塑模板字体中现有的字形轮廓,确保复杂字符组合和变体的连贯性。该系统生成多种字体,通过质量检查,并展示了字形序列的准确再现,评估显示其与更简单的基线相比具有有效性。
-
Whisper针对尼泊尔金融语音指令进行微调,提升可访问性
研究人员开发了SpeakPay,这是一款语音优先的数字钱包,旨在帮助尼泊尔的视障用户。核心技术贡献是使用LoRA在Whisper large-v2模型上进行域自适应微调。这种微调应用于一个包含403个尼泊尔金融指令的新数据集NepFinSpeech-403,将词错误率从129.95%显著降低到42.58%,并将交易成功率提高了约20倍。研究还发现,仅需100条特定领域的话语就能使错误率减半,而性能在大约300个样本后趋于稳定。
-
新的神经架构搜索框架生成梵文数字用于AI训练
研究人员开发了NepScript Genesis,一个神经架构搜索(NAS)框架,旨在自动化发现用于合成手写梵文数字的生成对抗网络(GAN)。该框架利用了一种新颖的领域感知评估指标和两阶段流程,其中自适应探索被证明是最有效的NAS策略。合成的数字在FID分数上比基线DCGAN提高了76.19%,并在低资源场景中展示了其效用,通过扩充小型训练数据集,将CNN分类准确率提高了5.5个百分点。
-
新的Arkios语言模型在英语-尼泊尔语文本上进行训练
研究人员推出了Arkios,一个拥有10.4亿参数的语言模型,该模型在1500亿个英语和尼泊尔语的token上进行了训练。该模型使用了自定义训练堆栈和梵文感知分词器。评估显示,Arkios在ARC-Easy和ARC-Challenge基准测试中表现优于同类开放模型,但这可能是由于与基准测试的数据重叠,而非整体能力。该研究还强调了评估低资源语言模型所面临的挑战,因为标准的单项选择题提示可能导致尼泊尔语理解的随机猜测结果。
-
尼泊尔表情包分类系统在CHiPSAL 2026上获得高排名
研究人员开发了一个新颖的尼泊尔表情包分类系统,在CHiPSAL 2026的仇恨言论检测共享任务中获得第二名,在情感分析任务中获得第四名。他们的方法利用了Qwen3-VL-8B-Instruct视觉语言模型,该模型原生支持天城文,无需单独的OCR和翻译步骤。该系统采用两阶段训练过程,包括LoRA微调和对比骨干微调,并采用过采样和Focal Loss等策略来管理类别不平衡。该方法证明了大型视觉语言模型在低资源语言上的有效适配。
-
紧凑型AI模型实现梵文识别基准饱和
研究人员开发了一种名为Barnamala的高度高效卷积神经网络,用于识别手写梵文。该紧凑型模型仅拥有111万个参数,在DHCD数据集上达到了99.73%的基准饱和准确率,在模型大小和效率方面显著优于更大的模型。Barnamala在CMATERdb数据集上还表现出强大的零样本性能,并且与更大的模型相比,在数据损坏方面具有更强的鲁棒性。
-
尼泊尔车牌识别系统准确率达93%
研究人员开发了一种新的自动车牌识别(ANPR)系统,专门针对使用天城文(Devanagari script)的尼泊尔车牌。该系统采用了一个流程,首先使用基于YOLO的模型来检测车牌和字符,然后使用在34个天城文字符上训练的卷积神经网络(CNN)分类器。这种方法达到了高达93%的识别准确率,证明了其在实际条件下的有效性,并为尼泊尔的交通管理提供了可扩展的解决方案。
-
AI模型难以处理梵文OCR,新基准测试揭示
一项新的基准研究评估了十种OCR系统的性能,包括专门的OCR-VLMs和前沿的多模态LLMs,在梵文上的表现。研究发现,虽然许多系统在干净的合成文本上表现良好,但在退化条件和真实世界扫描上的性能会显著下降。专门的OCR-VLMs尤其脆弱,DeepSeek-OCR出现了灾难性的重复失败。值得注意的是,在英语OCR上的强劲表现与在印度语言脚本上的表现并不相关,GPT-5.5等模型出现了大幅下降。
-
新基准衡量果阿身份群体的刻板印象偏见
研究人员推出了 AmchiBias,这是一个旨在衡量果阿身份群体内刻板印象偏见的新型基准,使用了英语和孔卡尼语的最小对数据集。该基准评估了五个多语言编码器模型,结果显示,虽然模型在用英语查询时对泛印度群体表现出高度偏见,但在孔卡尼语中的表现接近随机,表明其对超本地身份缺乏语言和文化能力。这项工作突显了低资源多语言自然语言处理评估在特定社区身份方面存在的重大差距。