Tamil
PulseAugur coverage of Tamil — every cluster mentioning Tamil across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新框架支持对斯里兰卡议会辩论进行三语主题建模
研究人员开发了一个新颖的框架,用于对斯里兰卡的国家议会辩论进行主题建模,这些辩论包含僧伽罗语、泰米尔语和英语。该系统通过采用基于LLM的文本提取以及多语言嵌入和聚类管道,克服了复杂的PDF布局、多语言脚本和黏着语形态带来的挑战。BiTopic扩展进一步提高了可解释性和降噪能力。该框架应用于2017-2026年超过19,000场演讲,成功识别出30个宏观主题,与2019年复活节爆炸案和2022年经济危机等重大国家事件相吻合,其表现优于传…
-
新基准揭示大型语言模型中的跨语言偏见
一项名为INCLUDE的新基准已被开发出来,用于评估大型语言模型(LLMs)在各种印度语言中的社会文化偏见。目前,大型语言模型的安全对齐主要集中在英语上,这可能导致在多语言环境中使用这些模型时产生潜在危害。INCLUDE基准包含2,604个英语、印地语、孟加拉语、马拉地语、泰米尔语和混合英语(Hinglish)的提示,用于评估十个大型语言模型。结果表明,在开源模型中,孟加拉语表现出最高的平均偏见;而在开源模型中,英语偏见最低,但在闭源…
-
Sarvam-105B 模型跨语言安全性测试
一项关于 Sarvam-105B 模型的研究,调查了链式思考监控作为安全信号在英语、泰米尔语和唐lish语中的可靠性。初步研究结果表明,推理可能会减少成功的提示注入,但后续实验显示出相反的趋势。研究观察到,表明有意忽略注入的输出通常是良性的,而有意遵循注入的输出更有可能成功攻击。然而,该研究规模小且场景有限,无法就推理对安全性的影响或其普遍性得出明确结论。
-
泰米尔语和马拉雅拉姆语 OCR 在复杂元音符号放置方面遇到困难
泰米尔语和马拉雅拉姆语脚本的光学字符识别 (OCR) 主要在元音符号方面面临挑战,原因是其放置方式以及与辅音的复杂交互。这些脚本是元音音节文字,其中元音符号附加到辅音上,导致处理视觉顺序而非存储顺序的 OCR 引擎出错。问题因分为两部分的元音符号(显示为独立的墨迹区域)以及与辅音融合形成独特字形的元音符号而加剧。通过检查音节簇开头或位于其他依赖元音符号之前的依赖元音符号,可以帮助识别和纠正这些 OCR 错误。
-
僧伽罗语-泰米尔语跨语言信息检索研究:嵌入模型优于翻译模型
一篇新研究论文评估了使用僧伽罗语和泰米尔语查询访问英文政务信息的跨语言信息检索(CLIR)方法。该研究比较了查询翻译技术(包括 Google Translate、NLLB-200 和 mBART50)与跨语言嵌入模型(如 LaBSE、Multilingual E5 和 BGE-M3)的性能。在斯里兰卡政府信息中心的基准数据集上进行的实验表明,虽然两种方法都比单语方法提高了检索准确性,但 BGE-M3 嵌入模型取得了最高的性能,证明了其…
-
单语模型在达罗毗荼语系上优于多语模型
研究人员开发并评估了五个GPT-2架构模型,以评估多语语言模型在达罗毗荼语系上的表现。其中四个模型分别针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语进行了单语训练,每个模型都有自己的分词器。第五个模型进行了多语训练,在所有四种语言之间共享一个分词器。研究发现,在情感分类和命名实体识别等任务上,单语模型的表现优于多语模型mGPT,并且显示出更高的分词器效率。
-
分词溢价为非英语语言制造人工智能成本障碍 · arXiv cs.CL
一项发表在arXiv上的新研究介绍了分词公平性审计(TEA),这是一个旨在衡量大型语言模型对不同语言分词差异的基准。研究发现,与英语相比,孟加拉语、印地语和约鲁巴语等语言的语义等效内容可能需要更多的分词,这会影响API成本、延迟和有效上下文窗口长度。这种分词溢价因模型和分词器而异,凸显了依赖人工智能工具的服务欠缺语言社区可能面临的经济和功能障碍。
-
新的MERaLiON-GR模型在多种语言上实现了最先进的性别识别
研究人员开发了MERaLiON-GR,这是一种新颖的语音性别识别模型,能够对英语和多种东南亚语言的性别进行分类。该模型基于MERaLiON-SpeechEncoder-2(一种基于Conformer的Transformer)构建,并利用低秩自适应(LoRA)进行高效微调。在包括中文、马来语、泰米尔语、泰语、越南语、印度尼西亚语和高棉语在内的各种评估模式和语言中,MERaLiON-GR的表现优于Vox-Profile和大型Audio-L…
-
研究质疑破译印度河文字的统计方法
一篇新发表在arXiv上的研究论文质疑了用于破译古代文字(特别是印度河文字)的统计度量的有效性。该研究引入了SIGIL,一个旨在模拟结构化非语言系统的生成性符号系统,并发现应用于印度河文字的常见统计测试在应用于SIGIL时也能产生类似结果。这表明这些度量可能不够具体,无法明确证明未破译的文字编码了语言,因为它们可以在不一定识别出语言内容的情况下检测到组织结构。
-
泰米尔语模型获得形态感知增强,翻译能力提升
研究人员为泰米尔语模型开发了一种新颖的形态感知系统,增强了翻译能力。该系统集成了ThamizhiMorph分析器和生成器,以及一个字节精确语义分词器和一个学习到的分层词组合器。该方法将词语分解为词元和语法特征,通过字符和字节回退保留精确重构。评估表明,这种基于形态的分词比现有的基线(如AI4Bharat IndicBERTv2)提高了翻译质量,并显著减少了序列长度和估计的推理成本。
-
新系统SIGIL质疑脚本破译的统计方法
一项新研究挑战了用于破译未知脚本(尤其是印度河谷文字)的统计方法。研究人员开发了一个名为SIGIL的生成性符号系统,该系统模仿了印度河谷文字的统计特性,但并未编码语言。在测试中,SIGIL在各种度量标准上产生了与印度河谷文字相似的统计特征,表明这些方法不足以确认语言编码。该研究还表明,英语、梵语和泰米尔语可以在SIGIL的语料库上实现高词典覆盖率,进一步凸显了这些统计方法在破译方面的局限性。
-
新数据集用7种语言教授LLM印度知识体系
研究人员开发了IKS-Instruct,一个旨在教授大型语言模型印度知识体系(IKS)的新多语言数据集。该数据集包含七种语言的24,000多个指令-响应对,涵盖41种教学技术,并与印度教育课程相符。评估表明,使用IKS-Instruct进行微调的7B模型在IKS特定维度上的得分与通用参考模型相当,但部署成本显著降低。
-
新的BHARATI分词器提高了古典印度语言的效率
研究人员开发了BHARATI,这是一套专为梵语和泰米尔语等古典印度语言设计的新分词器。与难以处理这些语言的黏着语形态和 संधि(sandhi)的标准算法不同,BHARATI实现了更有效的分段。这导致序列长度缩短,有效地增加了下游语言模型的上下文窗口,并提高了在专门的印度知识体系术语上的性能。
-
新的AI系统GeoMVC解决了多模态表情包中的厌女问题
研究人员开发了一个名为GeoMVC的新系统,用于检测互联网表情包中的厌女症,这项任务因视觉和文本元素之间的相互作用以及文化背景而变得复杂。该系统采用几何交互层来对齐视觉和文本嵌入,并采用多视图共识策略来处理嘈杂的OCR和代码混合文本。GeoMVC在ICMI 2026的CC-MMD挑战赛中取得了优异的成绩,在马拉雅拉姆语分区中获得第二名,在中国语分区中获得任务A的第三名。
-
从头开始构建的 Transformer 架构用于英语到泰米尔语翻译
某个人使用 PyTorch 从头开始开发和训练了一个 Transformer 神经网络架构。该模型专门用于英语到泰米尔语的机器翻译,并基于 "Attention Is All You Need" 论文。该项目包括详细的数学解析和分步教程,代码可在 GitHub 上找到,数据集托管在 Hugging Face 上。
-
新的Python库grapheme-kit改进了多语言自然语言处理的度量标准
一个名为grapheme-kit的新开源Python库已被开发出来,以解决现有文本处理度量标准的局限性。这些通常基于Unicode码点的度量标准,在书写系统中,当一个字素由多个码点组成时,可能无法准确表示错误。Grapheme-kit将这些度量标准扩展到字素簇,为泰米尔语和僧伽罗语等语言提供改进的处理。一项涉及光学字符识别的案例研究表明,字素级度量标准能为复杂脚本提供更准确的评估。
-
新的 N-VSSM 模型在长篇叙事一致性方面超越 Claude Opus 4.5
研究人员开发了 NarrativeWorldBench,这是一个旨在评估大型语言模型 (LLM) 在长篇音频戏剧中保持叙事一致性能力的新基准。目前的尖端 LLM 在超过 200 集的叙事弧方面存在困难,情节节拍 F1 分数饱和在 0.8 左右。为解决此问题,他们引入了 N-VSSM,一个利用 Mamba-2 主干的叙事变分状态空间模型,该模型在各种周期中实现了至少 0.84 的情节节拍 F1 分数,并在与专业作者的合作研究中证明了比 …
-
新的自动语音识别(ASR)错误分析工具打破脚本障碍
研究人员开发了一种新的自动对齐机制,旨在改进自动语音识别(ASR)错误的分析,特别是针对不使用拉丁字母的语言。该方法与语言无关,并适用于各种ASR架构,能够更一致地对齐假设和参考转录。该系统支持详细的词性(PoS)错误分析,可用于增强ASR训练并改进词错误率(WER)等指标。该方法已在使用了元音附标文字、字母文字和辅音字母文字书写系统的语言上进行了演示。
-
线性记忆容量取决于检索:Top-1 为 $n\log n$,列表式为 $n$
研究人员分析了线性联想记忆的容量限制,发现检索标准显著影响可存储的联想数量。对于 Top-1 检索(信号必须优于所有其他信号),记忆大小的规模为 $d^2 \asymp n \log n$。在考虑列表式检索(允许正确目标成为一组强候选者中的一员)时,容量呈二次方缩放 $d^2 \asymp n$。这项工作引入了尾部平均裕度(TAM)标准来形式化列表式检索,并开发了其性能的渐近理论。
-
新基准评估六维度的印度语言TTS口音保真度
研究人员推出PSP,一个旨在评估印度语言文本到语音(TTS)系统口音准确性的新基准。与关注清晰度和自然度的现有指标不同,PSP通过将其分解为六个不同的维度来专门衡量口音,包括卷舌音合并和韵律特征发散。对ElevenLabs v3和Sarvam Bulbul等系统的初步测试显示,在词错误率方面表现最佳的系统不一定在口音保真度方面表现出色,这凸显了对更细致评估方法的需求。