Tamil
PulseAugur coverage of Tamil — every cluster mentioning Tamil across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
AI 和软件开发主题在 Raku、Python 和 NLP 中讨论
来自同一 Mastodon 用户的多篇帖子讨论了各种软件开发主题,包括 Raku 编程语言、AI 面试工具、Flask 和 FastAPI 等 Python 后端框架,以及 AI 模型在泰米尔语数据上的性能。由于被禁止使用官方渠道,用户表示缺乏关于 Raku 的直接新闻,并强调他们自己的 AI 面试评分器是 GPT 解决方案的替代方案。讨论还涉及 Python Web 框架的演变以及特定语言任务的 AI 模型基准测试。
-
多语言AI支持机器人需要复杂的路由,而不仅仅是翻译
构建多语言支持机器人,尤其是在东南亚等地区,是一个复杂的路由挑战,而不是简单的翻译任务。关键问题包括在用户混合使用语言时准确检测语言,理解不同语言需要不同大小的模型(例如,阿拉伯语或泰米尔语的模型比英语的模型更大),以及在单个对话轮次中实现每一步路由,以使用适当的模型层级来完成分类或合成等任务。此外,数据驻留法规,如新加坡的《个人数据保护法》,要求在区域内进行推理,这符合自然对话的延迟要求。
-
Srijika 系统为九种印度文字生成 OpenType 字体
研究人员开发了 Srijika,一个旨在为包括天城文、泰米尔文和孟加拉文在内的九种印度文字创建可安装 OpenType 字体的创新系统。Srijika 不从头开始生成字体,而是重塑模板字体中现有的字形轮廓,确保复杂字符组合和变体的连贯性。该系统生成多种字体,通过质量检查,并展示了字形序列的准确再现,评估显示其与更简单的基线相比具有有效性。
-
新基准凸显人工智能在东南亚语言语音理解方面存在的关键差距
研究人员开发了SEA-SpeechBench,一个旨在评估11种东南亚语言语音理解能力的综合基准。该基准包含超过97,000个样本和597小时的音频数据,涵盖自动语音识别、语音翻译和时间理解等任务。对现有模型的初步评估显示出显著的性能差距,特别是在缅甸语和泰米尔语等低资源语言中,使用母语提示的性能比英语落后高达41个百分点。研究结果凸显了当前模型存在的关键局限性,并强调了更具包容性发展的必要性。
-
新的MMTClinic基准测试LLM在多语言临床时间序列数据上的表现
研究人员推出了MMTClinic,这是一个旨在评估大型语言模型(LLM)在临床时间序列数据上表现的新基准。该基准包含文本、医学影像和生理信号,涵盖五种语言(英语、印地语、孟加拉语、马拉地语和泰米尔语)的30,000个问答对。MMTClinic旨在评估LLM在关键临床任务上的能力,如死亡率预测、心率预测和SOFA评分估算,评估结果显示模型、语言和数据模态之间存在显著的性能差异。
-
新型 Transformer 模型改进泰米尔语拼写和语法纠错
研究人员开发了一种新的泰米尔语拼写和语法纠错方法。泰米尔语是一种具有复杂语音规则的黏着语。他们的方法使用了渐进式微调的序列到序列 Transformer,特别是 mT5-small 和 mBART-50 模型,在一个大型合成语料库上进行了训练。这种多阶段训练计划针对从表面噪声到上下文语法和连读规则的不同错误类型,显著提高了在诊断集上的准确性。研究还强调了连读回忆率和同一性准确率之间的权衡,并表明一个通用的泰米尔语适应指令模型在没有特定…
-
新型AI模型可从静态图像中重建手写轨迹
研究人员开发了一种新颖的两阶段框架用于手写轨迹恢复,旨在从静态图像中重建书写过程的时间信息。第一阶段使用自回归预测模型提取和排序笔画实例,该模型比事后排序方法更有效。第二阶段则重建连续的笔画内运动。该方法在中国手写体上表现出优越的性能,并显示出对英语和泰米尔语脚本的泛化能力。
-
新基准揭示大型语言模型在印度语言和翻译机制方面存在困难 · 跟踪3个来源
研究人员开发了VakyArth,这是一个新的基准,旨在评估大型语言模型(LLMs)在印地语、旁遮普语、泰米尔语和马拉雅拉姆语等印度语言中的语用能力。初步研究结果显示,在解释这些语言中通过上下文和文化习俗暗示的含义时,大型语言模型存在持续的失败,并且在不同语言和任务中的表现差异很大。此外,另一项独立研究对多语言大型语言模型中“潜在语言”的解释提出了质疑,认为当前的探测可能揭示了多语言处理的不同方面,而不是单一的内部通用语。另一篇论文提出…
-
新基准评估印地语、泰卢固语和泰米尔语中的 AI 生成文本检测
研究人员推出了 IndicDetect,这是一个旨在评估 AI 生成文本检测模型在印地语、泰卢固语和泰米尔语中有效性的新基准。该基准旨在评估检测器在真实世界分布变化(包括领域、生成器和对抗性扰动)下的鲁棒性。研究结果表明,虽然监督式神经网络检测器在分布内数据上表现良好,但在看不见的生成器和对抗性攻击下,无训练方法性能会显著下降,其中印地语的性能下降最为明显。
-
新框架支持对斯里兰卡议会辩论进行三语主题建模
研究人员开发了一个新颖的框架,用于对斯里兰卡的国家议会辩论进行主题建模,这些辩论包含僧伽罗语、泰米尔语和英语。该系统通过采用基于LLM的文本提取以及多语言嵌入和聚类管道,克服了复杂的PDF布局、多语言脚本和黏着语形态带来的挑战。BiTopic扩展进一步提高了可解释性和降噪能力。该框架应用于2017-2026年超过19,000场演讲,成功识别出30个宏观主题,与2019年复活节爆炸案和2022年经济危机等重大国家事件相吻合,其表现优于传…
-
新基准揭示大型语言模型中的跨语言偏见
一项名为INCLUDE的新基准已被开发出来,用于评估大型语言模型(LLMs)在各种印度语言中的社会文化偏见。目前,大型语言模型的安全对齐主要集中在英语上,这可能导致在多语言环境中使用这些模型时产生潜在危害。INCLUDE基准包含2,604个英语、印地语、孟加拉语、马拉地语、泰米尔语和混合英语(Hinglish)的提示,用于评估十个大型语言模型。结果表明,在开源模型中,孟加拉语表现出最高的平均偏见;而在开源模型中,英语偏见最低,但在闭源…
-
Sarvam-105B 模型跨语言安全性测试
一项关于 Sarvam-105B 模型的研究,调查了链式思考监控作为安全信号在英语、泰米尔语和唐lish语中的可靠性。初步研究结果表明,推理可能会减少成功的提示注入,但后续实验显示出相反的趋势。研究观察到,表明有意忽略注入的输出通常是良性的,而有意遵循注入的输出更有可能成功攻击。然而,该研究规模小且场景有限,无法就推理对安全性的影响或其普遍性得出明确结论。
-
泰米尔语和马拉雅拉姆语 OCR 在复杂元音符号放置方面遇到困难
泰米尔语和马拉雅拉姆语脚本的光学字符识别 (OCR) 主要在元音符号方面面临挑战,原因是其放置方式以及与辅音的复杂交互。这些脚本是元音音节文字,其中元音符号附加到辅音上,导致处理视觉顺序而非存储顺序的 OCR 引擎出错。问题因分为两部分的元音符号(显示为独立的墨迹区域)以及与辅音融合形成独特字形的元音符号而加剧。通过检查音节簇开头或位于其他依赖元音符号之前的依赖元音符号,可以帮助识别和纠正这些 OCR 错误。
-
僧伽罗语-泰米尔语跨语言信息检索研究:嵌入模型优于翻译模型
一篇新研究论文评估了使用僧伽罗语和泰米尔语查询访问英文政务信息的跨语言信息检索(CLIR)方法。该研究比较了查询翻译技术(包括 Google Translate、NLLB-200 和 mBART50)与跨语言嵌入模型(如 LaBSE、Multilingual E5 和 BGE-M3)的性能。在斯里兰卡政府信息中心的基准数据集上进行的实验表明,虽然两种方法都比单语方法提高了检索准确性,但 BGE-M3 嵌入模型取得了最高的性能,证明了其…
-
单语模型在达罗毗荼语系上优于多语模型
研究人员开发并评估了五个GPT-2架构模型,以评估多语语言模型在达罗毗荼语系上的表现。其中四个模型分别针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语进行了单语训练,每个模型都有自己的分词器。第五个模型进行了多语训练,在所有四种语言之间共享一个分词器。研究发现,在情感分类和命名实体识别等任务上,单语模型的表现优于多语模型mGPT,并且显示出更高的分词器效率。
-
分词溢价为非英语语言制造人工智能成本障碍 · arXiv cs.CL
一项发表在arXiv上的新研究介绍了分词公平性审计(TEA),这是一个旨在衡量大型语言模型对不同语言分词差异的基准。研究发现,与英语相比,孟加拉语、印地语和约鲁巴语等语言的语义等效内容可能需要更多的分词,这会影响API成本、延迟和有效上下文窗口长度。这种分词溢价因模型和分词器而异,凸显了依赖人工智能工具的服务欠缺语言社区可能面临的经济和功能障碍。
-
新的MERaLiON-GR模型在多种语言上实现了最先进的性别识别
研究人员开发了MERaLiON-GR,这是一种新颖的语音性别识别模型,能够对英语和多种东南亚语言的性别进行分类。该模型基于MERaLiON-SpeechEncoder-2(一种基于Conformer的Transformer)构建,并利用低秩自适应(LoRA)进行高效微调。在包括中文、马来语、泰米尔语、泰语、越南语、印度尼西亚语和高棉语在内的各种评估模式和语言中,MERaLiON-GR的表现优于Vox-Profile和大型Audio-L…
-
研究质疑破译印度河文字的统计方法
一篇新发表在arXiv上的研究论文质疑了用于破译古代文字(特别是印度河文字)的统计度量的有效性。该研究引入了SIGIL,一个旨在模拟结构化非语言系统的生成性符号系统,并发现应用于印度河文字的常见统计测试在应用于SIGIL时也能产生类似结果。这表明这些度量可能不够具体,无法明确证明未破译的文字编码了语言,因为它们可以在不一定识别出语言内容的情况下检测到组织结构。
-
泰米尔语模型获得形态感知增强,翻译能力提升
研究人员为泰米尔语模型开发了一种新颖的形态感知系统,增强了翻译能力。该系统集成了ThamizhiMorph分析器和生成器,以及一个字节精确语义分词器和一个学习到的分层词组合器。该方法将词语分解为词元和语法特征,通过字符和字节回退保留精确重构。评估表明,这种基于形态的分词比现有的基线(如AI4Bharat IndicBERTv2)提高了翻译质量,并显著减少了序列长度和估计的推理成本。
-
新系统SIGIL质疑脚本破译的统计方法
一项新研究挑战了用于破译未知脚本(尤其是印度河谷文字)的统计方法。研究人员开发了一个名为SIGIL的生成性符号系统,该系统模仿了印度河谷文字的统计特性,但并未编码语言。在测试中,SIGIL在各种度量标准上产生了与印度河谷文字相似的统计特征,表明这些方法不足以确认语言编码。该研究还表明,英语、梵语和泰米尔语可以在SIGIL的语料库上实现高词典覆盖率,进一步凸显了这些统计方法在破译方面的局限性。