PulseAugur
中
实时 16:27:29
实体 Marathi

Marathi

PulseAugur coverage of Marathi — every cluster mentioning Marathi across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
12
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
11
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. RESEARCH · CL_280122 ·

    新数据集量化了15种语言的AI能力迁移

    引入了一个名为Multilingual GSM-Symbolic的新数据集,以更好地理解AI模型能力如何在不同语言之间迁移。该数据集包含15种语言的30,000个匹配的项目问答对,有助于量化影响这种迁移的关键因素,例如模型大小、语言资源可用性和推理能力。研究表明,模型大小和推理能力显著缩小了低资源语言和高资源语言之间的性能差距,其研究结果解释了大部分跨语言差异。

  2. TOOL · CL_239309 ·

    新的MMTClinic基准测试LLM在多语言临床时间序列数据上的表现

    研究人员推出了MMTClinic,这是一个旨在评估大型语言模型(LLM)在临床时间序列数据上表现的新基准。该基准包含文本、医学影像和生理信号,涵盖五种语言(英语、印地语、孟加拉语、马拉地语和泰米尔语)的30,000个问答对。MMTClinic旨在评估LLM在关键临床任务上的能力,如死亡率预测、心率预测和SOFA评分估算,评估结果显示模型、语言和数据模态之间存在显著的性能差异。

  3. RESEARCH · CL_231357 ·

    新基准揭示大型语言模型在印度语言和翻译机制方面存在困难 · 跟踪3个来源

    研究人员开发了VakyArth,这是一个新的基准,旨在评估大型语言模型(LLMs)在印地语、旁遮普语、泰米尔语和马拉雅拉姆语等印度语言中的语用能力。初步研究结果显示,在解释这些语言中通过上下文和文化习俗暗示的含义时,大型语言模型存在持续的失败,并且在不同语言和任务中的表现差异很大。此外,另一项独立研究对多语言大型语言模型中“潜在语言”的解释提出了质疑,认为当前的探测可能揭示了多语言处理的不同方面,而不是单一的内部通用语。另一篇论文提出…

  4. TOOL · CL_225561 ·

    使用 Llama 3.1 8B LoRA 和 IndicF5 改进马拉地语 TTS

    一位开发者详细介绍了他们为马拉地语创建更自然文本转语音(TTS)系统的过程。该项目涉及清理和处理混乱的、代码转换的马拉地语文本,以训练本地 Llama 3.1 8B LoRA 模型。然后,开发者使用 IndicF5 从该模型合成语音,并在此过程中遇到并记录了问题。

  5. TOOL · CL_210381 ·

    新基准揭示大型语言模型中的跨语言偏见

    一项名为INCLUDE的新基准已被开发出来,用于评估大型语言模型(LLMs)在各种印度语言中的社会文化偏见。目前,大型语言模型的安全对齐主要集中在英语上,这可能导致在多语言环境中使用这些模型时产生潜在危害。INCLUDE基准包含2,604个英语、印地语、孟加拉语、马拉地语、泰米尔语和混合英语(Hinglish)的提示,用于评估十个大型语言模型。结果表明,在开源模型中,孟加拉语表现出最高的平均偏见;而在开源模型中,英语偏见最低,但在闭源…

  6. RESEARCH · CL_206281 ·

    新研究探索用于大型语言模型的高级分词,提高效率和性能 · 已追踪 4 个来源

    研究人员正在开发用于大型语言模型中文本分词的新方法,以提高效率和性能。一种名为 SuTRA 的方法侧重于形态丰富的语言(如印地语、马拉地语和古吉拉特语)的形态结构,减少了碎片化并改进了机器翻译。另一项开发 TokEval 提供了一套评估分词器的指标,超越了基本的压缩,评估了 UTF-8 完整性和数字对齐等属性,这些属性与下游任务性能相关。此外,一项试点研究探索了使用轻量级自回归模型自动完成分词器,以压缩字节级序列,在不牺牲质量的情况下…

  7. TOOL · CL_117780 ·

    LLM管道在马拉地语到英语翻译中保留文档结构

    研究人员开发了一个新颖的框架,用于将政府文件从马拉地语翻译成英语,特别解决了保留文档结构和格式的挑战。该系统集成了布局感知OCR、基于坐标的文本提取和大型语言模型,以确保翻译后的文档保持其原始布局和层次结构元素。在真实的马拉地语政府PDF上进行的评估表明,与仅文本的翻译方法相比,这种方法显著提高了结构保留、翻译连贯性和术语一致性,旨在提高电子政务中的多语言可访问性。

  8. RESEARCH · CL_107785 ·

    发布新的马拉地语词性标注数据集和BERT模型

    研究人员推出了L3Cube-MahaPOS,这是一个用于马拉地语词性(POS)标注的新数据集,解决了该语言标注资源稀缺的问题。该数据集包含32,000多句新闻文本中的手动标注句子,并与通用依存关系对齐。它被用于对六个模型家族进行基准测试,表现最好的系统达到了88.67%的词级别准确率和81.67%的宏F1分数。该数据集、标注指南和训练好的模型正在发布,以促进马拉地语自然语言处理的进一步研究。

  9. RESEARCH · CL_95877 ·

    新的 N-VSSM 模型在长篇叙事一致性方面超越 Claude Opus 4.5

    研究人员开发了 NarrativeWorldBench,这是一个旨在评估大型语言模型 (LLM) 在长篇音频戏剧中保持叙事一致性能力的新基准。目前的尖端 LLM 在超过 200 集的叙事弧方面存在困难,情节节拍 F1 分数饱和在 0.8 左右。为解决此问题,他们引入了 N-VSSM,一个利用 Mamba-2 主干的叙事变分状态空间模型,该模型在各种周期中实现了至少 0.84 的情节节拍 F1 分数,并在与专业作者的合作研究中证明了比 …

  10. RESEARCH · CL_79140 ·

    新数据集AgriGov助力印度农民AI应用

    研究人员开发了AgriGov,一个旨在改进印度农民AI工具的新多语言数据集。该数据集侧重于政府计划和福利政策,最初涵盖英语、印地语和马拉地语的50项计划。它通过自动化抓取和涉及Google Translate、MarianMT以及人工后期编辑的翻译流程创建,产生了约8,000个平行句子对。

  11. RESEARCH · CL_53584 ·

    新的马拉地语数据集BhashaSetu提高了低资源翻译质量

    研究人员推出BhashaSetu,一个旨在改善马拉地语低资源机器翻译的新数据集。该数据集包含278万个句子对,涵盖多个领域,包括用于形态感知分析的词干和词形还原表示。实验表明,语料库级别的去重显著提高了翻译质量,突显了数据卫生对于形态丰富的语言的重要性。BhashaSetu数据集现已公开提供,以支持该领域的重现性研究。

  12. TOOL · CL_29391 ·

    LLMs通过调整流畅性来改进多语言语音纠错

    研究人员开发了一种新方法,利用大型语言模型(LLMs)来纠正多语言语音转录中的不流畅之处。该流程首先识别不流畅的词元,然后利用这些信号对LLM进行微调,以将转录稿改写为流畅的文本。添加了一个对比学习目标来惩罚不流畅词元的再现,确保语法和含义得以保留。在印地语、孟加拉语和马拉地语进行的实验表明,与现有基线相比有显著改进,为语音驱动的NLP系统提供了实用的解决方案。