PulseAugur
实时 04:22:00
实体 Malayalam

Malayalam

PulseAugur coverage of Malayalam — every cluster mentioning Malayalam across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 9
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 8
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 9 条
  1. RESEARCH · CL_206307 ·

    发布了用于印度语言质量估计和后编辑的新基准

    研究人员推出了 IndicQE-APE,这是一个旨在整合和评估印度语言质量估计和自动后编辑的新基准。该基准结合了 WMT 共享任务的数据和一个扩展的英语-马拉雅拉姆语资源,创建了一个包含九种语言对的超过 126,000 个实例的数据集。该研究在此新数据集上对几个大型语言模型和 COMET 指标进行了基准测试,揭示了它们性能和跨语言评估挑战的见解。

  2. TOOL · CL_199489 ·

    泰米尔语和马拉雅拉姆语 OCR 在复杂元音符号放置方面遇到困难

    泰米尔语和马拉雅拉姆语脚本的光学字符识别 (OCR) 主要在元音符号方面面临挑战,原因是其放置方式以及与辅音的复杂交互。这些脚本是元音音节文字,其中元音符号附加到辅音上,导致处理视觉顺序而非存储顺序的 OCR 引擎出错。问题因分为两部分的元音符号(显示为独立的墨迹区域)以及与辅音融合形成独特字形的元音符号而加剧。通过检查音节簇开头或位于其他依赖元音符号之前的依赖元音符号,可以帮助识别和纠正这些 OCR 错误。

  3. TOOL · CL_193690 ·

    单语模型在达罗毗荼语系上优于多语模型

    研究人员开发并评估了五个GPT-2架构模型,以评估多语语言模型在达罗毗荼语系上的表现。其中四个模型分别针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语进行了单语训练,每个模型都有自己的分词器。第五个模型进行了多语训练,在所有四种语言之间共享一个分词器。研究发现,在情感分类和命名实体识别等任务上,单语模型的表现优于多语模型mGPT,并且显示出更高的分词器效率。

  4. TOOL · CL_167534 ·

    新数据集用7种语言教授LLM印度知识体系

    研究人员开发了IKS-Instruct,一个旨在教授大型语言模型印度知识体系(IKS)的新多语言数据集。该数据集包含七种语言的24,000多个指令-响应对,涵盖41种教学技术,并与印度教育课程相符。评估表明,使用IKS-Instruct进行微调的7B模型在IKS特定维度上的得分与通用参考模型相当,但部署成本显著降低。

  5. TOOL · CL_167301 ·

    新的AI系统GeoMVC解决了多模态表情包中的厌女问题

    研究人员开发了一个名为GeoMVC的新系统,用于检测互联网表情包中的厌女症,这项任务因视觉和文本元素之间的相互作用以及文化背景而变得复杂。该系统采用几何交互层来对齐视觉和文本嵌入,并采用多视图共识策略来处理嘈杂的OCR和代码混合文本。GeoMVC在ICMI 2026的CC-MMD挑战赛中取得了优异的成绩,在马拉雅拉姆语分区中获得第二名,在中国语分区中获得任务A的第三名。

  6. RESEARCH · CL_167424 ·

    由于以英语为中心的训练,印度语言在大型语言模型中面临 8 倍的“分词器税”

    一篇新的研究论文强调了印度语言在通过大型语言模型处理时面临的重大劣势,这是由于子词分词造成的。这些主要在英语数据上训练的分词器,导致印度语言平均面临 8.0 倍的“分词器税”,极大地缩减了其有效上下文窗口。研究确定字节对合并失败是主要原因,但也表明多语言分词器可以显著降低这种税负,表明该问题可以通过更好的分词器设计来解决。

  7. TOOL · CL_117769 ·

    新基准和微调技术改进了印度语言的自动语音识别

    研究人员开发了 Vividh-ASR,这是一个旨在评估自动语音识别 (ASR) 模型在印度语言(特别是印地语和马拉雅拉姆语)上性能的新基准。该基准将音频分为四个级别:录音室、广播、即兴和合成噪声,以更好地诊断低资源语言的性能问题。他们的研究表明,优化学习率时机和课程排序可显著提高性能,尤其是在即兴语音方面。他们还引入了一种称为反向多阶段微调 (R-MFT) 的参数高效微调技术,该技术允许较小的模型匹配或超越经过传统微调的较大模型。

  8. RESEARCH · CL_41788 ·

    SCRIBE框架通过新的错误分析改进印度语言的自动语音识别

    研究人员推出SCRIBE,一个旨在改进印度语言自动语音识别(ASR)的新诊断框架。与传统的词错误率(WER)等指标不同,SCRIBE将错误分为词汇、标点、数字和领域实体类型,提供更细致的评估。该框架还纳入了容忍连读的对齐和领域词汇注入,以更好地处理黏着语。除了SCRIBE,该团队还发布了针对印地语、马拉雅拉姆语和卡纳达语的LLM策展管道、基准测试和开放权重丰富转录模型。

  9. RESEARCH · CL_30789 ·

    新基准解决印度语言的ASR偏见问题

    研究人员开发了Vividh-ASR,这是一个旨在评估印度语言(特别是印地语和马拉雅拉姆语)自动语音识别(ASR)模型的新基准。该基准将音频分为四个复杂性级别:录音室、广播、即兴和合成噪声,旨在解决模型在朗读语音上表现良好但在即兴音频上表现不佳的“录音室偏见”。他们的研究表明,特定的训练策略,如早期的大参数更新和难易课程,可以显著提高性能,尤其是在即兴语音方面。他们还引入了一种参数高效的训练方法,反向多阶段微调(R-MFT),该方法允许…