PulseAugur
实时 07:04:42
实体 Sanskrit

Sanskrit

PulseAugur coverage of Sanskrit — every cluster mentioning Sanskrit across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
9
90 天内 14
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 11
层级分布 · 90 天
主题
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 14 条
  1. TOOL · CL_221051 ·

    新的NLP任务以梵语词汇生成为目标,并提供基准测试

    研究人员引入了“接地词汇生成”,这是一项新的NLP任务,专注于从诗节-翻译对中提取梵语短语及其含义。他们开发了一个包含超过31,000个三元组的基准数据集,这些数据来自《罗摩衍那》和《薄伽梵往世书》,并提供了短语恢复和语义一致性的评估指标。使用Gemma和Qwen等各种模型的实验表明,指令微调显著提高了性能,尽管与梵语复合词相关的形态学挑战仍然是一个瓶颈。

  2. RESEARCH · CL_210273 ·

    新的OCR方法改进梵文手稿数字化

    研究人员开发了一种用于光学字符识别(OCR)的迭代微调方法,以改进复杂历史梵文手稿的数字化。该方法可适应手稿特定的布局和外观,减少了对大量手动注释的需求。该研究还对多模态大型语言模型在为此任务创建的新数据集上的性能进行了基准测试。

  3. RESEARCH · CL_199488 ·

    泰语、高棉语、韩语和埃塞俄比亚文字的OCR挑战详述

    像泰语、高棉语、韩语和埃塞俄比亚语这样的文字的光学字符识别(OCR)面临着不同于标准拉丁字母文本的独特挑战。泰语OCR由于词语之间没有空格,在词语分割方面存在困难,需要基于词典的方法。高棉语OCR面临堆叠的辅音下标和可能被标准识别模型丢失或误解的小型变音符号的问题。韩语OCR因历史上混合使用谚文和汉字而变得复杂,在有限的谚文数据集上训练的模型可能会错误地替换汉字。埃塞俄比亚文字是一种音节文字,其字符家族内部存在系统性的混淆,这意味着错…

  4. TOOL · CL_183298 ·

    新AI方法聚焦韵律,增强梵语诗歌生成

    研究人员开发了Pingala,一种新颖的梵语诗歌生成解码方法,强调韵律和语义连贯性。通过将诗句分割成分组的行并偏好较长的词元,Pingala在保持格律一致性的同时,将语义连贯性提高了10%。该系统还利用了具有语音感知能力的音译方案SLP1,当与Phi-4等指令微调的大型语言模型一起使用时,可将格律对齐度提高46%。

  5. TOOL · CL_183251 ·

    研究质疑破译印度河文字的统计方法

    一篇新发表在arXiv上的研究论文质疑了用于破译古代文字(特别是印度河文字)的统计度量的有效性。该研究引入了SIGIL,一个旨在模拟结构化非语言系统的生成性符号系统,并发现应用于印度河文字的常见统计测试在应用于SIGIL时也能产生类似结果。这表明这些度量可能不够具体,无法明确证明未破译的文字编码了语言,因为它们可以在不一定识别出语言内容的情况下检测到组织结构。

  6. TOOL · CL_190061 ·

    新系统SIGIL质疑脚本破译的统计方法

    一项新研究挑战了用于破译未知脚本(尤其是印度河谷文字)的统计方法。研究人员开发了一个名为SIGIL的生成性符号系统,该系统模仿了印度河谷文字的统计特性,但并未编码语言。在测试中,SIGIL在各种度量标准上产生了与印度河谷文字相似的统计特征,表明这些方法不足以确认语言编码。该研究还表明,英语、梵语和泰米尔语可以在SIGIL的语料库上实现高词典覆盖率,进一步凸显了这些统计方法在破译方面的局限性。

  7. TOOL · CL_167534 ·

    新数据集用7种语言教授LLM印度知识体系

    研究人员开发了IKS-Instruct,一个旨在教授大型语言模型印度知识体系(IKS)的新多语言数据集。该数据集包含七种语言的24,000多个指令-响应对,涵盖41种教学技术,并与印度教育课程相符。评估表明,使用IKS-Instruct进行微调的7B模型在IKS特定维度上的得分与通用参考模型相当,但部署成本显著降低。

  8. TOOL · CL_167533 ·

    新的BHARATI分词器提高了古典印度语言的效率

    研究人员开发了BHARATI,这是一套专为梵语和泰米尔语等古典印度语言设计的新分词器。与难以处理这些语言的黏着语形态和 संधि(sandhi)的标准算法不同,BHARATI实现了更有效的分段。这导致序列长度缩短,有效地增加了下游语言模型的上下文窗口,并提高了在专门的印度知识体系术语上的性能。

  9. TOOL · CL_149349 ·

    新文本转语音系统Vāgdhenu生成梵语吟诵

    一个名为Vāgdhenu的新文本转语音系统已被开发出来,用于生成梵语吟诵。该系统旨在准确再现传统梵语诵读所需的语调和发音。该项目已在Hacker News上分享,可通过prathosh.in访问。

  10. COMMENTARY · CL_174599 ·

    终身学习被斥为骗局;单细胞生物被誉为真正的学习者

    终身学习的概念被批评为一种普遍的幻觉,传统的教育和企业培训往往只是记忆或工作表现,而不是真正的技能获取。作者认为,即使是哲学追求和AI生成的励志内容也未能代表真正的学习。相反,单细胞生物和野生动物因其持续的适应和创新而被认为是真正的终身学习者,这与人类容易遗忘的倾向形成对比。

  11. TOOL · CL_109467 ·

    计算语言学研究分析宗教文本中的词汇传播 · 追踪到4个来源

    两项新的计算语言学研究分析了宗教文本中的词汇传播和风格特征。第一篇论文考察了8至19世纪的孟加拉语和梵语虔诚文学,使用TF-IDF和余弦相似度量化佛教、Shakta和Vaishnava传统之间的词汇重叠。第二项研究将风格计量分析应用于佛教巴利三藏的英译本,使用齐夫分布、TTR和词汇重叠指标比较经藏、律藏和论藏文本。

  12. RESEARCH · CL_107811 ·

    帕尼尼语法为印度语言自然语言处理提供统一框架

    一篇新研究论文提出了一种面向印度语言的统一计算框架,其灵感来源于帕尼尼语法。作者认为,这些语言之间共享的形态句法结构,在帕尼尼的《八章书》中得到了形式化,可以作为自然语言处理的统一基础。该方法旨在通过将分散的语言资源合并为一个高资源元语言基石,来提高面向超过十亿用户的自然语言处理工具的准确性、数据效率和可迁移性。该论文引入了一个四部分组成的基准套件,用于衡量和利用这种共享架构,同时也引发了关于神经模型可解释性的问题。

  13. TOOL · CL_28334 ·

    NoRIN 通过非线性归一化推进时间序列预测

    研究人员推出了一种新颖的非线性可逆归一化技术 NoRIN,用于时间序列预测,该技术超越了 RevIN 等现有方法的线性仿射变换。与 RevIN 的局限性不同,NoRIN 使用 Johnson $S_U$ 变换,其参数可以调整分布尾部和偏度。该方法将形状参数优化与梯度训练分离,使用分位数拟合和贝叶斯优化来防止模型默认为线性形式,证明了不同的网络架构受益于不同的归一化参数。

  14. RESEARCH · CL_09818 ·

    研究人员创建Naamah,一个使用LLM的大型合成梵语NER数据集

    研究人员开发了Naamah,一个包含超过10万个梵语句子的大型合成数据集,旨在改进古典梵语文学的命名实体识别(NER)。该数据集通过从DBpedia提取实体并结合一个240亿参数的混合推理模型生成。Naamah旨在克服标注资源稀缺的问题,并用于对XLM RoBERTa和IndicBERTv2 Transformer架构进行基准测试。