Persian
PulseAugur coverage of Persian — every cluster mentioning Persian across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
大型语言模型跨语言知识迁移有限,新的蒸馏方法偏重推理 · 跟踪2个来源
两篇新研究论文探讨了大型语言模型如何获取和保留知识。第一篇论文研究了跨语言的事实知识迁移,发现模型从英语到波斯语的迁移有限,尤其是在训练数据中移除了特定事实时。第二篇论文研究了知识蒸馏技术,提出了“Switch Distillation”,该技术通过基于教师置信度和预测熵进行路由,在训练中期偏重推理而非事实回忆。
-
新框架CLIN客观评估大型语言模型在波斯文学中的创造力
研究人员开发了CLIN,一个用于客观评估大型语言模型生成的波斯短篇文学文本创造力的新框架。研究发现,大型语言模型在诸如情感和吸引力等主观创造力维度上表现不佳,而在原创性和流畅性等结构化属性方面则表现更好。CLIN利用这些维度的代理指标,与直接的大型语言模型评估相比,以更低的计算成本实现了与人类水平相当的一致性。
-
Whisper模型适配用于波斯语语音情感识别,并进行PCA降维
研究人员探索了改进低资源语言(如波斯语)的语音情感识别(SER)的方法,重点关注Whisper模型。他们的研究提出使用主成分分析(PCA)来降低Whisper的帧级嵌入的维度,从而在不牺牲性能的情况下减少可训练参数和训练延迟。虽然基于PCA的降维一致地提高了情感识别的准确性,但对波斯语自动语音识别(ASR)任务进行微调Whisper仅对SER产生了微小改进,表明语言适配对情感特定表示的迁移能力有限。
-
新型波斯语医学大语言模型家族“Gaokerena”发布
研究人员推出 Gaokerena,一个专为消费级硬件设计的新型小型波斯语医学语言模型家族。该模型家族包括 Gaokerena-V,它在一个包含 9000 万个 token 的波斯语医学语料库上进行了训练;以及 Gaokerena-R,它集成了思维链(Chain-of-Thought)和 RLAIF 以提高临床推理能力。尽管 Gaokerena-R 使用的数据集较小,但其基准测试得分高于 Gaokerena-V。两个模型都配备了不确定性…
-
血型在促销活动期间的行为差异探讨 · 已追踪 2 个来源
该集群讨论了不同血型(A、B、AB、O)在促销或自助餐活动期间可能如何影响行为。文章主要来自 Mastodon 实例,使用了与 AI 猫、英国短毛猫和波斯猫等特定猫品种相关的标签,以及促销和自助餐的通用术语。内容似乎轻松有趣且具有观察性,侧重于与血型相关的感知行为差异。
-
波斯语话语标记 'hāla' 被发现具有多种语用功能
一项新研究分析了波斯语话语标记 'hāla'(‘现在’),揭示了其超越时间用法的广泛多功能性。该研究检查了自发对话中的 267 个实例,发现 70% 的 'hāla' 标记服务于两个或多个语用角色。文本功能,如话题转换和强调,最为常见,其次是互动和情态用法。声学分析表明,持续时间和强度是区分 'hāla' 功能的关键韵律线索,文本用法较短,互动用法显示出更高的强度。
-
大型语言模型改进了低资源阿拉伯语系语言的生物医学翻译
研究人员探索了跨语言迁移学习,以改进低资源阿拉伯语系语言在生物医学领域的机器翻译。通过使用阿拉伯语和波斯语作为枢纽语言,他们使用LoRA适配器对小型仅解码器的大型语言模型进行了微调。该研究评估了三种迁移策略:少样本学习、最小监督适应和零数据LoRA适配器合并。研究发现,仅使用500句话的监督适应就显著改进了达里语和乌尔都语。适配器合并对于关系密切的语言非常有效,且不需要目标语言的生物医学数据,尽管普什图语和索拉尼库尔德语由于与枢纽语言…
-
新的合成数据集提升波斯语OCR能力
研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。
-
AI优先旅游知识平台DEHEH.COM上线
DEHEH.COM 是一个新推出的、以AI为优先的平台,专注于提供易于获取且可靠的旅游信息。该平台旨在为旅游业创建一个全面的知识图谱,涵盖国家、城市、酒店、景点、签证和汇率等详细信息。DEHEH.COM 还计划发布与旅游、技术和搜索未来相关的内容,特别是针对波斯语用户。
-
使用数据集工程和GPU技巧微调波斯语OCR模型
本文详细介绍了微调视觉语言OCR模型以支持波斯语的过程。文章强调了数据集工程和全模型微调技术的重要性,以及实用的GPU优化在此目标中的作用。作者还讨论了为什么LoRA(低秩自适应)不是此特定任务的选择方法。
-
新的ASR技术解决语音错误并提高判断可靠性
研究人员正在开发先进的方法来改进自动语音识别(ASR)系统,特别是在低资源语言方面以及解决特定类型的错误。一种名为Error-Aware TF-IDF的方法使用一种新颖的算法,根据历史语音错误识别来优先处理更正文档,从而显著降低词错误率。另一种名为G-SPIN的方法将语音图模型与大型语言模型相结合,通过将搜索空间限制在合理的语音替代方案内来纠正语义关键错误。此外,一项研究质疑用于评估LLM越狱尝试的自动判断的可靠性,揭示了其准确性和鲁…
-
研究发现,大型语言模型在将谚语翻译成忠实叙事方面存在困难
研究人员引入了一项名为“约束语义解压”的新任务,以评估大型语言模型(LLM)将抽象谚语转化为详细叙事的能力。他们使用波斯谚语和故事数据集,发现当前的大型语言模型在准确捕捉潜在的道德和因果结构方面存在困难,表现出“解压差距”。虽然模型可以生成流畅的文本,但它们常常无法忠实地表达谚语的预期含义,尽管显式推理和迭代改进等技术在提高性能方面显示出希望。
-
新的 ParsVoice 语料库提升波斯语 TTS 能力
研究人员推出了 ParsVoice,这是一个大规模的波斯语语音和文本数据新语料库,旨在推进波斯语的文本到语音(TTS)合成和其他语音处理任务。该数据集包含 2,200 小时的 TTS 就绪音频,拥有来自 1,815 名已识别说话人的超过 136 万个对齐片段,其规模远大于之前的波斯语语音数据集。创建过程涉及一个复杂的流程,包括微调 ParsBERT 模型、优化音频边界、恢复标点符号以及进行说话人识别和质量评估。通过微调多语言 TTS …
-
新数据集助力波斯语社交媒体文本分类
研究人员推出了 PerSoMed,一个新推出的用于分类波斯语社交媒体文本的大规模数据集。该数据集包含 36,000 篇帖子,涵盖九个类别,每个类别有 4,000 个样本以确保平衡。该研究对各种模型进行了基准测试,发现基于 Transformer 的架构,特别是 TookaBERT-Large,表现最佳。该资源旨在推动波斯语自然语言处理研究。
-
语音识别系统在语种转换语音上的基准测试
一项新的基准研究评估了五种商业自动语音识别(ASR)系统在语种转换语音上的表现,特别关注阿拉伯语、波斯语和德语与英语的混合。该研究引入了一个使用GPT-4o和Gemini 1.5 Pro对转录文本进行评分的新型流程,将LLM成本降低了91%,并采用BERTScore作为比传统词错误率(WER)更可靠的某些语种对的度量标准。ElevenLabs Scribe v2成为表现最佳的系统,在所有测试的语种对中实现了最低的WER和最高的BERTScore。
-
跨语言手写文本识别模型通过序列建模提高低资源性能
研究人员调查了跨语言迁移学习如何改进低资源阿拉伯语脚本语言的手写文本识别(HTR)。他们的研究表明,序列建模,而不仅仅是共享的视觉表示,是这些改进的关键,尤其是在数据稀缺的情况下。在阿拉伯语、乌尔都语和波斯语数据集上的实验表明,结合了卷积和序列建模的CRNN模型在多脚本训练时,其性能显著优于仅CNN的模型。这表明在低资源环境下,上下文理解在有效的HTR迁移学习中起着至关重要的作用。