Turkish
PulseAugur coverage of Turkish — every cluster mentioning Turkish across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
提示词工程:原生撰写类似输出的文本,指令可翻译
一种新的提示词工程方法提出,只有提示词中与期望输出相似的部分应使用目标语言原生撰写,而指令和辅助性内容则可以使用模型最理解的语言。该方法源于语言模型主要模仿其续写文本风格的理解。翻译后的提示词常引入“翻译腔”,包括省略主语代词、生硬的复合词、不恰当的礼貌用语以及不自然的语调,导致输出听起来像翻译过来的。通过将类似输出的文本与指令性文本分开,可以优化提示词,以获得更好的模型性能和更自然的输出结果。
-
新方法从广播新闻中学习手语表示
研究人员开发了一种从广播新闻字幕中学习手语表示的方法,由于口语和手语之间的对齐松散,这些字幕提供了弱监督。这种方法对于土耳其语等资源受限的语言尤其有益,因为密集的语言标签成本高昂。通过结合基于规则和LLM辅助的规范化,他们在TSL-News语料库上预训练了一个可重用的手语编码器。该编码器显著提高了跨数据集手语识别的性能,将时间定位的平均IoU从0.235提高到0.465,并增强了下游翻译任务。
-
GFlowNets 被用于生成新的英文和土耳其文 LLM 攻击
研究人员开发了一种使用 GFlowNets 自动生成针对大型语言模型 (LLM) 的对抗性攻击的新方法。该方法训练一个攻击者模型来识别受害者 LLM 中的漏洞,并提供量化的鲁棒性分数。该系统旨在适应性强且独立于人类,目标是产生比当前基准更有效的攻击。值得注意的是,这项研究引入了除英语外,还能生成土耳其语攻击输入的能力。
-
AssemblyAI推出Universal-3.5 Pro,扩展多语言转录功能
AssemblyAI发布了其Universal-3.5 Pro模型,增强了其多语言转录能力。该新模型支持18种语言的自动语言检测和原生语码转换,远超其上一代。通过回退到Universal-2来处理不支持语码转换的99种以上语言,该模型提供了更高的准确性和更无缝的体验,可在单次API调用中处理多样化的语言内容。
-
AI代理的提示注入检测器在非英语攻击上失效
对一个开源代理框架的安全审计揭示了其提示注入检测系统存在一个重大漏洞。该扫描器会检查上下文文件、内存写入和工具输出,但在使用英语以外的语言进行提示注入攻击时,未能检测到。虽然像Unicode字符或API密钥泄露这样的技术伪影无论何种语言都能被检测到,但法语、西班牙语、德语和其他语言的书面攻击却被一贯地忽略了。这表明该系统的有效性仅限于英语提示,使得部署容易受到简单的基于翻译的绕过攻击。
-
HukukBERT:土耳其法律文本新语言模型
研究人员开发了HukukBERT,一个专门用于处理土耳其法律文本的语言模型。该模型使用混合预训练方法,结合了各种掩码技术,在大量的土耳其法律文件语料库上进行了训练。HukukBERT在法律文本分析基准测试中表现出色,包括预测掩码法律术语和分割判决书,其性能优于现有的土耳其语语言模型。
-
突厥语族的跨语言迁移在特定语对上表现出强劲性能
研究人员调查了突厥语族内部机器翻译的跨语言迁移技术,重点关注土耳其语、阿塞拜疆语、乌兹别克语、哈萨克语和吉尔吉斯语。他们的发现表明,迁移在密切相关的语对之间最为有效,例如土耳其语和阿塞拜疆语,或哈萨克语和吉尔吉斯语。研究还强调,迁移方向会影响性能,并且在某些情况下,使用拉丁字母可以提高BLEU和chrF等翻译指标,但并非在所有指标上都普遍适用。
-
研究论文指出LLM-作为-裁判合成语料库存在结构性缺陷
一篇新的研究论文强调了在创建用于评估大型语言模型(LLM)作为裁判的合成数据集时存在的一个关键问题。研究表明,为这些数据集生成“幻觉”答案的过程可能会悄无声息地失败,导致结果失真或不准确。这种在多语言语料库中观察到的故障模式导致了裁判准确率的显著下降,并改变了其他测量偏差的大小,而这些偏差无法通过标准的统计检查来检测。该论文为LLM生成的语料库引入了“测试预言机问题”,并提出与那些仅依赖LLM生成的负面示例的语料库不同,通过对正确答案…
-
研究发现,医疗领域大语言模型在跨语言事实核查方面存在显著差异
一篇新的arXiv论文强调,在回答医疗相关问题时,大语言模型(LLMs)在不同语言之间存在显著的事实准确性差异。研究人员从维基百科创建了一个多语言数据集,以分析跨语言覆盖范围和LLM响应的一致性。研究发现,即使在其他语言提示下,LLMs也倾向于更紧密地与英文维基百科内容保持一致。然而,在推理过程中提供来自非英文维基百科的上下文信息,可以提高与文化相关知识的事实一致性,这为在医疗领域构建更公平的多语言AI系统指明了方向。
-
土耳其语研究质疑LLM对讽刺的理解能力
大型语言模型(LLM)可能难以理解讽刺,因为它依赖于语境和语言细微差别,这与情感分析等简单任务不同。Acıbadem大学与Dedecta合作的一个项目,通过构建一个土耳其语讽刺探测器来探讨这一挑战。该研究强调了LLM在试图解读讽刺语言时,在语用理解和统计模式匹配之间的区别。
-
跨语言迁移学习在低资源ASR方面效果不一
研究人员探索了跨语言迁移学习以改进低资源语言的自动语音识别(ASR)。一项研究成功利用僧伽罗语提升了迪维希语ASR,通过持续预训练和微调实现了12.89%的词错误率(WER)。相比之下,另一项研究发现,对于大规模多语言ASR模型,在相关辅助语言上进行预适应并未显著提升低资源非洲语言的性能,表明在这种情况下,语言相关性本身可能不足够。
-
研究发现,AI代理的评估排名因评委语言而异
一篇新的研究论文探讨了用于评估AI代理的语言如何显著影响其性能排名。该研究将“代理即评委”框架的提示本地化为五种不同的语言,发现GPT-4o和Gemini等不同的AI骨干网络在特定语言中表现最佳。这表明语言应被视为代理基准中的一个关键变量,因为它甚至可以改变一个模型相对于另一个模型的感知优势。
-
新的BERT模型处理土耳其语和阿拉伯语中的仇恨言论
研究人员开发了先进的基于BERT的模型,用于检测土耳其语和阿拉伯语中的仇恨言论。该研究引入了一个涵盖土耳其语五个主题(包括难民、以色列-巴勒斯坦冲突和LGBTQ+问题)以及阿拉伯语一个关于难民的主题的新数据集。这些模型旨在进行全面的分析,例如对仇恨类别进行分类、预测强度、识别目标以及检测仇恨内容的具体范围。
-
新的ToxiREX数据集解决了六种语言中的隐式毒性问题
研究人员推出ToxiREX,一个旨在捕捉在线对话中隐式和上下文相关毒性的多语言新数据集。该数据集包含Reddit评论线程,使用结构化的毒性推理模式进行标注,并包含六种语言的内容。ToxiREX旨在通过考虑对话上下文来提供对毒性更细致的理解,这是以前的数据集中不存在的特征。初步实验表明,虽然语言模型在此任务上的表现优于随机猜测,但仍需显著改进。
-
LLM 在使用新的音频-文本数据集检测土耳其诈骗方面接受测试
研究人员探讨了大型语言模型 (LLM) 在检测土耳其语(一种低资源语言)电话诈骗方面的有效性。他们引入了一个包含 100 对诈骗和正常对话的对齐音频-文本记录的新数据集。该研究评估了七个 LLM,包括 Gemini 2.5 变体、GPT-4o 和 Qwen 模型,使用了原始音频、自动转录文本和人工校正的转录文本。结果表明,基于文本记录的输入比直接音频处理更有效,而人工校正和未校正的转录文本表现相似。
-
Morpheus:新的土耳其语模型实现了卓越的形态学对齐
研究人员开发了 Morpheus,这是一种专为土耳其语设计的新型神经分词器和词嵌入器。与可能破坏土耳其语黏着语结构的传统子词分词器不同,Morpheus 能够准确识别词素,实现无损分词并生成结构化的词嵌入。该模型在形态学对齐和词汇检索任务中表现出卓越的性能,并且与标准的子词分词器相比,在内存使用方面也显示出效率。
-
新的SindBERT模型提升了土耳其自然语言处理能力
研究人员开发了SindBERT,一个专门针对土耳其语的新型大规模RoBERTa语言模型。SindBERT在超过300 GB的土耳其语文本上进行了训练,有base和large两种配置,是该语言首个此类编码器模型。在各种自然语言处理任务上的评估显示出具有竞争力的性能,尽管large版本并未持续优于更小、更精选的模型,这表明语料库质量对于形态丰富的语言至关重要。
-
新的土耳其语嵌入模型实现 8K 上下文窗口
研究人员开发了 embeddingmagibu-200m,这是一款新的专注于土耳其语的句子嵌入模型,可显著增强语义搜索及相关任务。该模型拥有 768 维向量输出和 8,192 个 token 的上下文窗口,相比之前的基于 BERT 的土耳其语编码器有了巨大提升。适配过程包括优化分词器、克隆教师模型和采用离线蒸馏,最终得到一个参数量为 200M 的模型,该模型训练高效且成本效益高。
-
新的土耳其语嵌入模型通过高效适配实现SOTA
研究人员开发了一个新的、专注于土耳其语的句子嵌入模型embeddingmagibu-200m,该模型在需要更少计算资源的情况下,显著优于更大的教师模型。该模型是通过一个三阶段的适配过程创建的,包括一个定制的、针对土耳其语优化的分词器、克隆教师模型的架构,以及从预计算的嵌入中进行离线蒸馏。这种方法产生了一个拥有2亿参数的模型,在土耳其语基准测试中取得了最先进的性能,并附带所有必要的工件以供复现。
-
文化演化理论解释模型崩溃
研究人员将模型崩溃(大型语言模型在训练自身输出来进行训练时会退化)这一现象重新解读为一种文化演化过程。通过应用迭代学习理论,他们使用LLaMA-2-7B和Mistral-7B模型在多种语言上推导并测试了五个预测。一个关键发现是,在未经筛选的自训练过程中,组合性最初会增加然后减少,这种模式即使在正则化数据下也持续存在,并且只有通过任务基础的筛选才能缓解。