BERTurk
PulseAugur coverage of BERTurk — every cluster mentioning BERTurk across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
微调的BERTurk在土耳其情感分析中优于LLMs
一项新研究调查了在大语言模型(LLMs)上进行微调与提示(prompting)在土耳其情感分析中的有效性。研究发现,在三分类情感分析任务中,微调的BERTurk模型优于提示的LLMs,尤其是在处理中性评论时。研究结果表明,虽然LLMs显示出潜力,但监督微调对于稳健的情感分析仍然至关重要,尤其是在包含中性类别时。
-
Morpheus:新的土耳其语模型实现了卓越的形态学对齐
研究人员开发了 Morpheus,这是一种专为土耳其语设计的新型神经分词器和词嵌入器。与可能破坏土耳其语黏着语结构的传统子词分词器不同,Morpheus 能够准确识别词素,实现无损分词并生成结构化的词嵌入。该模型在形态学对齐和词汇检索任务中表现出卓越的性能,并且与标准的子词分词器相比,在内存使用方面也显示出效率。
-
AI模型分析土耳其地震推文中应对方式
研究人员开发了一个计算模型,使用BERTurk分析2023年土耳其地震后土耳其语推文中的应对方式。该模型成功识别了三种应对方式——聚焦问题、聚焦情绪和寻求意义——宏观F1得分达到0.693。对超过一百万条推文的分析揭示了应对机制中独特的时序模式,聚焦问题应对在地震发生后立即最为普遍,而寻求意义应对随着时间的推移而增加。研究表明,愤怒与寻求意义密切相关,可能成为归咎的催化剂。
-
LLMs 在土耳其成语分类中表现出提示敏感性
研究人员调查了上下文学习在土耳其成语轻动词结构(LVCs)分类中的有效性。他们将监督式BERTurk基线与使用零样本、单样本和少样本提示的指令微调大型语言模型(LLMs)进行了比较。虽然LLMs在零样本LVC召回率方面遇到困难,但精心设计的演示的少样本提示提高了性能,其中GPT-OSS-20B和Qwen 2.5-14B表现出稳健的结果,与监督基线相当或超过了它。
-
新的SindBERT模型提升了土耳其自然语言处理能力
研究人员开发了SindBERT,一个专门针对土耳其语的新型大规模RoBERTa语言模型。SindBERT在超过300 GB的土耳其语文本上进行了训练,有base和large两种配置,是该语言首个此类编码器模型。在各种自然语言处理任务上的评估显示出具有竞争力的性能,尽管large版本并未持续优于更小、更精选的模型,这表明语料库质量对于形态丰富的语言至关重要。