computational linguistics
PulseAugur coverage of computational linguistics — every cluster mentioning computational linguistics across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新证明加强了 O2 的 MCFG 对语言学和代数的表征
这篇提交至 arXiv 的论文,通过一个新证明,加强了对 $O_2$ 作为多重上下文无关文法 (MCFG) 的理解。该研究侧重于字符串元组的因子分解,提供了比先前已建立的定理更稳健的表征。这些发现可能在计算语言学和计算代数领域都有应用。
-
代数统计方法通过签名识别概率结构
研究人员开发了一种新颖的代数统计方法,用于识别经验概率张量中的概率结构。该方法将消失的二项式视为环状模型的“代数签名”,从而无需参数估计即可通过签名匹配实现结构学习。通过关注一类计算上易于处理的称为 Kronecker-stack 类别的配置矩阵,该方法将最小不变约束(MIC)定义为表征每个签名的基本单元,并推广了独立性的概念。该技术在合成和大规模真实语言数据上的有效性得到了证明,识别出的秩一结构与可解释的词集相关,表明其在计算语言学…
-
语言学家质疑 AI 的“智能”及其与优生学的历史联系
计算语言学学者 E. Bender 博士在 Polytechs 播客上讨论了 AI 和生成式 AI 的现状。她担心公众被误导,认为 GenAI 具有革命性,并称其为“文本挤出机”,而非真正智能的系统。Bender 博士强调了 AI 与种族主义和优生学等概念的历史联系,并质疑 AI 生成不准确内容的“幻觉”一词,建议为这些统计排序机的输出提供替代描述。
-
研究表明神经网络语言模型在其内部表示中编码语法性
一篇新的研究论文探讨了神经网络语言模型(NLMs)是否能通过检查其内部表示来区分语法正确和不语法正确的句子,而不仅仅是概率分配。研究使用了一种称为质量均值探测(mass-mean probing)的技术,发现语法性在各种预训练NLMs的表示中被一致地编码。这种编码似乎在不同的语法现象中都很稳健,甚至在一定程度上可以泛化到不同语言,这表明语法性是这些模型中的一个独立维度。
-
DiscoExplorer 接口助力多语种话语关系研究
研究人员开发了 DiscoExplorer,一个开源的 Web 接口,旨在促进多语种话语关系的研究。该工具公开了 DISRPT 共享任务的数据集,涵盖 16 种语言。DiscoExplorer 提供查询语言、搜索和可视化功能,用于分析话语关系及其信号装置,例如连接词。
-
综述详述了表征语言中语义变化的各种方法
本综述论文探讨了表征语言中语义变化的各种方法,这种现象会影响翻译和信息检索等计算语言学任务。它正式定义了语义变化的三个类别:一般性的改变、情感(贬义或褒义)的转移以及上下文使用(例如,隐喻或转喻)的变化。本文旨在概述现有方法并确定该领域的未来研究方向。