Hebrew
PulseAugur coverage of Hebrew — every cluster mentioning Hebrew across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AI 文本工具因以英语为中心的规则在 6 种语言中失败
一款文本改写工具在扩展语言支持范围超出英语后遇到了重大问题,尤其是在德语、日语、法语、中文、阿拉伯语和希伯来语方面。该工具以英语为中心的句子长度、标点符号、正式程度和词汇规则,在其他语言中被证明是无效的,甚至是适得其反的。例如,缩短德语中本就较长的句子,或误解中文的标点符号习惯,都导致文本听起来不自然。开发人员意识到,像正式程度(例如法语中的 tu vs. vous)和书写方向(阿拉伯语和希伯来语的从右到左)这样的语言细微差别,需要针…
-
Linguardia 平台因过度依赖 AI 和机器翻译而受到批评
一位 Mastodon 用户对语言学习平台 Linguardia 提出了担忧,声称其内容大量使用了生成式 AI 和机器翻译。该用户声称,该平台严重依赖 Tatoeba 和 Google Translate 的数据,并辅以其自己的小型翻译模型,而不是真实的、人类生成的语言对。据该用户称,这种方法导致语法分析的错误率高达近 40%,即使对于捷克语等语言,在罗马化和文本转语音方面也经常出现错误。
-
用于希伯来语和新冠肺炎死亡人数低估报告的Chrome扩展程序
此集群包含两个不同的新闻条目,第一个条目详细介绍了两个用于希伯来语文本和日期的简易Chrome扩展程序,第二个条目则报道称,全球约一半的政府可能低估了数百万的新冠肺炎死亡人数。第一个条目重点介绍了Hacker News上关于这些扩展程序的“Show HN”帖子,第二个条目则引用了Gizmodo的一篇报道,该报道基于来自134个国家的全因死亡率的全面数据集。
-
新方法提高多语言视频转录准确性
研究人员开发了提高多语言视频语音转录准确性的方法,旨在帮助创建用于跨文化理解的自动化工具。利用公开的YouTube视频和基于Whisper的工具,初步观察到七种语言的平均转录错误率为30%。通过少量微调数据,该错误率降低到20%,使转录结果更适用于下游应用。相关的语音和元数据已发布给社区,以供进一步实验。
-
Gemma-2-9B-IT模型展示了语言无关的非正式语域
研究人员在Gemma-2-9B-IT模型中识别并控制了一个语言无关的非正式语域。他们使用稀疏自编码器(SAEs)对英语、希伯来语和俄语进行了分析,发现了一个强大的跨语言非正式语言核心表征。这个被称为“非正式语域子空间”的抽象概念在模型更深的层中变得更加清晰,并且可以被操纵以因果性地改变输出的正式程度,这表明多语言LLM可以内化超越表面启发式规则的语用抽象。
-
大型语言模型在多语言自我对抗中表现出语言依赖的技能差距
一篇题为“技能问题:技能是否在大型语言模型中具有语言不变性?”的新研究论文,探讨了大型语言模型(LLMs)在不同语言中的表现差异。研究使用了一个名为TextArena的文本游戏中的多语言自我对抗设置,发现同一个LLM根据其使用的语言界面,会表现出不同的技能水平和策略倾向。在英语交互时性能通常最高,而在希伯来语等语言中性能最低,并注意到在空间推理和决策方面存在特定缺陷。研究表明,语言会显著影响LLM的决策过程,阻碍了真正多语言模型的开发。
-
AI在用户测试中未能胜任希伯来语教师
一位用户测试了AI教授希伯来语的能力,发现其不成功。该AI作为语言教师的表现被认为不足。
-
由于预处理和训练数据限制,带尼库德的希伯来语文本的光学字符识别面临挑战
带尼库德(元音符号)的希伯来语文本的光学字符识别(OCR)常常难以处理这些符号,因为在识别模型看到文本之前,多个预处理阶段会移除这些精细的标记。这些阶段包括分辨率缩放、二值化阈值处理、去噪点滤波和行分割裁剪。此外,主要在省略尼库德的现代希伯来语上训练的模型,即使尼库德得以保留,也缺乏识别这些标记所需的训练数据。常见的混淆出现在外观相似的元音符号之间,例如卡马茨(qamats)和帕塔赫(patah),或塞戈尔(segol)和舍瓦(she…
-
AssemblyAI推出Universal-3.5 Pro,扩展多语言转录功能
AssemblyAI发布了其Universal-3.5 Pro模型,增强了其多语言转录能力。该新模型支持18种语言的自动语言检测和原生语码转换,远超其上一代。通过回退到Universal-2来处理不支持语码转换的99种以上语言,该模型提供了更高的准确性和更无缝的体验,可在单次API调用中处理多样化的语言内容。
-
圣经视角质疑AI拥有灵魂的能力
文章探讨了通用人工智能(AGI)拥有灵魂的概念,并将圣经中对‘心’的定义与人类存在的中心进行了类比。文章认为,虽然AI可以高速处理海量信息,但它从根本上缺乏灵魂的组成部分,如心智、智力、情感和道德品质。这些属性源于希伯来语的‘leb’和希腊语的‘kardia’等概念,被认为是人类独有的,源于神的创造和上帝赐予的‘生命气息’,而机器无法复制。
-
人工智能协助语言学家在破译Linear A方面取得潜在突破
一位人工智能工程师声称在破译Linear A方面取得了重大突破。Linear A是克里特岛青铜时代米诺斯文明的一种未被破译的文字。该工程师使用人工智能驱动的脚本来检验一个假设,即祈祷铭文中的一个词源自闪米特语词根。据报道,这种方法使得40个符号得以赋值并编纂了词汇表,表明Linear A属于闪米特语系。虽然人工智能在检验假设和处理数据方面发挥了作用,但最初的创意构想源于人类工程师。
-
进化生物学家就小舌头在人类语音中的作用展开辩论
小舌头,即人类喉咙后部的一小块组织,是大多数哺乳动物(包括大多数灵长类动物和狗、猫等家养动物)所没有的特征。进化生物学家们正在争论小舌头是为了辅助发声而直接进化出来的,它有助于发出某些声音并封闭鼻腔,还是在促进复杂语言的声带其他变化过程中产生的附带产物。虽然它在吞咽过程中起到润滑和防止食物进入鼻腔的作用已得到充分理解,但其确切的进化起源仍然是持续的科学探究课题。
-
新论文精确描绘有界峰度下的尾部概率
研究人员确定了具有有界峰度的随机变量的精确最坏情况尾部概率。该分析定义了一个四区域图,详细说明了峰度界如何影响单侧尾部控制,揭示了四阶矩的信息可以抵消二阶矩界提供的改进。研究结果还确定了这些界所需的最小平方和证明程度,并提供了明确的对偶证书和极值分布。
-
新的深度学习框架整合组织学和基因组学以用于癌症研究
研究人员开发了JASPR,一个自监督深度学习框架,旨在整合组织学图像(HE)和空间转录组学(ST)数据。这种新颖的方法旨在捕捉两种模式的通用空间特性,同时编码模式特定的特征。JASPR已证明其在改善基因表达预测和为乳腺癌预后提供价值方面的有效性。
-
AI工程师声称已破译古代线形文字A
业余AI工程师兼语言学家Tom Di Mino声称已破译了困扰专家120多年的古代米诺斯文字——线形文字A。Di Mino提出的解决方案表明,线形文字A代表一种已灭绝的闪米特语,是圣经希伯来语的前身。他的发现目前正由罗格斯大学和剑桥大学的语言学专家进行评审。如果得到证实,这一突破可能对语言学领域产生重大影响,类似于1952年线形文字B的破译。
-
新的希伯来语G2P系统提高了文本到语音的准确性
研究人员开发了新的希伯来语字母到音素(G2P)转换方法,这对于改进文本到语音(TTS)应用至关重要。ReNikud系统利用来自未标记希伯来语音频的音频监督来生成反映自然口语规范的音素转录,克服了传统方法依赖稀缺发音数据的局限性。Phonikud是另一个框架,通过增强基础注音器来专注于生成完全指定的国际音标(IPA)转录,旨在实现更具语音准确性的希伯来语TTS。这两种方法在希伯来语G2P基准测试中的表现均优于先前最先进的方法,并且已发布…
-
Voynich Manuscript 分析揭示密码状结构约束
一篇新发表在 arXiv 上的研究论文详细介绍了对 Voynich Manuscript 的字母序列进行的系统分析,揭示了两个不同的结构层。研究发现单词内部存在字符级别的从右到左优化,而在单词边界处存在从左到右的依赖关系,这种模式在英语、法语、希伯来语和阿拉伯语等比较语言中未被观察到。研究还根据特定标准评估了生成模型,发现参数化基于槽的生成器和 Cardan grille 都无法同时重现所有观察到的特征,这表明该手稿具有复杂的、类似密…
-
新基准测试大型语言模型在阿拉伯语-希伯来语同源词歧义上的表现
研究人员开发了 SemCog Bench,这是一个旨在评估大型语言模型(LLMs)在处理阿拉伯语和希伯来语同源词方面能力的基准。该基准包含 1,858 对单词和句子级别的注释,用于测试识别和语义消歧能力。评估显示,大型语言模型在真正的同源词上表现良好,但在处理假朋友词和外来词时却面临显著困难,这表明它们依赖于表面相似性而非深层语义理解。即使有上下文线索的帮助,性能提升也很有限,这凸显了当前大型语言模型在解决跨语言意义冲突方面的根本局限性。
-
新方法改进多语言词级语音对齐
研究人员开发了一种新颖的多语言词级强制对齐方法,集成了Massively Multilingual Speech (MMS) 模型中的表示和一个自监督音素边界检测器。该方法使用学习型动态规划解码器来推断精确的词边界。该系统在TIMIT和Buckeye数据集上与Montreal Forced Aligner (MFA) 等现有方法相比,表现出优越的性能,并在未见过(unseen)的语言上显示出有希望的结果,表明其可扩展性可覆盖MMS支持…
-
中国女子发现前夫在离婚时隐藏200万美元,而她正艰难应对医疗费用
一名中国女子在离婚诉讼期间发现,她的前夫隐藏了200万美元的财产,而她却在为他施暴造成的伤势支付医疗费用。该女子(姓王)称,她十多年来一直遭受丈夫(姓何)的家暴,包括多次肋骨骨折和脑损伤。这一事件在中国社交媒体上引发了广泛的公众讨论。