Cantonese
PulseAugur coverage of Cantonese — every cluster mentioning Cantonese across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新框架改进了用于老年人认知激发疗法的LLM
研究人员开发了一个名为反思性认知对齐(RCA)的新框架,以提高大型语言模型(LLM)为老年人提供认知激发疗法的能力。该框架解决了数据稀缺性(尤其是在粤语等低资源语言中)以及LLM在平衡共情互动与遵守治疗方案方面的困难。RCA利用风格迁移和结构化数据提取来合成对话,然后采用一种具有协议约束推理和推理时值对齐的顺序决策过程,以确保安全性和参与度。评估表明,与标准提示方法相比,RCA显著提高了协议依从性和安全性。
-
Whisper ASR工具助力新西兰粤语口述历史转录
一篇新论文探讨了自动语音识别(ASR)工具(特别是Whisper)在多语种口述历史研究中的应用。该研究聚焦于新西兰的粤语复兴工作,发现虽然Whisper显著缩短了转录时间,但其非英语部分的词错误率(WER)可能高达12.10%。尽管如此,该工具在提供初步转录方面仍被认为很有价值。
-
粤语适配语言模型在预测人类阅读方面表现出更强的拟合度
一项发表在arXiv上的新研究调查了专门针对粤语训练的语言模型,与针对标准中文或通用模型训练的模型相比,是否能更好地预测人类阅读模式。研究人员使用了粤语使用者的眼动追踪数据,并从不同的语言模型中提取了各种语言学指标。研究结果表明,经过更广泛粤语特定训练的模型,如CantoneseLLM-7B,在预测上与人类阅读行为的对齐度更强,尽管所使用的具体指标会影响模型排名。
-
字节跳动重组AI基础模型团队,拆分为数据、RL和产品部门
字节跳动种子基础模型团队已进行重大重组,成立了四个新的主要部门:预训练数据、Horizon RL、产品后训练工作和产品后训练聊天。此次重组旨在整合相似工作,减少重叠,并更有效地协调团队。预训练数据部门将集中处理各种模态的数据工作,而Horizon RL将专注于推进模型的强化学习能力。以产品为中心的部门被拆分以满足不同的用户需求:产品后训练工作部门针对企业应用和办公场景的智能体能力,而产品后训练聊天部门则专注于优化面向消费者的产品(如豆…
-
新框架标准化汉藏语系的罗马化
研究人员推出了汉藏语系罗马化生态系统,这是一个旨在跨不同汉藏语系语言标准化罗马化的框架。该生态系统采用了四个核心设计原则,包括语音和历史-音韵对应,以确保相似的语音由相似的罗马化符号表示。该框架应用于为普通话、粤语、梅县客家话、上海吴语和南京江淮官话开发新的罗马化方案。开发的基础设施支持存储、转换、解析和词典构建,语音到罗马化的实验显示出比现有基线更高的准确性。
-
香港初创公司Votee AI推出专门的LLM,目标是服务不足的粤语使用者
香港初创公司Votee AI正在开发专门针对粤语的大型语言模型。粤语拥有超过8000万使用者,但目前的人工智能技术服务不足。通过在海量的粤语数据集上重新训练Meta和阿里巴巴等开发者的开源模型,Votee旨在让本地教育、医疗和交流更容易获得和使用人工智能。他们的方法结合了在线抓取、社区数据和合成数据生成,其模型虽然比前沿模型小,但能以显著更低的训练成本有效地理解和推理粤语。
-
研究发现:大型语言模型在粤语语法工程方面成效有限
一篇新研究论文探讨了大型语言模型(LLMs)在语法工程中的实用性,特别关注粤语。该研究使用了新的粤语 ParGram 资源,并比较了 OpenAI 的 GPT-OSS 120B 和 GPT-5.4 模型。虽然 GPT-5.4 取得了更好的结果,但两个模型在协调复杂的正式语法约束方面都遇到了困难,这表明人类语言学专业知识在语法开发中仍然至关重要。
-
大语言模型在辅助粤语和爱尔兰语语法工程方面表现不一
研究人员作为平行语法(ParGram)项目的一部分,开发了新的粤语和爱尔兰语句法树库,重点在于保持跨语言的语言一致性。该研究探讨了使用大型语言模型(特别是 OpenAI 的 gpt-oss-120b)来辅助语法工程任务,如翻译和句法结构生成。尽管大语言模型在翻译准确性和捕捉跨语言抽象方面存在局限性,但它确实为分析和谓词-论元关系提供了一些有用的输出,突显了大语言模型在该领域的潜力和限制。
-
AI社区通过MiniMax蒸馏、新的ASR模型和Gemini传闻进行创新
AI社区基于MiniMax AI最近发布的权重,迅速开发了一个蒸馏LoRA模型,展示了快速的创新能力。另外,一个名为Audio8-ASR-0.1B的新开源模型已发布,支持七种语言的实时语音识别。此外,有传言称Google的Gemini 3.7 Flash已被发现,并推测Google可能因重大的计算限制和战略决策而有意推迟Gemini Pro的发布。
-
新的蒸馏方法增强了多语言语音识别系统
研究人员开发了一种名为语言专业化多教师在线策略蒸馏(LS-MOPD)的新方法,以改进多语言自动语音识别(ASR)系统。该方法解决了在具有不同特征的语言上训练单一模型时出现的优化冲突。LS-MOPD使用强化学习为每种语言训练专门的“教师”模型,然后将它们的知识蒸馏到一个通才的“学生”模型中,从而增强了语言层面的专业化和整体性能。
-
新研究通过改进的身份保持能力解决了妆容迁移问题 · 跟踪到2个来源
两篇新研究论文解决了图像中的妆容迁移挑战,旨在将化妆风格应用到源人脸,同时保持身份和精细细节。第一篇论文“Anchoring on Reality Makeup Transfer (ART)”提出了一个两阶段框架,在初始伪目标阶段后使用真实参考数据来优化结果。它还提出了 MakeupFaces2K (MF2K),一个包含 2K 分辨率化妆肖像的新数据集。第二篇论文“ConsistentBeauty and RealBeauty”提出了…
-
大学论文中的香港地图省略维多利亚港,目前正接受审查
香港教育大学发表的一篇大学论文因其包含的香港地图省略了维多利亚港而受到批评。在接到投诉后,《人文与社会科学通讯》期刊目前正在审查该论文。该大学为该地图辩护,称其侧重于行政边界而非地理海岸线,并非错误。
-
新加坡部长“没时间看电影”的玩笑引发方言辩论
新加坡代理文化、社区及青年部长 Neo Kian Hong 在议会上发表了关于部长们没时间看电影的言论。这一评论出现在关于政府在电影中推广华语方言政策的辩论中。讨论的焦点是政府是否以牺牲福建话和广东话等方言为代价来推广普通话,以及是否会放宽对媒体中使用方言的限制。
-
新的HK-LegiCoST语料库助力语音翻译研究
研究人员推出HK-LegiCoST,一个专为语音翻译研究设计的新型平行语料库。该语料库包含超过600小时的粤语音频、对应的繁体中文转录文本以及英文翻译,所有内容均在句子级别对齐。解决的一个关键挑战是非逐字转录的对齐问题,这种情况在口语和书面语形式差异显著时很常见,使其适用于存在白话和方言语音差异的语言。该语料库能够展示具有竞争力的语音翻译基线和跨语料库结果。
-
中国人工智能推动与粤语争议在周末读物中得到强调
最近的一篇周末读物强调了一位香港小姐候选人关于使用粤语的争议。此外,文章还提到了中国为解决NASA计划中存在的不足所做的努力,表明在技术和文化方面都有更广泛的讨论。
-
香港小姐选美比赛面试引发粤语流利度争论
香港小姐选美比赛因内地参赛者在面试中粤语发音不佳而面临文化争论。这引发了关于身份认同以及本地语言在保护香港文化方面重要性的讨论。虽然一些人批评参赛者的流利度,但另一些人则建议将重点放在选美比赛更广泛的文化代表性上。
-
AI模型在非英语语言方面滞后,可能加剧数字鸿沟
先进AI模型的开发严重偏向英语和少数几种主要语言,使得许多较小语种或“低资源”语言处于明显劣势。这些语言,包括粤语、越南语和印度尼西亚语,由于缺乏足够的数字数据来训练AI,导致模型生成的翻译和文本不准确或无意义。尽管Naver等公司以及印度尼西亚的合作项目正在努力创建针对特定语言和文化需求的AI,但全球AI格局仍可能加剧非英语使用者的数字鸿沟。