Slovene
PulseAugur coverage of Slovene — every cluster mentioning Slovene across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
ICU MessageFormat 在语言之间标准化复数规则
ICU MessageFormat 为国际化应用程序中的复数处理提供了一种健壮的方式,将语言规则从代码移入消息。它定义了六个复数类别(zero, one, two, few, many, other),这些类别在不同语言中有不同的应用方式,数据来源于 Unicode 联盟发布的通用区域设置数据存储库 (CLDR)。该语法允许显式值匹配(例如,'=0')并使用 '#' 来表示格式化的数字,还具有 'offset' 和 'select' …
-
Unicode CLDR 为语言本地化定义了 1-6 种复数形式
根据 Unicode 联盟的通用区域设置数据存储库 (CLDR) 的定义,一种语言在软件本地化所需的复数形式数量可以从一种到六种不等。这个数量不是语言学的绝对值,而是特定数据集版本的属性。像中文和日文这样的语言只需要一种形式,因为名词不标记复数;而威尔士语和阿拉伯语则需要六种形式,因为它们有复杂的数字交互和语法规则。
-
分析发现,斯洛文尼亚语提示在大型 LLM 上表现良好
一位斯洛文尼亚开发者分析了自己向 Claude Code 提出的 2,300 条提示,发现即使存在拼写错误和混合使用的英语技术术语,使用斯洛文尼亚语进行提示也不会显著降低大型模型的性能。研究表明,大型语言模型在共享的、以英语为中心的概念空间中处理意义,因此非英语输入的影响很小。虽然小型模型可能表现出更大的性能差距,但由于包含了英语技术术语和文件路径,斯洛文尼亚语输入的 token 成本也低于预期,尽管输出 token 仍然是延迟的一个重要因素。