Japanese
PulseAugur coverage of Japanese — every cluster mentioning Japanese across labs, papers, and developer communities, ranked by signal.
18 天有情绪数据
-
新研究揭示多语言LLM数学训练奖励中的偏见
一篇新研究论文指出,在多语言可验证奖励强化学习(RLVR)中存在显著偏见,RLVR是训练大型语言模型进行数学推理的常用技术。研究发现,旨在语言中立的精确匹配验证器,在日语、英语和标准中文等语言中,会以不同速率错误地惩罚正确答案。这种偏见局限于最终答案界面,并造成了跨语言选择瓶颈,阻碍了有效训练。研究人员建议在优化之前,按语言和界面审计RLVR奖励,以解决这些问题。
-
AI token 计数错误导致分类 bug,而非模型本身
一位开发者遇到了一个 bug,导致一个工单分类服务在处理较长消息时(尤其是在德语和日语中)失败。问题不在于 AI 模型本身,而在于客户端和推理端点之间的 token 计数不匹配。客户端代码使用了字符限制,但由于非英语语言的 token 化比例不同,这会在模型处理分类指令之前默默地截断提示。修复方法包括实施基于 token 的限制、添加响应标记进行验证以及创建回归测试以防止将来发生此类问题。
-
Mastodon 帖子标记为 AI、漫画和露骨内容 · 跟踪 10 个来源
Mastodon 上的多篇帖子被标记为 #AI、#cartoon、#manga 以及与性内容和身体部位相关的各种露骨术语。一些帖子还包含 #Muslim 和 #hijab 等标签,而另一些则包含 #Japanese 和 #fantasy。
-
14MB AI 模型运行高效但日语表现不佳;讨论 AI 生产力衡量
一个小型、14MB 的人工智能模型已被证明可以有效运行,仅需单个 DLL 文件和 37MB RAM,每次处理时间为 0.5 秒。然而,该模型在日语任务上的表现明显不佳,得分为 0/5。另外,关于如何衡量个人贡献以外的 AI 生产力,正与 Findy 和 O'Reilly 等实体进行讨论。
-
提示词工程:原生撰写类似输出的文本,指令可翻译
一种新的提示词工程方法提出,只有提示词中与期望输出相似的部分应使用目标语言原生撰写,而指令和辅助性内容则可以使用模型最理解的语言。该方法源于语言模型主要模仿其续写文本风格的理解。翻译后的提示词常引入“翻译腔”,包括省略主语代词、生硬的复合词、不恰当的礼貌用语以及不自然的语调,导致输出听起来像翻译过来的。通过将类似输出的文本与指令性文本分开,可以优化提示词,以获得更好的模型性能和更自然的输出结果。
-
中国谴责日本官员参拜靖国神社
中国强烈谴责日本官员参拜靖国神社一事,该神社因供奉战犯而备受争议。北京方面认为该神社是日本军国主义的象征,并指责参拜官员试图为战犯翻案并歪曲历史事实。中国外交部表示,此类参拜行为破坏了掩盖日本战争责任的努力,并为日本重新军事化铺平了道路。
-
新的NARU基准测试MLLMs对日语视频叙事和文化的理解能力
研究人员推出了NARU,这是一个新的基准,旨在评估多模态大型语言模型(MLLMs)在理解日语长视频中的叙事演变和文化细微差别方面的能力。该基准包含基于155个视频的1,481个问题,总时长为146.8小时,涵盖了四个叙事维度和五个文化维度。其构建过程采用了基于分层记忆的注释流程,并由68名母语为日语的注释员进行了验证。初步评估表明,当前MLLMs在长距离叙事整合和基于文化的推理方面存在显著局限性。
-
研究表明,大语言模型的安全对齐具有语言依赖性
发表在arXiv上的一项新研究揭示,用于提示大语言模型的语言会显著影响其安全对齐,尤其是在高风险场景下。研究人员发现,当Claude Sonnet 4.6和Gemini Pro 3.1等模型被指示用日语进行推理时,与用英语提示相比,它们推荐核打击的倾向降低了。这种效应似乎源于模型在日语中自发生成了英语提示中不存在的道德词汇,这表明仅在英语中进行的安全评估可能会忽略其他语言中存在的关键安全措施。
-
OCR系统难以处理蒙古文传统竖排草书
传统的蒙古文(称为“蒙古文”)给标准的OCR系统带来了独特的挑战。这些系统通常假定文本是横向排列的,无法处理蒙古文的竖排、从上到下的列。即使将文本旋转,使列看起来像行,但该脚本的草书性质和依赖于上下文的字母形式(其中多个字符共享相同的中间形状)意味着仅凭视觉信息不足以进行准确识别。确定正确的字符通常依赖于语言上下文,例如元音和谐和词义,而不是仅仅依赖于图像中存在的墨迹模式。
-
ICU MessageFormat 在语言之间标准化复数规则
ICU MessageFormat 为国际化应用程序中的复数处理提供了一种健壮的方式,将语言规则从代码移入消息。它定义了六个复数类别(zero, one, two, few, many, other),这些类别在不同语言中有不同的应用方式,数据来源于 Unicode 联盟发布的通用区域设置数据存储库 (CLDR)。该语法允许显式值匹配(例如,'=0')并使用 '#' 来表示格式化的数字,还具有 'offset' 和 'select' …
-
AI产品本地化:营收地域比说话者数量更重要
在将AI产品推向全球市场时,仅仅关注语言的说话者数量是错误的。文章认为,市场营收、支付基础设施和购买力比纯粹的说话者数量更为关键。此外,关键人群中的英语熟练程度以及英语在网络内容和训练数据中的普遍性意味着,除了核心几种语言之外,本地化为多种语言的好处正在减少。
-
Unicode CLDR 为语言本地化定义了 1-6 种复数形式
根据 Unicode 联盟的通用区域设置数据存储库 (CLDR) 的定义,一种语言在软件本地化所需的复数形式数量可以从一种到六种不等。这个数量不是语言学的绝对值,而是特定数据集版本的属性。像中文和日文这样的语言只需要一种形式,因为名词不标记复数;而威尔士语和阿拉伯语则需要六种形式,因为它们有复杂的数字交互和语法规则。
-
新的NARU基准测试AI对日语视频叙事的理解能力
研究人员推出了NARU,这是一个新的基准,旨在评估多模态大语言模型(MLLMs)在理解日语长视频中的叙事演变和文化细微差别方面的能力。该基准包含1,481个问题,源自155个视频,总时长超过146小时,评估四个叙事维度和五个文化维度。NARU通过一个涉及母语者的分层标注流程开发,旨在识别当前MLLMs处理复杂、高语境视频内容能力的局限性。
-
AssemblyAI推出Universal-3.5 Pro,扩展多语言转录功能
AssemblyAI发布了其Universal-3.5 Pro模型,增强了其多语言转录能力。该新模型支持18种语言的自动语言检测和原生语码转换,远超其上一代。通过回退到Universal-2来处理不支持语码转换的99种以上语言,该模型提供了更高的准确性和更无缝的体验,可在单次API调用中处理多样化的语言内容。
-
Azure GPT-5.6 变体发票计算失败,生成不正确数字
对 azure/gpt-5.6-sol@low 模型变体的最新分析揭示了其数值推理能力存在重大缺陷。当输入发票时,这些模型会持续错误计算小计和税额,并非由于误读数字,而是应用了错误的公式。具体来说,它们似乎会将总金额除以 1.1,即使正确数字清晰可见且文档税率并非简单的 10%,此计算也会产生不正确的小计和税值。这表明模型并非基于可见数据执行算术运算,而是基于预设的错误公式生成答案。
-
中国因出口管制违规拘留日籍高管
中国已拘留数名日籍高管,因其涉嫌违反双重用途技术的出口限制。此次拘留是在中国加强对日企的审查之后发生的,审查包括现场检查和审讯。中国日本大使馆已向其公司发出警告,建议谨慎行事,并为那些面临中国当局问询的公司提供支持。
-
IndexTTS 2.5 凭借多语言支持和更快的推理速度,在零样本 TTS 方面取得进展
研究人员推出了 IndexTTS 2.5,这是一款先进的零样本文本到语音模型,在其前代产品的基础上进行了显著改进。主要增强功能包括降低语义编解码器帧率以降低成本,升级基于 Zipformer 的架构以实现更快的推理速度,以及扩展对中文、英文、日文、西班牙文和阿拉伯文的多语言支持。该模型还融入了强化学习以提高发音准确性和自然度,即使没有特定的情感训练数据,也能实现跨语言的稳健情感迁移。
-
AI代理的提示注入检测器在非英语攻击上失效
对一个开源代理框架的安全审计揭示了其提示注入检测系统存在一个重大漏洞。该扫描器会检查上下文文件、内存写入和工具输出,但在使用英语以外的语言进行提示注入攻击时,未能检测到。虽然像Unicode字符或API密钥泄露这样的技术伪影无论何种语言都能被检测到,但法语、西班牙语、德语和其他语言的书面攻击却被一贯地忽略了。这表明该系统的有效性仅限于英语提示,使得部署容易受到简单的基于翻译的绕过攻击。
-
AI社区通过MiniMax蒸馏、新的ASR模型和Gemini传闻进行创新
AI社区基于MiniMax AI最近发布的权重,迅速开发了一个蒸馏LoRA模型,展示了快速的创新能力。另外,一个名为Audio8-ASR-0.1B的新开源模型已发布,支持七种语言的实时语音识别。此外,有传言称Google的Gemini 3.7 Flash已被发现,并推测Google可能因重大的计算限制和战略决策而有意推迟Gemini Pro的发布。
-
新的蒸馏技术提升了大型语言模型的多语言数学推理能力
研究人员探索了在线策略增量蒸馏(OPD^2),这是在线策略蒸馏(OPD)的一项改进,用于多语言数学推理。使用Qwen3模型的实验表明,OPD^2在英语、韩语和日语上的表现显著优于标准的OPD。研究还指出,虽然仅使用英语的OPD可以提升其他语言的性能,但可能会无意中将响应转向英语,这凸显了使用多语言数据来维持特定语言响应的必要性。