Dutch
PulseAugur coverage of Dutch — every cluster mentioning Dutch across labs, papers, and developer communities, ranked by signal.
- 2026-07-25 product_launch Dutch, a veterinary telehealth company, has achieved significant growth and is leveraging AI for marketing. 来源
5 天有情绪数据
-
AI产品本地化:营收地域比说话者数量更重要
在将AI产品推向全球市场时,仅仅关注语言的说话者数量是错误的。文章认为,市场营收、支付基础设施和购买力比纯粹的说话者数量更为关键。此外,关键人群中的英语熟练程度以及英语在网络内容和训练数据中的普遍性意味着,除了核心几种语言之外,本地化为多种语言的好处正在减少。
-
Unicode CLDR 为语言本地化定义了 1-6 种复数形式
根据 Unicode 联盟的通用区域设置数据存储库 (CLDR) 的定义,一种语言在软件本地化所需的复数形式数量可以从一种到六种不等。这个数量不是语言学的绝对值,而是特定数据集版本的属性。像中文和日文这样的语言只需要一种形式,因为名词不标记复数;而威尔士语和阿拉伯语则需要六种形式,因为它们有复杂的数字交互和语法规则。
-
孟加拉语大语言模型支持滞后是由于数据稀缺,而非需求不足
尽管孟加拉语拥有大量母语使用者,但其在大语言模型中的支持程度却远落后于使用者较少的语言。这种差距并非源于需求不足,而是由于可爬取、机器可读的文本数据稀缺。主要原因之一是历史上使用了自定义字体,将孟加拉语字符映射到ASCII,导致大量旧的数字内容对网络爬虫和语言检测工具不可见。虽然现代孟加拉语出版物使用Unicode,但历史语料库仍包含这些遗留数据,影响了模型训练。
-
AssemblyAI推出Universal-3.5 Pro,扩展多语言转录功能
AssemblyAI发布了其Universal-3.5 Pro模型,增强了其多语言转录能力。该新模型支持18种语言的自动语言检测和原生语码转换,远超其上一代。通过回退到Universal-2来处理不支持语码转换的99种以上语言,该模型提供了更高的准确性和更无缝的体验,可在单次API调用中处理多样化的语言内容。
-
AI代理的提示注入检测器在非英语攻击上失效
对一个开源代理框架的安全审计揭示了其提示注入检测系统存在一个重大漏洞。该扫描器会检查上下文文件、内存写入和工具输出,但在使用英语以外的语言进行提示注入攻击时,未能检测到。虽然像Unicode字符或API密钥泄露这样的技术伪影无论何种语言都能被检测到,但法语、西班牙语、德语和其他语言的书面攻击却被一贯地忽略了。这表明该系统的有效性仅限于英语提示,使得部署容易受到简单的基于翻译的绕过攻击。
-
AI公司为宝藏打捞招聘真正的海盗,年薪高达50万美元
AE Studio是一家AI研究公司,正在招聘一名真正的海盗来领导宝藏打捞行动,年薪高达50万美元。该公司利用AI筛选了8000万页的西班牙殖民时期历史记录,以确定潜在的沉船地点。该职位要求丰富的航海和潜水经验,薪酬包括股权和回收宝藏的份额。
-
Hims 联合创始人驱动的 AI 兽医服务实现每月 20% 的增长
Dutch 是一家由 Joe Spector 联合创立的兽医远程医疗公司,正经历显著增长,其会员数量每月增长 20%。Spector 最近用一个内部团队取代了他的外部营销机构,该团队大量使用 AI 工具生成内容,从而使内容产量增加了十倍,客户获取成本降低了 20%。这一战略转变旨在提高品牌知名度并教育消费者了解虚拟兽医护理的好处。
-
开源ASR模型多样化超越Whisper;比较人类与机器语音识别
一项新的研究论文比较了自动语音识别(ASR)系统和人工听众,发现Google Telephony表现良好,有时甚至在儿童或老年人语音以及弗拉芒语口音等特定语音类型上优于人类。与此同时,开源ASR模型领域正在超越Whisper实现多样化,Cohere的Transcribe和IBM的Granite Speech 4.1已成为强有力的竞争者。然而,这些模型的比较因评估方法不同和私有数据集的影响而变得复杂,这表明对于用户而言,许可、语言支持和…
-
用于健康的AI聊天机器人:益处、风险和自我披露研究
一项涉及1,388名荷兰参与者的研究探讨了将AI聊天机器人用于健康相关咨询。研究发现,感知的益处对用户使用聊天机器人的意愿和披露敏感健康信息的意愿产生了积极影响,而感知的风险则与之呈负相关。与高敏感性话题相比,参与者对低敏感性话题表现出更高的使用意愿,尽管个体特征也在这些感知和意愿中发挥了作用。
-
新模型通过基于图的词汇表模拟早期语言学习
研究人员开发了一个模型,通过将单词学习模拟为基于图的心理词汇表上的搜索过程来理解早期语言习得。与简单的最短路径基线相比,该模型利用激活扩散和类别探索来更好地捕捉词汇发展动态。研究结果表明,激活动态和词汇类别受调控的探索之间的相互作用是理解儿童如何学习不同语言单词的关键。
-
爱尔兰公司注册处备案提供实时尽职调查数据,领先于聚合器
数据聚合延迟可能会使收购尽职调查复杂化,正如最近一次都柏林软件收购事件所表明的那样,在该事件中,付费数据库在官方备案六周后仍显示过时信息。爱尔兰公司注册处(CRO)会快速发布备案信息,但下游数据集可能会滞后,从而产生差异。直接查询CRO数据源,如通过OpenRegistry MCP等工具实现的,可以近乎实时地访问备案顺序,这对于识别公司结构、董事任职或财务安排中可能在静态快照中被忽略的细微变化至关重要。
-
美国指控荷兰技术转移中国,威胁全球力量平衡
美国指控荷兰的专有技术可能通过允许中国获取先进半导体制造技术而改变了全球力量平衡。自2019年以来,美国一直限制用于生产驱动AI模型的尖端半导体的极紫外光刻机的出口。这些机器由荷兰公司ASML独家生产。最近,美国商务部长霍华德·卢特尼克(Howard Lutnick)向ASML表达了担忧,称其中一台关键机器可能已被出口到中国,给该公司造成了危机。
-
荷兰律师事务所面临人工智能订阅成本上升
荷兰律师事务所因采用人工智能工具而面临日益增长的费用。法律行业的人工智能订阅相关成本正在上升,影响了已将这些技术整合到其运营中的公司。
-
自动语音识别系统和人类在识别荷兰语构音障碍语音时遇到困难
一项新近发表在arXiv上的研究比较了人类听者和三种先进的自动语音识别(ASR)系统——Whisper-large-V3、Google Chirp 3和Omnilingual——在识别荷兰语构音障碍连续语音方面的性能。研究发现,人类和现成的ASR系统都面临显著困难,平均词错误率(WER)超过70%。然而,通过在构音障碍语音上微调ASR模型,可以大幅降低WER,个性化模型在识别性能上优于人类听者,并有望支持日常交流。
-
新的ToxiREX数据集解决了六种语言中的隐式毒性问题
研究人员推出ToxiREX,一个旨在捕捉在线对话中隐式和上下文相关毒性的多语言新数据集。该数据集包含Reddit评论线程,使用结构化的毒性推理模式进行标注,并包含六种语言的内容。ToxiREX旨在通过考虑对话上下文来提供对毒性更细致的理解,这是以前的数据集中不存在的特征。初步实验表明,虽然语言模型在此任务上的表现优于随机猜测,但仍需显著改进。
-
Nearfield Instruments 融资 3.8 亿美元,创荷兰深度科技投资纪录
Nearfield Instruments 在 D 轮融资中筹集了 3.8 亿美元,估值达到 16 亿美元,创下了荷兰深度科技投资的最高纪录。该公司专注于半导体计量学,为芯片制造商提供关键工具,用于大规模检测复杂的 AI 处理器和测量先进芯片内部的复杂三维结构。
-
Nearfield Instruments 融资 3.8 亿美元,估值 16 亿美元,创荷兰深度科技融资纪录
半导体计量学专家 Nearfield Instruments 已成功完成 D 轮融资,获得 3.8 亿美元资金,估值达到 16 亿美元。这笔融资是荷兰历史上最大的一笔深度科技投资。该公司的技术对芯片制造商至关重要,使他们能够在生产规模上检测复杂的 AI 处理器并测量先进芯片内部复杂的 3D 结构。
-
Y2K bug在旧BSD构建中重现,由荷兰开发者发现
一位荷兰开发者在旧的BSD构建中发现了一个类似于Y2K bug的2000年问题缺陷。该漏洞存在于一个依赖短波授时广播的系统中,除非仍在运行PDP-11/70,否则不会构成威胁。这一发现凸显了遗留系统中可能存在的潜在问题。
-
新方法改进多语言词级语音对齐
研究人员开发了一种新颖的多语言词级强制对齐方法,集成了Massively Multilingual Speech (MMS) 模型中的表示和一个自监督音素边界检测器。该方法使用学习型动态规划解码器来推断精确的词边界。该系统在TIMIT和Buckeye数据集上与Montreal Forced Aligner (MFA) 等现有方法相比,表现出优越的性能,并在未见过(unseen)的语言上显示出有希望的结果,表明其可扩展性可覆盖MMS支持…
-
深度学习模型提升荷兰语音节划分准确性
研究人员开发了一种新的荷兰语音节划分深度学习模型,词语准确率达到99.65%。该模型结合了语音和拼写信息,比现有算法提高了0.14%。研究还评估了其他四种音节划分算法,发现在各种数据集上,数据驱动的方法通常优于基于知识的方法。