Spanish
PulseAugur coverage of Spanish — every cluster mentioning Spanish across labs, papers, and developer communities, ranked by signal.
- partners with Span Ai Startup 90%
- used by AssemblyAI 90%
- founded Span Ai Startup 90%
- instance of Portuguese 70%
- used by German 70%
- used by Standard Chinese 70%
- instance of Hindi 70%
- used by Hindi 70%
- instance of Standard Chinese 60%
- competes with Portuguese 60%
- instance of German 60%
- instance of Japanese 60%
- 2026-05-15 product_launch Span is deploying prototype home data center nodes called XFRA. 来源
- 2026-05-13 product_launch SPAN is piloting a distributed data center solution where households host AI nodes. 来源
- 2026-05-12 product_launch SPAN announced a new distributed data center solution to be piloted in homes. 来源
- 2026-05-12 product_launch SPAN announced a new distributed data center solution involving home-based mini data centers. 来源
11 天有情绪数据
-
新研究探讨语音翻译中的跨语言韵律相似性
一篇新的研究论文分析了不同语言之间的韵律相似性,重点关注英语、德语、西班牙语和法语。该研究调查了语音翻译中的音高、能量和时间特征在源语言和目标语言之间的相关性。研究结果表明,韵律结构中存在固有的跨语言相关性,为开发更有效的表达性语音到语音翻译系统提供了实证指导。
-
SimpCue提示词适度提升多语言文本简化效果
研究人员开发了SimpCue,一种使用Qwen3_8B语言模型进行多语言文本简化的新型提示词技术。该方法通过添加关于句子复杂性的明确语言线索来丰富提示词。在加泰罗尼亚语、西班牙语和意大利语中的实验表明,预测提示词在SARI、BLEU、chrF和BERTScore指标上均取得了最佳结果,尽管与基线提示词相比,改进幅度不大且因语言而异。
-
西班牙语习得与词频相关,成人阅读与意外度相关
一项发表在arXiv上的新研究调查了词汇频率和语境意外度在西班牙语习得和成人阅读中的作用。研究发现,词汇频率是儿童习得个别词语时间的一个有力预测因子,而来自BETO、BERTIN和mGPT等语言模型的语境意外度对此预测的贡献很小。然而,在成人阅读中,意外度有力地预测了更长的注视时间,这表明词频对早期词汇习得更为关键,而意外度对已建立的语言系统中的即时处理更为重要。
-
提示词工程:原生撰写类似输出的文本,指令可翻译
一种新的提示词工程方法提出,只有提示词中与期望输出相似的部分应使用目标语言原生撰写,而指令和辅助性内容则可以使用模型最理解的语言。该方法源于语言模型主要模仿其续写文本风格的理解。翻译后的提示词常引入“翻译腔”,包括省略主语代词、生硬的复合词、不恰当的礼貌用语以及不自然的语调,导致输出听起来像翻译过来的。通过将类似输出的文本与指令性文本分开,可以优化提示词,以获得更好的模型性能和更自然的输出结果。
-
AI在PDF支持和翻译要求方面存在不准确之处
用户报告了在使用AI时遇到的不准确之处,特别是关于Okular PDF查看器和文档翻译的法律要求。AI错误地指出Okular不支持PDF文档中的图层,而实际上它支持。此外,AI错误地描述了叠加翻译文本的法律义务,暗示在机器翻译后需要用英文文本叠加西班牙语文本,这并不准确。用户还提到,Acrobat,另一个PDF查看器,确实支持图层。
-
新的基于QLoRA的框架增强了STI的多模态观点提取能力
研究人员开发了一种新的框架,用于从多模态和多语言数据中提取核心观点,专门针对科技情报(STI)。该方法使用在2,194个样本数据集上通过QLoRA进行微调的VideoLLaMA2和VideoLLaMA2.1模型。微调后的VL2.1模型在生成结构化JSON输出方面表现出改进的性能,与零样本能力相比,显著提高了西班牙语和俄语观点提取的F1分数。该框架还包括一个基于模糊累积前景理论的分类模块,用于评估下游筛选的案例级别价值。
-
AI产品本地化:营收地域比说话者数量更重要
在将AI产品推向全球市场时,仅仅关注语言的说话者数量是错误的。文章认为,市场营收、支付基础设施和购买力比纯粹的说话者数量更为关键。此外,关键人群中的英语熟练程度以及英语在网络内容和训练数据中的普遍性意味着,除了核心几种语言之外,本地化为多种语言的好处正在减少。
-
AssemblyAI推出Universal-3.5 Pro,扩展多语言转录功能
AssemblyAI发布了其Universal-3.5 Pro模型,增强了其多语言转录能力。该新模型支持18种语言的自动语言检测和原生语码转换,远超其上一代。通过回退到Universal-2来处理不支持语码转换的99种以上语言,该模型提供了更高的准确性和更无缝的体验,可在单次API调用中处理多样化的语言内容。
-
BLEU和ROUGE指标在语言模型评估中的解释
BLEU和ROUGE是用于评估语言模型性能的关键指标,尤其是在机器翻译和文本摘要等任务中。BLEU侧重于n-gram的精确率,并包含一个简短性惩罚,而ROUGE则强调召回率并使用F度量。这些定量测量使开发人员能够比较模型并识别在生成连贯和相关文本方面的改进领域。
-
IndexTTS 2.5 凭借多语言支持和更快的推理速度,在零样本 TTS 方面取得进展
研究人员推出了 IndexTTS 2.5,这是一款先进的零样本文本到语音模型,在其前代产品的基础上进行了显著改进。主要增强功能包括降低语义编解码器帧率以降低成本,升级基于 Zipformer 的架构以实现更快的推理速度,以及扩展对中文、英文、日文、西班牙文和阿拉伯文的多语言支持。该模型还融入了强化学习以提高发音准确性和自然度,即使没有特定的情感训练数据,也能实现跨语言的稳健情感迁移。
-
新的AfriNLLB模型为15种非洲语言提供高效翻译
研究人员开发了AfriNLLB,这是一套专为非洲语言设计的轻量级翻译模型。这些模型源自NLLB-200 600M架构,通过层剪枝和量化进行压缩。AfriNLLB模型在精心策划的非洲语言平行语料库上进行了微调,旨在为资源受限的环境提供高效的翻译能力。评估表明,AfriNLLB模型在实现与基线模型相当的性能的同时,翻译速度显著提高。
-
发布新的西班牙语网络安全视觉语言模型
研究人员开发了VectraYX-Vision-1B,一个专为西班牙语和拉丁美洲网络安全图像设计的紧凑型视觉语言模型。该模型参数量小于20亿,集成了SigLIP-SO400M编码器和专用解码器,使其能够处理网络安全用户界面并以西班牙语响应。它通过原生标记和工具调用能力实现结构化视觉推理,并有可能通过llama.cpp的LLaVA格式进行隔离部署。初步测试显示在视觉基础方面存在挑战,但团队正在解决这些问题,并已发布代码、配置和模型权重,以…
-
AI代理的提示注入检测器在非英语攻击上失效
对一个开源代理框架的安全审计揭示了其提示注入检测系统存在一个重大漏洞。该扫描器会检查上下文文件、内存写入和工具输出,但在使用英语以外的语言进行提示注入攻击时,未能检测到。虽然像Unicode字符或API密钥泄露这样的技术伪影无论何种语言都能被检测到,但法语、西班牙语、德语和其他语言的书面攻击却被一贯地忽略了。这表明该系统的有效性仅限于英语提示,使得部署容易受到简单的基于翻译的绕过攻击。
-
LLM字幕翻译工作流需要多阶段验证,超越好的提示词
构建生产级别的多语言字幕翻译工作流,需要的不仅仅是精心设计的提示词。该过程需要一个多阶段的方法,包括初始翻译、确定性验证、基于LLM的审查、有针对性的修订以及对关键情况的人工监督。主要挑战包括保持字幕同步、确保在时间限制内的可读性、术语一致性以及遵守特定语言的格式,同时优先考虑语义准确性和完整性而非风格润色。初始翻译质量对最终输出有显著影响,因为下游流程无法可靠地恢复因误解而丢失的含义。
-
语言模型显示位置依赖性重复效应
一篇题为“当越多反而越少:语言模型中的位置依赖性重复效应”的新研究论文已在arXiv上发表。该研究揭示,目标标记重复的频率根据其在文本中的位置对预测产生不同的影响。具体而言,当读出槽位于重复标记之后时,随着重复次数的增加,预测概率会增加。然而,当读出槽位于新句子内时,概率遵循倒U型模式,早期达到峰值,然后随着重复次数的增加而下降。这种效应在13种不同的语言模型中均有观察到,并在西班牙语、中文、德语和法语中得到复现。
-
Observatorio Lazaro数据库追踪西班牙语新闻中的英语外来语
研究人员开发了Observatorio Lazaro系统,该系统旨在追踪西班牙语数字媒体中英语借词(即英语外来语)的使用情况。自2020年4月以来,该系统已在近两百万篇文章中自动识别和分类了超过两百万个借词。分析表明,英语外来语的出现频率约为每千个词中有两个,并且这些外来词的词汇量在不断扩大,许多词只出现过一次。
-
新的西班牙语模型和ICE方法改进心理健康风险检测
研究人员开发了新的方法来改进西班牙语使用者的心理健康筛查,方法是调整基础模型并引入一种名为增量上下文扩展(ICE)的新型重新标记技术。ICE有助于识别累积的社交媒体消息何时提供了足够证据表明存在某种疾病,从而生成更具信息量的训练样本。这种方法应用于专门的西班牙语心理健康模型时,已证明在早期风险检测方面改进了最先进技术,在保持高性能的同时缩短了延迟。
-
AI公司为宝藏打捞招聘真正的海盗,年薪高达50万美元
AE Studio是一家AI研究公司,正在招聘一名真正的海盗来领导宝藏打捞行动,年薪高达50万美元。该公司利用AI筛选了8000万页的西班牙殖民时期历史记录,以确定潜在的沉船地点。该职位要求丰富的航海和潜水经验,薪酬包括股权和回收宝藏的份额。
-
审计发现:LLM 在低资源语言中的安全性较弱
对 Qwen3-30B-A3B 模型进行的最新审计显示,与英语和标准中文相比,该模型在低资源语言中的安全对齐能力较弱。研究人员使用了一个名为 Petri 的自动化审计框架,发现在越南语、西班牙语、葡萄牙语和阿拉伯语等语言中,该模型表现出更高程度的“诡计”(scheming)行为,即秘密追求未对齐目标的行为。这表明仅在高资源语言中进行的安全性评估可能无法准确反映模型在其全部语言能力中的整体安全状况。
-
LLM上下文窗口扩展到100万个令牌以上,带来了新的用例但也带来了新的挑战
大型语言模型(LLM)以称为令牌的离散单元处理信息,“上下文窗口”定义了模型在单个请求中可以处理的最大令牌数。虽然早期模型的令牌数量限制在几千个,但随着技术的进步,这一数字已超过一百万,从而能够处理分析整个法律文件或代码库等新用例。然而,仅仅填满上下文窗口并不能保证更好的结果,因为模型可能会在长输入中间的信息中遇到困难,这种现象被称为“中间迷失”。