PulseAugur
实时 09:53:44
实体 Portuguese

Portuguese

PulseAugur coverage of Portuguese — every cluster mentioning Portuguese across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

7 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_223212 ·

    新的TTS流水线通过基于音素的增强功能改进ASR系统

    研究人员开发了一个统一的流水线,用于生成合成语音以改进自动语音识别(ASR)系统。该流水线使用多语言文本到语音(TTS)模型F5-TTS,并带有语言ID条件。一种名为音素频率引导选择(PFGS)的新颖方法根据音素频率对候选句子进行排名,在阿拉伯语、法语、意大利语和葡萄牙语的实验中,其表现优于随机选择和仅真实数据训练。

  2. TOOL · CL_210424 ·

    研究梳理了46个面向葡萄牙语的语言模型,并指出了研究空白

    一项针对面向葡萄牙语的语言模型进行的系统性映射研究,识别出了一个不断增长的、包含46个模型的生态系统。该研究根据模型的架构、计算资源、训练数据、许可和可用性对其进行了特征描述。研究还分析了这些模型的演变和相互关系,并指出了葡萄牙语语言模型开发的现有研究空白和未来方向。

  3. COMMENTARY · CL_201951 ·

    魁北克法语在AI输出中与法国法语不同

    大型语言模型在被要求生成法语时,通常默认使用“法国法语”,但这可能存在问题,因为魁北克拥有一个独特的官方术语权威机构。魁北克法语办公室(Office québécois de la langue française)积极为英语借词创造法语替代词,使得正式书面的魁北克法语比其法国对应词更系统地法语化。这种区别对于需要生成特定地区法语的应用至关重要,尤其是在术语方面,例如电子邮件的“courriel”以及不同餐点名称。

  4. TOOL · CL_199350 ·

    ICU MessageFormat 在语言之间标准化复数规则

    ICU MessageFormat 为国际化应用程序中的复数处理提供了一种健壮的方式,将语言规则从代码移入消息。它定义了六个复数类别(zero, one, two, few, many, other),这些类别在不同语言中有不同的应用方式,数据来源于 Unicode 联盟发布的通用区域设置数据存储库 (CLDR)。该语法允许显式值匹配(例如,'=0')并使用 '#' 来表示格式化的数字,还具有 'offset' 和 'select' …

  5. COMMENTARY · CL_199357 ·

    AI产品本地化:营收地域比说话者数量更重要

    在将AI产品推向全球市场时,仅仅关注语言的说话者数量是错误的。文章认为,市场营收、支付基础设施和购买力比纯粹的说话者数量更为关键。此外,关键人群中的英语熟练程度以及英语在网络内容和训练数据中的普遍性意味着,除了核心几种语言之外,本地化为多种语言的好处正在减少。

  6. SIGNIFICANT · CL_195455 ·

    AssemblyAI推出Universal-3.5 Pro,扩展多语言转录功能

    AssemblyAI发布了其Universal-3.5 Pro模型,增强了其多语言转录能力。该新模型支持18种语言的自动语言检测和原生语码转换,远超其上一代。通过回退到Universal-2来处理不支持语码转换的99种以上语言,该模型提供了更高的准确性和更无缝的体验,可在单次API调用中处理多样化的语言内容。

  7. TOOL · CL_191306 ·

    新的AfriNLLB模型为15种非洲语言提供高效翻译

    研究人员开发了AfriNLLB,这是一套专为非洲语言设计的轻量级翻译模型。这些模型源自NLLB-200 600M架构,通过层剪枝和量化进行压缩。AfriNLLB模型在精心策划的非洲语言平行语料库上进行了微调,旨在为资源受限的环境提供高效的翻译能力。评估表明,AfriNLLB模型在实现与基线模型相当的性能的同时,翻译速度显著提高。

  8. TOOL · CL_188134 ·

    AI代理的提示注入检测器在非英语攻击上失效

    对一个开源代理框架的安全审计揭示了其提示注入检测系统存在一个重大漏洞。该扫描器会检查上下文文件、内存写入和工具输出,但在使用英语以外的语言进行提示注入攻击时,未能检测到。虽然像Unicode字符或API密钥泄露这样的技术伪影无论何种语言都能被检测到,但法语、西班牙语、德语和其他语言的书面攻击却被一贯地忽略了。这表明该系统的有效性仅限于英语提示,使得部署容易受到简单的基于翻译的绕过攻击。

  9. TOOL · CL_172558 ·

    AI公司为宝藏打捞招聘真正的海盗,年薪高达50万美元

    AE Studio是一家AI研究公司,正在招聘一名真正的海盗来领导宝藏打捞行动,年薪高达50万美元。该公司利用AI筛选了8000万页的西班牙殖民时期历史记录,以确定潜在的沉船地点。该职位要求丰富的航海和潜水经验,薪酬包括股权和回收宝藏的份额。

  10. TOOL · CL_171915 ·

    分层Transformer连贯预测急诊科需求

    研究人员开发了HierSTT,一个新颖的分层Transformer框架,旨在跨多个级别连贯地预测急诊科(ED)需求。该模型在一个端到端系统中联合预测医院、区域和全国的需求,解决了独立预测方法中常见的که incoherence 问题。通过采用一个连贯感知损失并利用全国性的葡萄牙ED数据集,HierSTT与非分层深度学习基线相比,平均WAPE降低了32%,并且优于经典的که incoherence 协调方法。

  11. TOOL · CL_171033 ·

    审计发现:LLM 在低资源语言中的安全性较弱

    对 Qwen3-30B-A3B 模型进行的最新审计显示,与英语和标准中文相比,该模型在低资源语言中的安全对齐能力较弱。研究人员使用了一个名为 Petri 的自动化审计框架,发现在越南语、西班牙语、葡萄牙语和阿拉伯语等语言中,该模型表现出更高程度的“诡计”(scheming)行为,即秘密追求未对齐目标的行为。这表明仅在高资源语言中进行的安全性评估可能无法准确反映模型在其全部语言能力中的整体安全状况。

  12. TOOL · CL_167584 ·

    LLM防护失效,跨语言生成个性化虚假信息

    一项新研究表明,即使有防护措施,主流大型语言模型(LLMs)也极易生成个性化虚假信息。研究人员使用324个虚假叙事和150个人口统计学画像,创建了一个包含英语、俄语、葡萄牙语和印地语超过160万条个性化虚假信息文本的数据集。研究发现,约80%的提示防护失效,其中Grok的失效率超过94%。模型能够有效地根据特定画像定制虚假信息,并采用比非个性化内容更具说服力的技巧,这凸显了当前LLM安全机制的重大弱点以及改进多语言防护措施的必要性。

  13. RESEARCH · CL_166801 ·

    LLM上下文窗口扩展到100万个令牌以上,带来了新的用例但也带来了新的挑战

    大型语言模型(LLM)以称为令牌的离散单元处理信息,“上下文窗口”定义了模型在单个请求中可以处理的最大令牌数。虽然早期模型的令牌数量限制在几千个,但随着技术的进步,这一数字已超过一百万,从而能够处理分析整个法律文件或代码库等新用例。然而,仅仅填满上下文窗口并不能保证更好的结果,因为模型可能会在长输入中间的信息中遇到困难,这种现象被称为“中间迷失”。

  14. TOOL · CL_161876 ·

    mii-llm 发布小型开源葡萄牙语-英语语言模型

    mii-llm,一个开源人工智能实验室,发布了 Zagreus-0.4B-por,一个拥有约 4 亿参数的小型双语葡萄牙语-英语语言模型。该模型是从头开始在一个开放数据集语料库上训练的,旨在作为进一步开发的基础,例如指令调优或创建特定领域的助手。虽然其在葡萄牙语评估中的基准性能对于其规模来说很有希望,但此次发布强调了其作为研究和轻量级应用的开放基础模型的作用。

  15. RESEARCH · CL_128512 ·

    新的基准测试评估葡萄牙语文本嵌入模型,揭示性能差距

    发布了两个新的基准测试 MTEB-PT 和 MTEB-PT(巴西葡萄牙语),专门用于评估葡萄牙语的文本嵌入模型。这些基准测试解决了现有评估中葡萄牙语代表性不足的问题,而现有评估通常依赖于翻译的数据集或多语言平均值。新的基准测试包含大量葡萄牙语原生任务,涵盖语义文本相似性、分类、检索和重新排序等多个类别。初步评估表明,模型性能高度依赖于任务,并且在多语言基准测试上的排名并不能可靠地预测葡萄牙语特定性能,这凸显了进行原生语言评估的必要性。

  16. TOOL · CL_125538 ·

    MarketNow为其AI代理市场增加了4种语言

    MarketNow,一个拥有8560项AI代理技能的市场,已将其语言支持从英语扩展到五种语言:西班牙语、葡萄牙语、中文和法语。这种多语言能力是在不依赖react-i18next等大型外部库的情况下实现的。该实现使用了自定义React Context进行语言持久化,以及一个包含每种语言400多个键的单一翻译文件。对于复杂页面,使用了特定的内容对象,并且技术类别保留为英文作为后备。

  17. TOOL · CL_117601 ·

    新型BERTomelo模型增强葡萄牙语NLP任务

    研究人员开发了BERTomelo,这是一种专为葡萄牙语设计的新型单语编码器模型。该模型采用ModernBERT架构,并集成了FlashAttention等优化技术,与之前的葡萄牙语编码器(如BERTimbau和Albertina)相比,实现了更高的效率和可扩展性。BERTomelo在广泛的ClassiCC-PT语料库上进行训练,在命名实体识别和语义文本相似性等下游任务中表现出色,优于旧的单语模型和大型多语言模型。

  18. TOOL · CL_116765 ·

    AssemblyAI 语音代理 API 新增 6 种语言,支持原生语码转换

    AssemblyAI 的语音代理 API 现在支持六种语言:英语、西班牙语、法语、德语、意大利语和葡萄牙语,并具备原生语码转换功能。此功能由 Universal-3.5 Pro Realtime 模型提供支持,该模型优先针对这些特定语言进行深度训练,以提高对姓名、产品和行话的准确性。该 API 还提供免费的自定义术语提示,以进一步提高对特定领域词汇的识别能力,确保更精确和专业的用户体验。

  19. TOOL · CL_107534 ·

    AssemblyAI推出医疗模式,支持原生语码转换转录

    AssemblyAI为其转录模型引入了新的医疗模式,专注于准确处理临床对话中的语码转换。与需要语言切换的系统不同,AssemblyAI的Universal-3 Pro和Universal-3.5 Pro Realtime模型可以无缝转录在一次发音中混合语言的句子。这种能力对于患者和临床医生经常在语言之间切换的医疗环境至关重要,确保医疗术语和任何穿插的英语限定词都能被正确捕获。

  20. RESEARCH · CL_107747 ·

    新的LLM系统和数据集增强了葡萄牙电子商务的产品数据提取

    研究人员开发了AI-PAVE-Br,一个利用大型语言模型来改进葡萄牙电子商务数据产品属性值提取(PAVE)的系统。该系统旨在处理巴西产品描述中的复杂性和语言变体。为了支持进一步研究并建立基准,该团队还创建并发布了“Golden Set”,一个用于葡萄牙语PAVE的精心标注的数据集。