Merlin
PulseAugur coverage of Merlin — every cluster mentioning Merlin across labs, papers, and developer communities, ranked by signal.
- 2026-06-22 product_launch A duck named Merlin became the unofficial mascot and stole the show at a presidential press briefing. 来源
4 天有情绪数据
-
音乐行业推出倡议打击流媒体欺诈
国际唱片业协会 (IFPI) 已启动“流媒体完整性倡议” (SII),以打击音乐流媒体行业的欺诈行为。该倡议得到了众多音乐发行商和唱片公司的支持,为参与者制定了五项核心承诺,包括强大的身份验证、对欺诈活动和 AI 相关风险的内容审查,以及情报共享。IFPI 旨在解决流媒体欺诈造成的重大经济损失,而生成式 AI 和自动化机器人农场的兴起加剧了这一问题。
-
音乐发行商发起倡议打击人工智能驱动的流媒体欺诈
国际唱片业协会(IFPI)发起了“流媒体诚信倡议”(SII),以打击音乐流媒体中的欺诈行为。该倡议包括五项参与发行商的承诺,重点关注验证版权所有权、审查与人工智能相关的风险内容、检测和减轻欺诈、共享情报以及持续加强反欺诈系统。Sony Music Group、Universal Music Group 和 Merlin 等主要音乐发行商正在支持 SII,该倡议旨在保护艺术家和粉丝免受欺诈性流媒体活动造成的收入损失。
-
环球音乐集团与 ElevenLabs 合作开发 AI 音乐混音平台
环球音乐集团 (UMG) 已与 ElevenLabs 达成多年期授权协议,将合作开发一个由 AI 驱动的音乐平台。该平台将使用户能够混音并与参与的艺术家和词曲作者的授权音乐共同创作,还可以生成个性化的声音体验。此次合作旨在促进新的收入来源和粉丝参与,同时强调负责任的 AI 使用和艺术家报酬。此举是在 Suno 最近发布其自身 AI 模型(这些模型经过 UMG 竞争对手的音乐训练)之后发布的,凸显了 AI 在音乐行业日益增长的整合趋势。
-
新框架改进了稀有实体的多语言实体链接
研究人员开发了一个新框架,以改进多语言实体链接,特别是对于稀有实体。该系统使用一个具有推理能力的视觉语言模型,该模型动态搜索和推理维基百科以收集证据。这种方法结合了推理和检索,表明虽然单独的推理是不够的,但没有推理的检索会对整体准确性产生不利影响。结合方法显著提高了稀有实体和多语言基准的性能。
-
Z世代将观鸟变成一项流行的复古爱好,融合了科技与社群
年轻一代,特别是Z世代,正日益将观鸟作为一项流行的复古爱好,这源于他们对社群和线下参与的渴望。虽然Merlin等观鸟识别应用程序使这项活动更加便捷,但主要吸引力似乎在于人际联系和指导,许多新观鸟者是通过朋友或导师接触到这项爱好的。这一趋势体现在大学观鸟俱乐部的增长以及年轻人参与度的显著提高,将观鸟从一项小众消遣变成了一项酷炫且具有社群感的活动。
-
新框架和排行榜旨在标准化 AI 放射学报告生成
研究人员推出了 ReXrank,这是一个公共排行榜和挑战,旨在标准化放射学报告生成 AI 模型的评估。该框架利用大型测试数据集 ReXGradient 和现有公共数据集来评估模型在各种指标上的性能。同时,RadFusion 提出了一个新颖的框架,允许进行阈值可控的放射学报告生成,通过平衡敏感性和特异性来适应不同的临床需求。另一项研究探索了用于 3D 放射学报告生成的高效视觉上下文,研究了如何优化视觉标记到基础视觉编码器和大语言模型的分…
-
Spotify与Merlin合作推出AI音乐混音和翻唱
Spotify正通过与独立厂牌的授权合作伙伴Merlin合作,扩展其AI驱动的音乐混音和翻唱项目。此次合作将把30,000多家厂牌纳入Spotify的计划,该计划旨在允许粉丝在获得艺术家同意的情况下创作其音乐的翻唱和混音。该公司强调,其产品专注于真实艺术家,并确保同意、署名和报酬,这使其区别于那些有争议的AI音乐初创公司。该功能的研究预览将作为付费附加服务提供给部分用户,为参与的艺术家创造新的收入来源。
-
Spotify 与 Merlin 达成 AI 混音协议,扩大艺术家选择范围
Spotify 已与 Merlin(一家全球独立音乐版权代理机构)达成许可协议,为其高级订阅用户集成 AI 混音工具。该协议允许 Merlin 所代表的艺术家选择是否允许其音乐用于 AI 生成的混音,并确保他们获得署名和报酬。该工具最初于 5 月宣布,旨在为艺术家提供额外的收入来源,同时优先考虑艺术家的同意和原创作品的完整性。
-
新的ORCA方法为AI模型压缩3D CT视觉令牌
研究人员开发了ORCA(ORgan-Centroid Aggregation),一种用于压缩3D CT扫描视觉令牌的新颖方法。这种无需训练的方法通过器官引导合并相邻令牌,并结合质心空间编码以保留解剖信息。在相似的令牌预算下,ORCA的性能始终优于现有的压缩方法,显著减小了下游视觉语言模型的KV缓存大小和处理时间。ORCA的代码已在Hugging Face上发布。
-
新框架调整CT基础模型以更好地对齐放射学报告
研究人员开发了解剖学情境化适应(ACA)框架,这是一种旨在改进CT视觉语言基础模型的新型框架。ACA能够高效地调整现有的冻结模型,以实现与放射学报告在解剖学层面的对齐,从而增强精细的解剖学信号和全局上下文。这种轻量级方法在Merlin和CT-RATE数据集上进行了评估,在零样本发现分类方面,以极少的训练时间显著优于基线模型。
-
新探测方法揭示AI模型如何编码医学影像
研究人员开发了一种名为概念通道探测(CCP)的新方法,用于识别冻结的3D医学视觉语言模型内部哪些特定单元编码了特定的放射学发现。该技术成功应用于Pillar-0和Merlin两个不同的模型,证明了大约十个通道的稀疏集合可以准确地表示单个发现,而不会影响不相关的标签。CCP方法在临床疗效和自然语言生成指标方面显著优于现有的CT-CHAT等工具,同时运行延迟也大大降低。
-
量子神经网络中的物理噪声被探索为一种原生正则化器
研究人员探索了在光子混合量子神经网络(PHQNN)中使用物理噪声作为原生正则化器的潜力,并将其与经典深度学习中的噪声注入技术进行类比。通过使用遗传算法在Quandela的Perceval模拟器和MerLin框架中调整噪声参数,该研究旨在优化PHQCNN在Iris、Digits和MNIST等数据集上的性能。虽然这种方法在Iris和Digits数据集上取得了适度的准确性提升,但在MNIST数据集上却导致性能下降,这表明物理噪声作为正则化器…
-
新框架通过视觉语言模型(VLM)-专才协同增强医学影像理解
研究人员开发了新的医学影像理解框架,将视觉语言模型(VLM)的广泛能力与专业诊断工具相结合。工具瓶颈框架(TBF)使用学习模型来组合选定工具的输出,在数据受限的情况下提高可解释性和性能,尤其是在组织病理学和皮肤病学领域。另外,Super-Generalist(SuG)框架将通才VLM与专才目标相结合,利用分割专家的空间先验来增强病灶定位,并在胸部和腹部CT基准测试中取得最先进的成果。
-
SEER框架处理噪声、缺失和偏移的时间序列数据
研究人员推出SEER,一个基于Transformer的框架,旨在增强时间序列预测的鲁棒性。SEER通过采用自动化的补丁增强和替换策略,解决了噪声、异常、缺失值和分布偏移等常见数据质量问题。这种方法允许对各种低质量时间序列数据进行统一建模,旨在提高在数据不完美现实工业应用中的预测准确性和稳定性。
-
墨西哥城鸭子吉祥物抢了总统新闻发布会风头,引发争议
一只名叫Merlín的鸭子,身穿足球球衣,意外成为了墨西哥城总统新闻发布会的明星。它的主人Carla Gómez将Merlín和她的家人作为工薪阶层墨西哥人的象征,强调他们的辛勤工作。虽然此次活动获得了大量的社交媒体关注,但也因盖过了失踪人员家属的担忧而受到批评,并引发了野生动物倡导者对冲动养宠物的潜在风险的警告。
-
通过观鸟应用和GPS质疑人工智能的认知影响
用户质疑,如果反对人工智能的论点是可能丧失认知技能,那么像观鸟应用Merlin这样提高便利性或效率的人工智能工具是否本质上就不好。他们将此与文字处理中的自动更正和GPS导航进行类比,认为这些工具也会导致词典使用或地图阅读等相关认知能力的下降。
-
辅助认知的AI是“糟糕的人工智能”吗?
用户质疑,如果前提是人工智能会削弱认知能力,那么像Merlin观鸟应用或带自动更正功能的文字处理器这类增强人类能力的工具是否应被视为“糟糕的人工智能”。这引发了关于界定有益的人工智能辅助与有害的人工智能对人类认知影响的更广泛讨论。
-
AI 的模糊界限:摄影和鸟类识别应用受到质疑
该集群探讨了常见的摄影和鸟类学工具是否符合人工智能的定义。第一项质疑 Z 堆叠(一种通过组合多张图像来提高照片质量的技术)是否构成 AI,以及它是有益还是有害。第二项询问 Merlin 鸟类识别应用程序,询问它是否是 AI,以及如何区分好与坏的 AI 应用。
-
Merlin CTO:自主性是航空业的下一次演进,提升安全性和保障性
Merlin的首席技术官认为,自主系统对于推进航空业和国家安全至关重要,它们并非取代飞行员,而是飞行技术的演进。这些系统能够执行危险和复杂的任务,降低风险,并增强国防和商业领域的能力。现代航空业日益增长的复杂性对人类飞行员的认知带宽提出了过高的要求,因此自主性成为保障安全和效能的必要工具。
-
新方法解决视频大模型中的幻觉问题
研究人员开发了几种新方法来解决视频大模型(VLMMs)中的幻觉问题。一种方法 MultiToP,通过选择性地用全局补丁标记替换不可靠的视觉标记来在语言生成之前对其进行精炼。另一种方法 ViSSRes,使用轻量级网络增强视频表示,以提高时空和语义一致性。第三种技术侧重于精炼文本嵌入,以鼓励更好地整合视觉信息并减少对语言先验的过度依赖。这些方法在减少幻觉率和提高各种基准测试中的视频理解能力方面显示出显著的改进。