PulseAugur
实时 22:12:14
实体 MIDI

MIDI

PulseAugur coverage of MIDI — every cluster mentioning MIDI across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 18
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 9
层级分布 · 90 天
主题
关系
情绪 · 30 天

5 天有情绪数据

最近 · 第 1/1 页 · 共 18 条
  1. TOOL · CL_136789 ·

    Kyutai 发布开放权重 MuScriptor 用于多乐器音乐转录

    法国 AI 实验室 Kyutai 推出了 MuScriptor,一个用于将多乐器音乐转录为 MIDI 格式的开放权重 Transformer 模型。该模型有三种尺寸,最大的拥有 14 亿参数。MuScriptor 在大量的 MIDI 文件和真实录音数据集上进行了训练,据报道其 Multi F1 分数达到了 48.2,显著优于基线模型。

  2. COMMENTARY · CL_134713 ·

    PipeWire 1.6.8 发布;播客讨论缅因州政治、Meta 的 Threads 和特朗普电话

    该集群涵盖了两项不同的技术新闻:PipeWire 1.6.8 的发布,其增强了 Linux 的音频和视频服务器功能;以及一期播客节目,讨论了缅因州的政治丑闻、Meta 的 Threads 平台(作为 X 的竞争对手)以及特朗普电话的出现。

  3. TOOL · CL_144505 ·

    MuScriptor: 开放权重模型将多乐器音乐转录为MIDI

    研究人员推出MuScriptor,一个用于多乐器音乐转录的开放权重模型。与以往在复杂混音或单一乐器上表现不佳的模型不同,MuScriptor能够将流行、古典、金属和爵士等多种音乐流派中各种乐器的音符转录为MIDI格式。该模型通过合成数据预训练、真实音频微调和强化学习的结合开发而成,并增加了基于乐器存在的条件设置能力。MuScriptor可在其官网使用,并在GitHub上提供开源代码。

  4. TOOL · CL_123053 ·

    新框架将符号音乐反编译为可执行代码

    研究人员开发了Decomposer,一个新颖的框架,旨在将符号音乐(如MIDI文件)翻译成Strudel音乐编程语言中的可执行程序。该系统通过创建一个名为Strudel-Synth的合成语料库进行初始训练,然后利用无配对MIDI数据进行强化学习,以提高代码可读性和重建准确性,从而解决了配对数据稀缺的问题。据报道,Decomposer在MIDI重建保真度方面优于闭源大型语言模型,并且比现有的启发式转换器生成更多样化、更易读的代码。

  5. TOOL · CL_111710 ·

    Pianist Transformer 通过自监督学习推动富有表现力的音乐生成

    研究人员开发了 Pianist Transformer,这是一种从符号乐谱生成富有表现力的钢琴演奏的新方法。该方法利用了在超过 100 亿个未标记 MIDI 数据标记上的大规模自监督学习,这比以往受限于小数据集的监督方法有了显著进步。该模型采用了一种高效的不对称 Transformer 架构,并进行了音符级压缩,以提高训练和推理效率,并提供了一个可编辑的工作流程以集成到音乐制作中。该项目旨在为合成类人音乐表演铺平一条可扩展的道路。

  6. COMMENTARY · CL_110430 ·

    AI 研究员探索使用 LLM 从 MIDI 数据生成音乐

    一个人正在探索微调一个小型大型语言模型(LLM)以理解和生成音乐模式的想法。该方法涉及使用扩展的 MIDI 文件协议,而不是实际的声音样本,将音乐视为一种语言,而不仅仅是听觉模式。

  7. TOOL · CL_99634 ·

    新算法有助于乐谱的音高拼写和调性估算

    研究人员开发了一种用于乐谱音高拼写和调性估算的算法。该算法处理类似MIDI的输入,以确定每个小节的音符名称、调号和局部音阶,从而优化清晰的音乐记谱。评估在包括爵士乐总谱、独奏转录和古典钢琴乐谱在内的多样化数据集上进行,潜在应用包括音乐转录、分析和保存。

  8. RESEARCH · CL_90819 ·

    研究发现:贝多芬的《月光奏鸣曲》与机器学习架构相似

    一项新的研究论文探讨了贝多芬的《月光奏鸣曲》(作品27号之二)与机器学习机制之间的结构相似性。通过对乐谱进行计算分析,该研究在奏鸣曲的三个乐章中识别出了不同的机器学习架构。研究结果表明,音乐的“温度”与吞吐量而非分布宽度有关,并且在较轻的乐章中可以发现更高的不协和度。研究还强调了音级在不同乐章中如何获得不同的上下文身份,类似于自然语言处理中的嵌入,并量化了音乐和语言中编码-解码循环的“手性”。

  9. RESEARCH · CL_86683 ·

    AI模型在巴赫风格音乐生成方面的比较

    一篇新研究论文比较了不同AI模型生成巴赫风格钢琴音乐的效果。研究发现,带有注意力机制的自回归LSTM模型产生了最符合音乐逻辑的结果,而向量量化改进了潜在变量模型。生成对抗网络在捕捉局部模式方面显示出潜力,但更难训练,并且在整体风格连贯性方面效果较差。

  10. COMMENTARY · CL_85170 ·

    IntelliJ 会议探讨 JavaFX 和 MIDI 文件操作

    宣布了一场专注于 IntelliJ 中 JavaFX 和 MIDI 文件操作的会议,参与者包括 Anton Arhipov 和另一个人。该活动鼓励观众提问互动,并提供直播供观看。

  11. RESEARCH · CL_73624 ·

    Melinda French Gates 承诺投入 2.15 亿美元用于更年期和中年女性健康

    Melinda French Gates 已承诺投入 2.15 亿美元,以推进更年期和中年女性健康领域的研究和护理。这项重大的慈善投资旨在解决该领域资金不足和缺乏关注的问题,该问题影响着女性的生产力和职业生涯。French Gates 的倡议将支持研究、提供者教育、保险覆盖和工作场所保护,向其他资助者和企业表明该市场的可行性。

  12. RESEARCH · CL_74415 ·

    新模型统一语音和歌声生成

    研究人员开发了新的统一模型,用于生成人类语音音频,能够同时生成语音和歌声。UniVoice 使用条件流匹配方法,分离内容、旋律和音色,从而能够独立控制语音韵律和歌唱旋律。UniSinger 基于多模态扩散 Transformer 构建,统一了说话人克隆歌曲生成与带伴奏的歌声转换。这两个模型在各自的任务上都展现了最先进的性能,为音频生成和音乐制作带来了新的可能性。

  13. RESEARCH · CL_72463 ·

    Google 发布 Magenta RealTime 2 以实现实时 AI 音乐协作

    Google 发布了 Magenta RealTime 2,这是一款能够与人类音乐家实时即兴创作音乐的 AI 模型。该模型提供两个版本:一个拥有 24 亿参数的高质量模型,以及一个为 Apple Silicon 优化的、拥有 2.3 亿参数的更快速模型。随同发布的是免费应用程序和 DAW 插件,允许用户与 Magenta RealTime 2 互动,实现基于流派的音乐生成和 MIDI 控制,以进行协作音乐创作。

  14. RESEARCH · CL_65611 ·

    新数据集测试AI对多语言习语的理解能力

    研究人员推出了MIDI,一个旨在评估多语言NLP模型对习语理解能力的新数据集。该数据集包含句子和对话语境下的习语,涵盖高、中、低资源语言。对当前模型的基准测试显示,在低资源语言中性能显著下降,并且即使在对话语境下,模型也普遍难以进行字面解释。

  15. RESEARCH · CL_23441 ·

    数据中心因电网互联延迟而优先考虑现场供电

    数据中心开发商正越来越多地转向现场发电,主要是基于天然气的微电网,以解决与主电网互联的重大延迟问题。这种转变是由支持人工智能基础设施快速扩张对可靠电力的迫切需求所驱动的,预计到 2028 年,美国数据中心的电力消耗将翻一番以上。作为一项能源即服务提供商,Unison Energy 正利用这一趋势,通过长期合同提供表后发电系统,使现场供电从一种权宜之计转变为一种主要的设计选择。

  16. TOOL · CL_22065 ·

    PianoCoRe数据集结合并精炼MIDI语料库,用于表现力演奏研究

    研究人员推出了PianoCoRe,这是一个全面的、精炼的钢琴MIDI演奏和乐谱数据集。该新数据集结合并改进了现有的开源语料库,包含来自483位作曲家的5,625首作品的超过250,000次演奏。PianoCoRe包含适用于各种应用的层级子集,其中一个值得注意的音符对齐集合用于表现力演奏建模。该项目还提供了一个MIDI质量分类器和一个名为RAScoP的对齐精炼管道,以提高数据准确性。

  17. RESEARCH · CL_10862 ·

    EchoSight 提供开源的视觉-听觉感官替代应用

    EchoSight 是一款开源的移动应用程序,旨在提供实时的视觉到听觉感官替代。该框架旨在通过将视觉信息转换为听觉信号来帮助人们,特别是盲人。该项目利用 YOLOv3 等技术进行对象检测,并使用 MIDI 进行音频输出,与 ARVO 2026 会议相关。

  18. SIGNIFICANT · CL_05364 ·

    碳移除技术转向能源主导以度过特朗普时代

    碳移除行业正在调整其宣传重点,以适应特朗普政府对能源主导而非气候变化的关注。这一战略转变旨在确保路易斯安那州和德克萨斯州等项目的持续联邦支持和资金,这些项目已获得新的批准。公司正在强调碳移除如何能增强能源安全并创造经济机会,尽管一些当地社区对环境和安全风险表示担忧。