PulseAugur
实时 20:51:23
实体 RVQ

RVQ

PulseAugur coverage of RVQ — every cluster mentioning RVQ across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. SIGNIFICANT · CL_205166 ·

    MiniMax发布可生成5分钟歌曲的开放权重音乐模型

    MiniMax发布了MiniMax-Music3,这是一个开放权重模型,能够根据文本输入生成长达五分钟的完整歌曲。该模型接受带有章节标签的歌词和详细的音乐描述,生成32 kHz、16位立体声WAV音频。其架构结合了混合语言模型(Hybrid-LM),由一个8B的全局LLM和一个0.6B的局部LLM组成,以及一个利用流匹配(flow matching)和Flow-VAE的连续合成栈。MiniMax已公开提供权重、推理代码和服务路径,允许…

  2. TOOL · CL_174363 ·

    新的RFSQ方法通过改进信号条件增强神经压缩

    研究人员开发了鲁棒残差有限标量量化(RFSQ),这是一种新的方法,通过解决多阶段量化中残差幅度衰减的问题来改进神经压缩。RFSQ 结合了可学习的缩放因子和可逆层归一化,以在量化阶段保持信号强度。实验表明,与现有方法相比,RFSQ-LayerNorm 在音频重建方面提高了 3.6%,在 ImageNet 上的 L1 和感知损失方面取得了显著的提高。

  3. TOOL · CL_168090 ·

    Inkling 多模态模型集成到 Hugging Face、vLLM;llama.cpp 添加音频输入

    顶级国际象棋引擎 Stockfish 18 的最新版本与开源 AI 领域的重大进展同时发布。Hugging Face Transformers v5.14.0 和 vLLM v0.26.0 集成了新的 Inkling 多模态模型,这是一个来自 Thinking Machines 的 9750 亿参数模型,使开发人员能够轻松地将其用于各种任务。同时,llama.cpp 的 b10155 更新增加了对 MiMo-V2.5 音频输入和基于 …

  4. RESEARCH · CL_158609 ·

    新AI框架根据歌词和描述生成完整歌曲

    研究人员开发了一个新颖的框架,可根据歌词、文本描述和音乐属性等各种输入生成完整歌曲。该系统支持三个不同的生成任务:从零开始创作带歌词的歌曲、制作器乐音乐以及生成不同风格的翻唱歌曲。该框架集成了语义感知分词器、混合语言模型(hybird-LM)、用于流匹配渲染的FullDiT以及旋律模块,并采用直接偏好优化(DPO)和GRPO等先进训练策略来增强音乐性和质量。

  5. TOOL · CL_121922 ·

    Self-Variable Robotics unveils X-Tokenizer for embodied AI action segmentation

    Zibianliang (Self-Variable) Robotics has introduced X-Tokenizer, a novel cross-modal embodied action tokenizer designed to improve the semantic understanding between visual-language models (VLMs) and robot action expert…