PulseAugur
实时 20:06:28
English(EN) nvidias nemotron omni only loads its text half on a mac, so i wrote the vision and audio towers in mlx

开发者通过自定义 MLX 运行时在 Mac 上启用了 NVIDIA Nemotron Omni 的视觉/音频功能

一位开发者创建了一个 MLX 自定义运行时,以使 NVIDIANemotron Omni 模型能够在 Mac 上利用其视觉和音频功能。原始模型的仅文本部分可以使用标准的 MLX 工具加载,但视觉和音频模块需要单独的实现。该开发者成功移植了这些组件,确保它们通过了与 NVIDIA 的 PyTorch 参考实现进行的严格测试。这个新的运行时允许模型处理图像和音频,在 M5 Max 芯片上实现了令人印象深刻的每秒 token 率,并以 MIT 许可发布。 AI

影响 使多模态 AI 模型在消费级硬件上具有更广泛的可访问性和可用性。

排序理由 第三方开发者为特定平台上的现有开放权重模型创建了自定义实现。

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

开发者通过自定义 MLX 运行时在 Mac 上启用了 NVIDIA Nemotron Omni 的视觉/音频功能

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/divinetribe1 ·

    nvidias nemotron omni only loads its text half on a mac, so i wrote the vision and audio towers in mlx

    <!-- SC_OFF --><div class="md"><p>nvidias nemotron omni is open weights and it sees, hears and reasons. theres already a 4bit mlx quant on hugging face but only the text backbone loads with standard mlx tooling. the model card says it plainly, the vision and audio towers need a r…