PulseAugur
中
实时 05:44:16
实体 Mlx

Mlx

PulseAugur coverage of Mlx — every cluster mentioning Mlx across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
140
90 天内 140
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-26 product_launch Apple released MLX, a machine learning framework for local model fine-tuning on Mac devices. 来源
情绪 · 30 天

15 天有情绪数据

最近 · 第 1/8 页 · 共 159 条
  1. TOOL · CL_286499 ·

    设备端AI工作空间优先考虑数据隐私和文件完整性

    一位开发者创建了一个名为OnDevice.ai的设备端AI工作空间,专为需要本地处理敏感数据的用户设计,以避免因隐私和监管问题而依赖云解决方案。该系统使用Ollama或LM Studio在MacBook上运行Glimmer 30B等LLM,重点是通过使用JSON中间规范而非直接操作文件格式来生成PowerPoint和Excel等准确的文件。这种方法确保了文件完整性,这是受监管行业的一个关键因素,同时提供了一个数据保留在用户机器上的可控环境。

  2. TOOL · CL_283724 ·

    Ollama 发布 v0.40.1 和 v0.40.0,支持 Apple Silicon 和服务器改进

    Ollama 发布了两个新版本,v0.40.1 和 v0.40.0。v0.40.1 更新包括用于云使用和 API 负载均衡的服务器端更改,解决了 Windows 与大文件兼容性问题,并调整了 CLI 的入门流程。v0.40.0 版本引入了一项重大更改,默认情况下使模型在 Apple Silicon 设备上通过 MLX 运行,并支持与 MLX 运行时兼容的架构。

  3. TOOL · CL_282224 ·

    Ollama 发布 v0.40.0-rc4,MLX 版本更新

    Ollama 发布了 0.40.0-rc4 版本,其中包括 MLX 的更新。本次发布通过为单元测试添加作用域来改进内存使用。

  4. TOOL · CL_280681 ·

    DecisionTune 1.0:发布用于小型决策的本地编码器

    DecisionTune 1.0 是一个新发布的 395M 参数编码器模型,专为本地决策任务设计,资源需求极低。由 /u/Abe238 开发,它可以在 Apple 芯片上使用 MLX 后端,在大约 10 毫秒内处理短决策,内存占用约 1.7 GB。该模型能够从提供的选项中进行选择或回答是/否问题,而无需生成文本,使其适用于需要离线处理小型、频繁决策的代理栈。

  5. TOOL · CL_279351 ·

    Krea 2 Turbo LoRAs 针对 ComfyUI、MLX 和云进行了优化

    一位用户发布了 Krea 2 Turbo 的更新版 LoRAs,通过 ComfyUI 提供更快、更简单的图像生成。这些 LoRAs 针对各种工作流进行了优化,包括使用 PyTorch 的本地 ComfyUI 和 Apple Silicon 的 MLX/MFLUX,以及 ComfyUI Cloud。更新功能包括使用 LLM 增强的提示生成、对其他风格 LoRAs 的支持以及高级放大功能。

  6. TOOL · CL_279380 ·

    Ollama v0.40.0-rc1 更新 mlx 分词器语义

    Ollama 发布了 v0.40.0-rc1 版本,其中包括对其 mlx 集成的更新。这些更改侧重于使分词器语义与发布者标准保持一致,确保预分词、Unicode 边界和分词规范化得到一致处理。此次发布还为已发布的分词器添加了共享的 Go 和 Python 参考案例,并解决了配置优先级和字节回退行为问题。

  7. TOOL · CL_277398 ·

    Cloudflare推出Clef-Flash,一个用于快速分类的9B决策模型

    Cloudflare发布了Clef-Flash,一个拥有90亿参数、专为速度和效率设计的决策模型,该模型基于Qwen3.5-9B构建。与传统的聊天模型不同,Clef-Flash在一个前向传播中处理输入状态和类型化问题,并返回预定义答案的概率,而不生成自由文本。这使其适用于支持工单分类等任务,可以快速分类其紧急程度和负责人。Cloudflare还提供了一个名为Clef的更大、经过精度调优的27B参数模型,该模型包含用于图像分类的视觉能力。

  8. RESEARCH · CL_272851 ·

    2 位量化使 27B LLM 能够在消费级 GPU 上运行

    模型量化的最新进展使得更大的语言模型能够在消费级硬件上运行。诸如三元 2 位量化和 GGUF 格式等技术允许 Qwen3.8-27B 等模型被显著压缩,文件大小从大约 54 GB 减少到 9 GB 以下。这种压缩虽然可能对性能有轻微影响,但使得这些强大的模型能够在标准 GPU 上本地执行,从而将重点从仅限于云部署转移到更广泛的用户可访问性。

  9. TOOL · CL_272811 ·

    Phonon-2:发布小型、高精度开源语音识别模型

    FermionResearch发布了Phonon-2,一个开源语音识别模型,它以小巧的文件尺寸实现了对英语音频的高精度识别。该模型在Open ASR Leaderboard上的平均词错误率为5.21%,优于更大的模型,并且在文件尺寸小15倍的情况下,达到了其更大、全精度教师模型的性能。Phonon-2专为高效转录而设计,能够在Apple M5 MacBook Air上大约20秒内处理一小时的音频,而在NVIDIA H100 GPU等高…

  10. TOOL · CL_260900 ·

    Ollama v0.34.2 引入新的设置流程和应用集成

    Ollama 发布了 0.34.2 版本,引入了新的首次运行设置流程,允许用户登录或继续本地运行。此设置的完成与 macOS 和 Windows 上的桌面应用程序同步。此次更新还包括一项新功能,可以通过 macOS 和 Windows 上的 `ollama://apps` 直接打开桌面应用的 Apps 页面,并解决了使用 MLX 推理解码进行长时间生成时内存过度增长的问题。

  11. TOOL · CL_260723 ·

    在 Mac 上使用 LoRA 和 MLX 微调 Qwen LLM

    本指南详细介绍了如何使用 LoRA 在配备 Apple Silicon 的 Mac 上微调 Qwen 模型,特别是 Qwen3.8-27B 和 Qwen3.5-9B。它提供了从环境设置到将训练好的适配器与基础模型合并的整个过程的七个脚本。教程强调了实际方面,如管理内存使用、优化训练轮次而非步数,以及适配器合并技术的重要性,以避免数据丢失。

  12. TOOL · CL_260355 ·

    本地LLM硬件:小模型用GPU,大模型用统一内存

    在本地运行大型语言模型方面,硬件格局已根据内存容量和速度划分为不同类别。RTX 5090等消费级GPU在内存不超过32GB的小模型上表现出色,提供高内存带宽以实现快速生成。超过32GB的大模型则受益于Apple Mac等系统以及NVIDIA和AMD的专用硬件中采用的统一内存架构,在这种情况下,速度的重要性不如加载模型本身。

  13. TOOL · CL_258644 ·

    并行约束解码提升Apple Silicon上AI结构化数据提取能力

    一种名为并行约束解码(Parallel Constrained Decoding)的新方法已被开发出来,可显著加速在Apple Silicon上从AI模型中提取结构化数据的速度。该技术绕过了传统的逐个token生成过程,而是同时评估JSON schema的多个字段。在Apple Silicon M4 Max上的基准测试显示,在风险评估和分类等任务中,延迟最多可减少7倍,同时保持100%的schema有效性。

  14. TOOL · CL_256257 ·

    Ollama 发布 v0.34.1,更新 MLX 和 GGUF 模型创建功能

    Ollama 发布了 0.34.1 版本,带来多项重要更新。该版本使 MLX safetensors 的 "ollama create" 功能不再处于实验阶段,并改进了 Apple Silicon 上 MLX 的内存处理。此外,GGUF 模型创建现在需要使用 llama.cpp 工具进行 safetensor 转换和量化,并且优化了 runaway repeat token 检测以减少误报。

  15. TOOL · CL_253455 ·

    Ollama 发布 v0.34.1-rc0,MLX 版本更新

    Ollama 发布了 0.34.1-rc0 版本,其中包括 MLX 的更新。此次发布主要侧重于提升 MLX 版本并增加对专家混合(MoE)模型中全局缩放的支持。

  16. TOOL · CL_255269 ·

    新的 macOS 应用 Radiant Canvas 提供更快的本地 AI 图像生成

    一款名为 Radiant Canvas 的新的原生 macOS 应用程序已被开发出来,用于在 Apple Silicon 上使用 Krea 2、FLUX.2 和 Qwen 等模型进行本地图像推理。该应用程序使用 C++20、Objective-C++ 和 Swift 构建,直接利用 MLX 和 Metal 来避免 Python 依赖并提供简化的用户体验。基准测试显示,在 M5 Max 芯片上,Radiant Canvas 在 Krea…

  17. TOOL · CL_252709 ·

    Ollama 对比 llama.cpp:选择您的本地 LLM 运行时

    文章将 Ollama 和 llama.cpp 作为本地 LLM 推理的运行时进行了比较,重点介绍了它们不同的操作模式。Ollama 充当托管服务,通过稳定的名称和自动调度简化模型管理和部署,非常适合需要为 Open-WebUI 或编码助手等应用程序提供可靠后端的用户。相比之下,llama.cpp 提供了一种更直接、面向工具包的方法,通过其 llama-server 进程让用户能够精细控制上下文大小和 GPU 放置等参数。虽然 Olla…

  18. TOOL · CL_249201 ·

    用户重新利用 DALL-E mini 进行迭代插图创作

    一位用户开发了一种通过迭代拼接旧版 DALL-E mini (Craiyon) 图像生成器的输出来创建插图的方法。通过将原始 Transformer 模型移植到 MLX,使其能在 Apple Silicon 硬件上快速运行,该过程变得更加高效。用户创建了一个“插图线束”,该线束接受 JSON 格式的场景描述,进行渲染,并利用输出结果来改进插图,展示了一种新颖的图像生成方法。

  19. TOOL · CL_280590 ·

    jialinyyzz/humanizer 模型集成 Transformers、MLX 和本地应用

    jialinyyzz/humanizer 模型现已可与各种流行的 AI 工具和库配合使用。提供了将其与 Hugging Face 的 Transformers、MLX 和 llama.cpp 集成的说明,使用户能够本地运行或通过兼容 OpenAI 的服务器运行它。此外,该模型还可以与 LM Studio、Jan、vLLM 和 SGLang 等推理提供商一起使用,为不同的部署场景提供了灵活性。

  20. TOOL · CL_246336 ·

    2026年Mac:统一内存和带宽决定本地LLM性能

    在2026年,Mac硬件上本地运行大型语言模型将主要取决于统一内存容量和带宽,而非核心数量。拥有16GB统一内存的Mac可以很好地运行多达140亿参数的模型,而对于70B级别模型建议使用64GB,对于超过1000亿参数的模型则需要128GB或更多。内存带宽是生成速度的主要决定因素,M4等新芯片比旧芯片具有显著优势。Ollama、LM Studio、MLX和llama.cpp等工具提供了在本地运行这些模型的不同接口和功能。