Omlx Local Ai Models
PulseAugur coverage of Omlx Local Ai Models — every cluster mentioning Omlx Local Ai Models across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
DeepSeek-V4 Flash 0731 本地设置问题详解
用户在本地设置 DeepSeek-V4 Flash 0731 模型时遇到几个问题。最初,Unsloth GGUF 版本的模型由于回退到 CPU 使用而运行缓慢。在切换到另一个版本的 DeepSeek-V4 Flash 并使用 oMLX 后,工具调用因 Unsloth 未能正确将工具信息发送给模型而静默失败。进一步的故障排除发现了一个与 30GB 热缓存大小限制相关的缓存无效问题,系统中报告了高缓存匹配百分比,但实际使用了零个 token。
-
用户在 M5 Pro MacBook 上测试本地 LLM 运行时,寻求性能见解
一位用户正在他们的 M5 Pro MacBook(配备 24GB RAM)上测试各种本地大型语言模型(LLM)的运行时和应用程序。他们正在评估运行 Gemma 4 12B 等模型时,Ollama、LMStudio、oMlx 和 osaurus 等工具之间的性能差异。用户正在寻求社区的意见,了解哪个本地 LLM 运行时能提供最佳性能。
-
DeepSeek V4 Flash 8位MLX针对Apple Silicon进行优化,提升速度
一位Reddit用户分享了使用oMLX在Apple Silicon上对DeepSeek V4 Flash 8位MLX模型进行的优化。这些修改由Codex实现,重点在于为8位仿射配置启用原生DeepSeek MoE Metal内核,并优化路由排序和解码内核。这些更改带来了显著的速度提升,预填充速度提高了约1.6倍,解码速度提高了约3倍,同时旨在保持模型准确性。
-
GLM 5.2 提升 Mac Studio 运行大上下文模型性能
GLM 模型的新版本 5.2 已发布,并在 Mac Studio 硬件上提供了显著的速度提升。此次更新使得即使在大上下文窗口下,预填充速度也能超过每秒 100 个 token,同时还减少了内存使用。这些增强功能使用户能够在其拥有 512GB 内存的 Mac 设备上运行上下文窗口超过 10 万个 token 的 4 位量化模型。
-
oMLX 在 Mac LLM 推理速度上显著优于 Ollama
对在 Mac 设备上本地运行 LLM 的 oMLX 和 Ollama 进行的性能比较显示出显著的速度差异。oMLX 利用 Apple Silicon 的 MLX 框架,与使用 GGUF 后端的 Ollama 相比,其 token 生成速度快了 35%,多轮对话延迟降低了 7 倍。虽然 oMLX 提供了 SSD KV Cache 和 Continuous Batching 等专业功能,但 Ollama 在跨平台兼容性和更广泛的模型生态系…
-
oMLX 通过 KV 缓存提升 Apple Silicon LLM 性能
oMLX 是一个面向 Apple Silicon 的开源 LLM 推理服务器,在处理大型模型和复杂工作流方面展现出显著的性能提升。社区基准测试和本地测试突显了 oMLX 相较于 Ollama 和 LM Studio 等替代方案的优势,尤其是在涉及编码代理和持久化 KV 缓存的场景中。该服务器利用 SSD 进行 KV 缓存的能力极大地缩短了首次令牌生成时间 (TTFT),使得 Claude Code 和 Qwen3-Coder-Next…
-
Cohere 的 North Mini Code 模型引发了快速的社区开发
Cohere 发布了其首个开源编码模型 North Mini Code,并强调了社区的快速采用和开发。开发人员迅速创建了各种工具和集成,包括文档、适用于 GGUF 和 OMLX 等不同平台的模型量化,以及通过 llama.cpp、Ollama 和 vLLM 进行本地执行的支持。Cohere 积极感谢并展示这些社区贡献,强调围绕其新模型的创新速度。
-
开发者构建本地AI代理,强调上下文管理挑战
一位开发者构建了一个名为Vibrisse Agent的本地AI代理,该代理运行在Python和LangGraph上,旨在超越教程来理解AI机制。该代理集成了GitHub和SQLite等工具,支持Gemma 4的多模态视觉功能,并提供通过代码注释进行后台控制的“Ghost Mode”。该项目突显了在复杂AI系统中管理上下文的挑战,强调了纪律严明的软件工程而非“氛围编码”的必要性。
-
Apple Silicon LLM 堆栈:MLX、oMLX、MTPLX 详解
本文解释了 MLX、oMLX 和 MTPLX 之间的区别,这些是用于在 Apple Silicon 硬件上运行大型语言模型 (LLM) 的框架。旨在指导用户根据其特定需求和要解决的问题选择合适的工具。
-
基于 Qwen-3.5B-MXFP8 的本地 AI 设置被证明可用于代理任务
一位用户本周一直在试验本地 AI 设置,结合了采用 MoE 架构以提高速度的 Qwen-3.6-35B-MXFP8 模型。该系统还集成了 OMLX 用于提示缓存,以及 PiAgent 作为工具。用户对该设置的有效性表示惊讶,并指出尽管尚未达到商业级别,但这是本地模型首次真正可用于基本的代理任务。
-
Reddit 用户使用 oMLX 工具对模型进行基准测试
一位 Reddit 用户使用 oMLX 工具进行了基准测试,并承认其样本量小以及可能存在基准测试泄露的局限性。尽管结果并非决定性的,但它们为模型性能提供了一些有趣的见解。该用户在 r/LocalLLaMA 子版块分享了这些发现。
-
本地LLM上下文窗口突破341k token
r/LocalLLaMA subreddit上的一位用户已成功将本地大型语言模型的上下文窗口限制推至256k token以上。该用户手动将自动压缩设置为341.5k token,目前正通过优化内存驱逐来进一步提高上限。这项进展归功于Apple、DeepSeek和oMLX的贡献。
-
oMLX 简化了在 Mac 上运行本地 AI 模型
oMLX 是一款旨在简化在 macOS 设备上运行本地 AI 模型的新应用程序。该软件通过原生的菜单栏应用程序和 Web 仪表板提供用户友好的界面,让用户可以直接在 Mac 上轻松安装和管理各种 AI 模型。