M4 Max
PulseAugur coverage of M4 Max — every cluster mentioning M4 Max across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
本地30B模型在常见开发者任务上可媲美前沿AI
一位开发者发现,在配备M4 Max芯片的MacBook Pro上运行的本地300亿参数模型,足以满足他日常大部分AI驱动的工具任务。这些任务包括生成提交信息、总结拉取请求和分类通知,涉及的输入和输出都很小,而本地模型的表现与前沿模型相当。该设置使用了量化为4位的Qwen 3变体,占用约18GB内存,速度约为每秒40个token,初始请求耗时约四秒。
-
Apple Mac Studio 搭载新芯片,价格上涨
自 2022 年首次亮相以来,Apple 的 Mac Studio 在保持其独特的铝制机身的同时,经历了显著的内部升级。最新的 M5 Ultra 型号拥有 512GB 内存和 1.2TB/s 的数据传输速度,与最初的 M1 Ultra 相比有了巨大飞跃。近期的型号价格有所上涨,特别是 M4 Max 和 M3 Ultra 版本,这归因于内存成本的上升以及对本地 AI 模型处理的需求。
-
本地LLM硬件:小模型用GPU,大模型用统一内存
在本地运行大型语言模型方面,硬件格局已根据内存容量和速度划分为不同类别。RTX 5090等消费级GPU在内存不超过32GB的小模型上表现出色,提供高内存带宽以实现快速生成。超过32GB的大模型则受益于Apple Mac等系统以及NVIDIA和AMD的专用硬件中采用的统一内存架构,在这种情况下,速度的重要性不如加载模型本身。
-
并行约束解码提升Apple Silicon上AI结构化数据提取能力
一种名为并行约束解码(Parallel Constrained Decoding)的新方法已被开发出来,可显著加速在Apple Silicon上从AI模型中提取结构化数据的速度。该技术绕过了传统的逐个token生成过程,而是同时评估JSON schema的多个字段。在Apple Silicon M4 Max上的基准测试显示,在风险评估和分类等任务中,延迟最多可减少7倍,同时保持100%的schema有效性。
-
新方法使用GGUF元数据预测llama.cpp吞吐量
研究人员开发了一种方法,利用GGUF元数据来预测llama.cpp(一个流行的运行大型语言模型的框架)的单序列吞吐量。该方法采用具有量化特定比例因子的屋顶线形预测器,并在参考模型上进行拟合。该研究在两个Apple M4 Max系统和一个NVIDIA RTX 5080上测试了53种配置下的318次测量,在某些留一主机测试中实现了低至11.6%的平均绝对百分比误差(MAPE)。研究结果表明,GGUF结构有助于跨不同系统的性能预测,尽管拟合…
-
2026年Mac:统一内存和带宽决定本地LLM性能
在2026年,Mac硬件上本地运行大型语言模型将主要取决于统一内存容量和带宽,而非核心数量。拥有16GB统一内存的Mac可以很好地运行多达140亿参数的模型,而对于70B级别模型建议使用64GB,对于超过1000亿参数的模型则需要128GB或更多。内存带宽是生成速度的主要决定因素,M4等新芯片比旧芯片具有显著优势。Ollama、LM Studio、MLX和llama.cpp等工具提供了在本地运行这些模型的不同接口和功能。
-
Mac 用户就 M4 Max MacBook Pro 用于本地 AI 模型渲染寻求建议
一位 Reddit 用户正在寻求关于运行开放权重 AI 模型(特别是 H3 Mini Max 和 Stable Diffusion)的最佳 Apple 硬件的建议。他们正在考虑几款配备 M4 Pro 和 M4 Max 芯片的 MacBook Pro 和 Mac Studio 配置,所有配置均配备 48GB 统一内存,并正在权衡这些配置与配备外部 RTX 4090 GPU 的 Windows Bootcamp 设置的优劣。用户特别关注了…
-
Meta发布开源代理模型Muse Glimmer以供本地使用
Meta发布了Muse Glimmer,一个专为在个人电脑和Mac上本地执行而设计的开源代理模型。这个拥有300亿参数的模型,在Apache 2.0许可下发布,针对“始终在线”的代理工作流进行了优化,能够管理个人数据、使用工具和执行多步推理。Meta通过三个阶段的流程训练了该模型,并利用量化和推测解码技术实现了高效的本地部署。
-
Meta 发布用于代理任务的开源 Muse Glimmer 模型
Meta 发布了 Muse Glimmer,一个基于 Apache 2.0 许可的新型 30B 参数开源模型。该模型专为端到端代理任务完成、可靠的工具使用和多步推理而设计,在 DeepSearch QA 和 SWE-Bench 等基准测试中表现强劲。然而,其内存需求(压缩后约 24-32 GB)可能会限制其在许多消费级笔记本电脑上的本地使用,而早期基准测试表明其效率可能低于 Qwen 等竞争对手。
-
Nvidia RTX Spark 笔记本芯片变体在 Geekbench 上曝光
Nvidia 即将推出的 RTX Spark 笔记本超级芯片的两个变体已出现在 Geekbench 上,其中一个配置为精简的 18 核,另一个为全功能的 20 核。初步结果显示,这两种芯片的多核得分均令人印象深刻,可与许多 x86 移动处理器相媲美甚至超越,尽管它们的单核性能竞争力稍逊,尤其是在与 Apple 最新产品相比时。这些早期基准测试表明,RTX Spark 有望成为笔记本 CPU 市场上的有力竞争者,并且随着驱动程序的优化,…
-
Apple M4 Max Mac Studio 在本地 AI 解码吞吐量方面领先 NVIDIA 和 AMD
Apple 的 M4 Max 芯片在 Mac Studio 中表现出强大的本地 AI 性能,尤其是在解码吞吐量方面,其性能优于 NVIDIA 的 GB10 和 AMD 的 Strix Halo。这一优势主要归功于 Apple Silicon 的高内存带宽,这对于在顺序 LLM 推理过程中流式传输模型权重至关重要。虽然 GB10 系统提供广泛的软件兼容性,但 Apple 的统一内存架构为优先考虑本地 AI 任务的内存带宽和容量的用户提供…
-
Nvidia RTX Spark N1X原型Surface Laptop Ultra初显潜力,面临驱动问题
一款据称搭载未发布的Nvidia RTX Spark N1X片上系统(SoC)的Microsoft Surface Laptop Ultra原型机,已由一位科技爱好者进行了初步测试。该N1X SoC专为AI任务设计,据称其性能可与桌面版RTX 4070或移动版RTX 5070媲美,并支持高达128GB的统一内存。然而,该原型机出现了显著的驱动和电源管理问题,导致部分应用程序性能不一致甚至崩溃,表明在可能发布之前还需要进一步开发。
-
Claude AI 协助用户通过修改 macOS 内核来超频 M4 Max GPU
一位 Reddit 用户报告称,Anthropic 的 Claude AI 协助他们修改了新的 macOS beta 内核的电源管理系统。据称,此修改允许手动控制 M4 Max GPU 的散热预算和功率目标,从而能够在超出标准散热限制的情况下进行超频。该用户在 GitHub 上分享了核心代码的链接,并指出需要进行具有特定权限的主机注入才能实现这些更改。
-
oMLX 通过 KV 缓存提升 Apple Silicon LLM 性能
oMLX 是一个面向 Apple Silicon 的开源 LLM 推理服务器,在处理大型模型和复杂工作流方面展现出显著的性能提升。社区基准测试和本地测试突显了 oMLX 相较于 Ollama 和 LM Studio 等替代方案的优势,尤其是在涉及编码代理和持久化 KV 缓存的场景中。该服务器利用 SSD 进行 KV 缓存的能力极大地缩短了首次令牌生成时间 (TTFT),使得 Claude Code 和 Qwen3-Coder-Next…
-
Mac 对 NVIDIA GPU:为本地 LLM 选择合适的硬件
在本地运行大型语言模型方面,Apple Silicon Mac 和 NVIDIA GPU 各有优势。Mac 因其统一内存架构,在运行大型模型推理方面表现出色,可以更轻松、更安静地处理高达 70B 参数的模型。然而,NVIDIA GPU 在运行小型模型方面提供卓越的原始速度,并且由于其 CUDA 生态系统,对于微调和生产服务等任务至关重要。
-
本地大模型:M5 Max MacBook Pro 对比 M4 Max MacBook Pro 用户寻求建议
一位数据科学家正在寻求建议,关于是购买一台翻新的 M4 Max 芯片 MacBook Pro 还是新款 M5 Max 芯片 MacBook Pro 来运行本地大语言模型。M5 Max 在 CPU 核心和内存带宽方面略有提升,可能有助于提高 Gemma 4 31B 和 Qwen 3.6-27B 等模型的数据推导和提取任务的性能。最终决定取决于 1,120 美元的差价是否值得新款芯片带来的性能提升。
-
新指标“每瓦特智能”衡量本地AI效率
一项新的研究论文引入了“每瓦特智能”(IPW)作为评估本地AI模型效率的指标。研究发现,本地模型可以准确回答88.7%的现实世界查询,并且在2023年至2025年间IPW提高了5.3倍。与基于云的解决方案相比,本地加速器也显示出至少低1.4倍的IPW,这表明本地推理可以显著减轻集中式基础设施的需求。
-
Apple的MLX框架加速Mac上的本地LLM
Apple的MLX框架正在显著提升Apple Silicon Mac上的本地LLM性能,其表现优于llama.cpp等工具。LM Studio,一个流行的LLM前端,现在在Apple Silicon上利用MLX,与之前的默认设置如llama.cpp相比,速度有了大幅提升。这种优化使得统一内存得到高效利用,从而可以在内存充足的Mac上流畅运行更大的模型。