Apple M1 Max
PulseAugur coverage of Apple M1 Max — every cluster mentioning Apple M1 Max across labs, papers, and developer communities, ranked by signal.
-
Ollama 生产环境更新因过往问题和共享资源风险而推迟
作者决定不在其生产环境机器上将 Ollama 更新至 0.32.0 版本,因为尽管发布说明中宣传了新的“agent”功能,但存在潜在风险。此决定是基于过往 Ollama 更新导致数据损坏和模型可见性问题的经历。此外,生产环境机器是一个用于各种 AI 任务的共享资源,而新的 agent 的自主多步执行可能会干扰现有的资源管理和调度脚本。
-
Apple Silicon 上的 Ollama 0.30.8:GGUF 模型未激活 MLX runner
对 Ollama 0.30.8 版本的最新分析显示,尽管二进制文件包含 MLX runner 的代码,但在 Apple Silicon 上运行标准 GGUF 模型时,它似乎并未被使用。在 M1 Max 64GB Mac 上进行的调查发现,即使测试了不同的模型架构,日志也一直显示 `llama-server` 是活动的 runner。这表明通过典型的 `ollama pull` 和 `ollama run` 命令运行模型的用户可能无法获…
-
Qwen3.5-9B 模型“思考” token 膨胀输出,拖慢本地 LLM 性能
一位用户在配备 64GB RAM 的 Apple M1 Max 上使用 Ollama 进行本地执行,测试了 Qwen3.5-9B 模型。尽管模型的提示建议其日语能力可以超越 GPT-4,但测试侧重于实际性能指标。Qwen3.5-9B 模型被量化为 Q4,并使用了约 6.6GB 的 VRAM,生成了 131 个字符的日语回复,但总共产生了 3936 个 token。绝大多数这些 token 是用户不可见的内部“思考” token,这严重…
-
开发者构建代理编排系统,可并行运行ChatGPT、Claude和本地LLM
一位开发者创建了一个名为agent-orchestra的系统,用于同时管理多个大型语言模型(LLM)以完成编码任务。该工具允许跨ChatGPT、Claude和本地Qwen 2.5 Coder 32B等模型并行执行任务,并利用Git worktrees防止冲突。该系统旨在通过在达到token限制或特定模型在某些任务上表现更好时提供备选方案来维持编码的连续性。开发者发现,虽然本地模型正在改进,但强大的编排工具对于代理工作流至关重要。
-
使用 ExecuTorch MLX 代理,Qwen3 LLM 在 Apple Silicon 上运行速度提升高达 4.52 倍
一项最近的技术探索展示了在使用 ExecuTorch 的实验性 MLX 代理在 Apple Silicon 上运行 Qwen3-0.6B 语言模型时,速度得到了显著提升。与 PyTorch 的 MPS 后端相比,利用 Apple 的 MLX 框架的 MLX 代理在使用 4 位量化 (INT4) 时,解码吞吐量速度最高提升了 4.52 倍。虽然这种量化方法极大地减小了文件大小并提高了速度,但观察到在少数测试用例中改变了模型的输出。
-
M1 Max 大模型基准测试:本地运行时,更大的 MoE 模型速度更快
在配备 64GB RAM 的 Apple M1 Max 上进行的本地大模型基准测试显示,更大的模型并非总是更慢。测试使用 Ollama,发现一个 23.9GB 的 Qwen3.6 MoE 模型达到了 60.4 token/秒,优于一个较小的 6.6GB Qwen 3.5 密集模型,后者得分为 40.5 token/秒。这是因为 MoE 模型每个 token 使用的激活参数更少,尽管总体尺寸更大,但解码速度更快。基准测试还强调了在测试中…
-
GLM-5.2 在 64GB Mac 上比 Qwen3.6 慢,原因在于内存限制和活跃参数 · 跟踪 1 个来源
在 64GB Mac 上对 GLM-5.2 和 Qwen3.6 大型语言模型进行的比较显示,GLM-5.2 的速度明显较慢,这与一些说法相反。主要原因是 GLM-5.2 是一个开源的 753B 参数混合专家(MoE)模型,即使经过极端量化,也需要超过 217GB 的内存,远远超过了 Mac 的 RAM。此外,MoE 模型的速度取决于活跃参数,而不是总参数,GLM-5.2 的活跃参数 40B 大约是 Qwen3.6 的活跃参数 3B 的…
-
M1 Max 推理引擎基准测试:rapid-mlx 领先
一位爱好者在 M1 Max MacBook Pro 上使用 Qwen3.5-4B 模型对多个推理引擎进行了基准测试。结果提交给 mlx-chronos 社区基准测试后表明,rapid-mlx 在速度和内存效率方面提供了最佳性能。该用户现在正在使用 rapid-mlx 来部署 Qwen35b-A3b 模型。
-
Phosphene AI 视频工具增加了 LoRA 支持,可在 16GB RAM 的 Mac 上运行
开源 AI 视频生成工具 Phosphene 已快速更新,支持 LoRA 和 CivitAI 集成,允许用户应用自定义 LoRA 模型,如 Retro anime LoRA。此外,还出现了在内存仅为 16GB 的 Mac 上运行 Phosphene 和 LTX-2.3 的技巧,可在几分钟内使用 M1 Max 芯片生成视频。
-
AI模型从音频预测口吃事件,并部署在设备上
研究人员开发了一种新的卷积神经网络(CNN)模型,该模型能够从短音频片段中预测即将发生的口吃事件。这个拥有616K参数的模型在SEP-28k数据集上进行了训练,在识别如阻塞和声音重复等严重口吃事件的前体方面表现出特别的能力。值得注意的是,该模型可以部署在设备上,并在各种Apple设备上展示了高效的导出格式和低延迟。
-
消费级显卡也能快速上手!面壁智能MiniCPM-o 4.5发布技术报告
MiniCPM-o 4.5 是一个全新的 9B 参数的全模态大语言模型,专为实时、全双工交互而设计。它可以同时处理和生成音频、视频和文本,实现主动行为和持续的环境理解。该模型利用 Omni-Flow 框架进行时间对齐处理,并针对高效推理进行了优化,使其能够在内存小于 12GB 的边缘设备上运行。