Metal
PulseAugur coverage of Metal — every cluster mentioning Metal across labs, papers, and developer communities, ranked by signal.
- used by Apple Silicon 90%
- used by Vulkan 90%
- used by macOS 90%
- used by Off Grid AI Desktop 90%
- used by Llama-2-70B-Chat-GGUF 90%
- used by Llama-2-13B-Chat-GGUF 90%
- used by Llama-2-7B-Chat-GGUF 90%
- used by Mlx 80%
- developed by Apple Silicon 70%
- used by Microsoft Windows 70%
- competes with Apple Silicon 70%
- affiliated with Apple Silicon 50%
9 天有情绪数据
Apple Silicon's Metal API gaining traction for local LLM inference
Multiple recent articles highlight the increasing use of Apple Silicon's Metal API for local LLM inference. Salvatore Sanfilippo's ds4.c engine and the LM Studio guide both point to Metal as a key enabler for running large models on Macs. This suggests a growing ecosystem and optimization efforts around Metal for AI workloads on Apple hardware.
Apple to announce enhanced Metal support for AI/ML in upcoming WWDC
Given the recent focus on Metal for local LLM inference on Apple Silicon, it's plausible Apple will announce significant enhancements or new features for AI/ML development using Metal at the upcoming WWDC. This could include improved performance, new APIs, or better integration with popular ML frameworks.
Cross-platform GPU virtualization for AI is an emerging trend
The project connecting an NVIDIA GPU to a MacBook Air via a Linux VM demonstrates a novel approach to leveraging hardware across different operating systems for AI tasks. This workaround, while currently slower than native solutions, indicates a potential future direction for utilizing specialized hardware in environments with limited native driver support.
-
WebGPU 解锁浏览器 GPU 算力,实现大规模并行计算
WebGPU 是一项新的 Web API,它允许开发者直接从浏览器利用图形处理单元(GPU)的大规模并行处理能力。与仅限于渲染且需要复杂变通方法才能进行通用计算的前身 WebGL 不同,WebGPU 能够直接在数千个线程上执行任意数学代码。这一转变预计将显著提高 Web 应用程序中 AI 推理、媒体处理和复杂模拟等任务的性能,弥合传统 CPU 密集型 Web 开发与现代 GPU 硬件能力之间的差距。
-
开发者构建本地LLM服务器,支持自动VRAM模型选择
一位开发者使用FastAPI和llama.cpp创建了一个本地LLM服务器,该服务器可根据可用的GPU VRAM自动选择合适的GGUF模型。该设置允许用户在本地运行各种模型,从7B到70B参数不等,并提供与OpenAI兼容的API。该系统使用NVML检测NVIDIA GPU的VRAM,或使用Metal检测Apple Silicon的VRAM,确保在不依赖云服务或达到速率限制的情况下高效部署模型。该项目还被打包成一个名为Strata的桌…
-
本地 LLM 服务器模拟 OpenAI API,按 VRAM 自动选择模型
一位开发者创建了一个本地 LLM 服务器,提供兼容 OpenAI 的 API,允许用户在自己的硬件上运行各种 GGUF 模型。该系统使用 llama.cpp 进行推理,FastAPI 作为服务器,并配备了一个 VRAM 感知路由器,可根据可用 GPU 内存自动选择最合适的模型。此设置旨在提供一种经济高效且注重隐私的云端 LLM 服务替代方案。
-
本地 LLM 服务器使用 VRAM 路由实现高效模型选择
一份技术指南演示了如何使用 llama.cpp 和 FastAPI 设置本地大型语言模型服务器。该系统具有 VRAM 感知路由功能,可以根据可用的 GPU 内存和请求的上下文大小自动选择最合适的 LLM。这种方法使用户能够运行各种 GGUF 量化模型,包括 Llama 和 Mistral 系列的模型,并提供兼容 OpenAI 的 API 端点,以便于集成。
-
用户在 Mac Studio 上运行 465GB DeepSeek V4-Pro LLM
一位用户详细介绍了他们如何在配备 512GB 统一内存的 Mac Studio M3 Ultra 上成功运行一个 465GB 的 LLM,即 DeepSeek V4-Pro。该设置优先考虑成本效益而非原始速度,利用 Apple Silicon 的统一内存架构和包括 llama.cpp 在内的优化工具栈。关键考虑因素包括最大化 GPU 内存分配、管理 KV 缓存、防止磁盘交换以及为大型模型实施稳健的下载和服务器管理策略。
-
Redis 创造者为 Mac 开发开源 H3 推理引擎
Redis 的创造者 Salvatore Sanfilippo 为 MiniMax AI 的 H3 模型开发了一个开源推理引擎,该引擎针对使用 Metal 的 Mac 电脑进行了优化。此实现允许在各种硬件平台上广泛访问和修改 H3 模型。Sanfilippo 的工作已在 GitHub 上提供,其中还包含 Lvlv 的代码,可能用于 drawdrawingsapp。
-
本地语音转代码系统使用 Whisper 和 Claude Code 以保护隐私
一位开发者创建了一个完全本地化的语音转代码系统,使用了 Faster Whisper 进行语音转录,并使用 Claude Code 作为 AI 代理。与 ChatGPT 的语音模式或 OpenAI 的 Codex 等云端解决方案不同,该系统避免将任何数据发送到云端,这对于敏感代码来说并不理想。该系统允许用户直接在终端中输入代码,语音转录由本地 Whisper 模型处理,为开发者提供了一种注重隐私的替代方案。
-
llama.cpp 针对 Apple Silicon 进行优化,Hugging Face 提升 4 位扩散推理速度
最新发布的 llama.cpp 版本 b10299 为 Apple Silicon 引入了优化,通过 Metal API 提升了在 macOS 和 iOS 设备上的性能。此外,Hugging Face 详细介绍了其 Nunchaku 4 位扩散推理集成到 Diffusers 库中,显著降低了 VRAM 需求并加速了消费级 GPU 上的图像生成。NVIDIA NemotronLabs VoiceChat-11B 模型也在 Hugging…
-
QuarkStar 引擎可在 16GB 机器上运行大型语言模型
一款名为 QuarkStar 的新型推理引擎已被开发出来,其灵感来源于 DwarfStar,但针对低配置硬件进行了优化。它使得 Qwen3.6-35B-A3B 和 KAT-Coder-V2.5-Dev 等大型语言模型能够在内存仅为 16GB 的机器上运行,在 Linux 上使用 Vulkan,在 Apple Silicon 上使用 Metal。该引擎还支持 SSD 流式传输,以运行超出可用内存的模型,旨在无需昂贵的硬件即可实现强大的本地 AI。
-
新的 C#/.NET 引擎 TensorSharp 性能媲美 llama.cpp
TensorSharp 是一款新的 GGUF 模型推理引擎,作为纯 C#/.NET 替代品出现,可与 llama.cpp 等成熟的 C/C++ 引擎相媲美。由 zhongkaifu 开发,它提供了广泛的模型和后端支持,包括 CUDA、Metal 和 Vulkan,以及分页 KV 缓存和连续批处理等功能。基准测试表明,TensorSharp 的性能与 llama.cpp 相当,在某些场景下 TensorSharp 速度更快,而在其他场景…
-
DeepSeek V4 Flash 为 DwarfStar 推理引擎进行了量化
用户创建并分享了 DeepSeek V4 Flash 模型的量化版本,专门针对 DwarfStar (DS4) 推理引擎进行了优化。这些 GGUF 文件旨在提供比标准 llama.cpp 实现更快的性能,一位用户报告在 MacBook M5 Max 上速度超过 30 tokens/秒。创建者正在寻求用户的反馈,特别是拥有 CUDA 或 ROCm 硬件的用户,以帮助改进量化并可能提高性能和去审查等功能。
-
开源引擎在配备 2GB RAM 的 Mac 上运行 Gemma 4 26B 模型
一款名为 TurboFieldfare 的新型开源引擎允许用户在内存仅为 2GB 的 Mac 上运行 Gemma 4 26B 指令微调模型。该引擎采用 Swift 和 Metal 开发,将核心模型和 KV 缓存保留在内存中,同时从 SSD 流式传输必要的专家,从而显著降低了内存需求。这种方法使得大型语言模型可以在 Apple Silicon Mac 上运行,即使是那些只有 8GB 统一内存的设备也能运行,从而使先进的 AI 功能在消费…
-
AI 助力《塞尔达传说:时之笛》原生移植到 iOS 设备
一位开发者利用 AI 工具,特别是 OpenAI 的 Codex 和 GPT-5.6 Sol,为 iOS 和 iPadOS 创建了经典游戏《塞尔达传说:时之笛》的原生移植版本。该项目名为 HarkinianPad,基于现有的反编译代码库,并使用 Apple 的 Metal API 将其重建为 Arm64 应用程序。该移植版本提供了宽屏支持、60 FPS 帧率和触摸控制等增强功能,但用户仍需提供自己合法获取的游戏 ROM。
-
新研究优化跨不同GPU和硬件的LLM推理
研究人员正在开发新的方法来优化跨不同硬件的大型语言模型(LLM)推理和训练。Meganeura旨在通过Vulkan和Metal实现便携式GPU训练和推理,并展示出与供应商特定解决方案相比具有竞争力的性能。Celty通过共同设计GPU内核和SIMT微架构以实现稀疏矩阵-稀疏向量工作负载,专注于高效的双稀疏LLM推理。此外,一种新的分析方法无需直接测量即可估算GPU上LLM推理的能耗,有助于可持续性分析。
-
Ollama v0.32.4-rc0 添加 Laguna MLX 模型支持并进行性能优化
Ollama 发布了 v0.32.4-rc0 版本,引入了对 Laguna MLX 模型的支持。此次更新包括与 Laguna XS 2、XS 2.1 和 S 2.1 变体的兼容性,并在密集层和 MoE 层之间实现了统一的量化策略。该版本通过选择性地量化投影、处理混合精度数据类型以及通过融合操作和缓存的预填充块来优化性能,同时将 Laguna 权重保留在 Metal 上以实现高效的 GPU 访问。
-
VIDRAFT 的 POCKET 35B 模型可在无 GPU 的手机和 PC 上运行
VIDRAFT 发布了 POCKET,这是一个拥有 350 亿参数的混合专家模型,可以使用 llama.cpp 等标准工具在无 GPU 的设备上运行,包括 PC 和手机。这为像 Bonsai 这样需要更强大硬件才能获得可比性能的模型提供了一种替代方案。POCKET 的稀疏架构使其在许多设备上运行的场景中比同等甚至更大尺寸的密集模型更快,通过完全在本地运行来优先考虑隐私和可复现性。
-
Ollama v0.32.3-rc0 更新 Laguna 模型和 GGUF 兼容性
Ollama 发布了 0.32.3-rc0 版本,更新了其 Laguna 模型以与上游 llama.cpp 实现对齐。此版本移除了 Ollama 本地的 Laguna 版本,并为路由 MoE 模型中的仅 Metal 提示溢出问题添加了临时解决方案。此外,它还翻译了旧的 GGUF 元数据名称,以确保与现有模型的持续兼容性。
-
LLM的变异测试:在无真实标签的情况下识别提取错误
一种评估大型语言模型(LLM)数据提取能力的新方法采用了变异测试,该方法无需真实标签数据即可识别错误。此方法涉及对输入进行微小更改(例如,重新排序行、添加无关文本),并检查LLM的输出是否保持一致。虽然该技术已经成熟,并且存在METAL和LLMorph等工具,但最近一项针对535张扫描收据的实验旨在确定当这些变异测试标记出差异时,实际的错误率是多少。该研究试图量化被标记的输出在多大程度上是真正不正确的,这对于高效的人工审查LLM生成的…
-
Mac 内核崩溃由大语言模型切换错误引起
一位开发者遇到了一个严重问题,在 Mac 上切换两个大语言模型时导致了内核崩溃,整个系统重启。问题源于 Apple Silicon 上 llama.cpp Python 绑定的内存管理,释放模型时并未释放其有线内存。这导致在尝试加载第二个、更大的模型时,系统可用内存耗尽,引发看门狗超时和内核崩溃。修复方法是重启应用程序的后端进程,而不是尝试就地模型交换,以确保所有内存都得到正确释放。
-
推测解码研究提升消费级硬件上LLM的推理速度
研究人员正在探索推测解码技术以加速大型语言模型(LLM)的推理。两篇论文,一篇来自arXiv,另一篇来自dev.to,详细介绍了在消费级硬件和高并发场景下提高效率的方法。arXiv论文《Lossless but Not Free》对Apple Silicon上的推测解码进行了实证分析,强调加速效果取决于并行验证以及草稿模型和目标模型之间显著的延迟差距。D-Cut论文(也来自arXiv)提出了一种用于批处理推测解码的自适应剪枝方法,该方…