Apple Neural Engine
PulseAugur coverage of Apple Neural Engine — every cluster mentioning Apple Neural Engine across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Apple Neural Engine:在不使用 CPU 或 GPU 的情况下运行模型
本文深入探讨了 Apple Neural Engine (ANE) 的内部工作原理,重点关注其超越传统 CPU 和 GPU 处理的能力。文章探讨了如何优化模型,特别是 Qwen 模型,使其能够直接在 ANE 上执行,绕过传统的硬件加速器。该文章是 ANE 逆向工程工作的延续。
-
较旧的 LLM 量化格式在 Apple M2 上优于较新的格式
最近在 Apple M2 笔记本电脑上对两个本地大型语言模型 (LLM) 进行的测试显示,较旧的 Q4_K_M 量化格式的表现优于较新的 MXFP4 格式。Q4_K_M 格式实现了每秒 4.7 个 token,在 44 秒内完成了 200 个 token 的生成,而 MXFP4 仅达到每秒 2.6 个 token,完成相同任务耗时 71 秒。作者推测,MXFP4 在 M2 芯片上的性能受到反量化成本以及其依赖的硬件功能 M2 不完全支…
-
Apple发布M6和M5 Ultra芯片,以增强AI性能
Apple发布了其新款M6和M5 Ultra芯片,旨在显著提升Mac设备的性能和AI能力。M6芯片采用2nm工艺制造,配备增强型CPU、GPU和双16核神经网络引擎,可实现更快的设备端AI处理。M5 Ultra采用四芯片设计架构,在CPU、GPU和内存带宽方面进行了大幅升级,成为Apple迄今为止最强大的芯片,可满足要求严苛的专业和AI工作负载。
-
Apple Silicon AI 工具利用 MLX 框架和神经网络引擎
已发布一套针对 Apple 的 MLX 数组框架和神经网络引擎进行优化的工具、框架和模型。该计划旨在利用 Apple Silicon 的能力进行 AI 开发。MLX 被呈现为 Apple 替代 PyTorch 等流行框架的方案。
-
随着云依赖性下降,离线听写应用应运而生
作者详细介绍了他们如何构建了一个名为 DictaFlow 的离线听写应用程序,该程序可以在 Windows 笔记本电脑、Mac 和 iPhone 等设备上本地运行语音识别模型。这与 Wispr Flow 等仍需要互联网连接才能进行听写的服务形成了对比。文章强调,现代硬件和开源模型(如 NVIDIA 的 Parakeet TDT 0.6B v3 和 OpenAI 的 Whisper)现在可以在不依赖云服务器的情况下执行转录,使得离线听写…
-
FusionML 通过 CPU-GPU 协同执行提升 Apple Silicon 的 AI 推理性能
研究人员开发了 FusionML 系统,通过协同执行 CPU 和 GPU 操作来优化 Apple Silicon 上的 Transformer 推理。通过解决 MLX 调度器导致的串行化限制,FusionML 实现了 Transformer 预填充的行切分方法,使 Llama 模型提速 1.15 倍至 1.38 倍,Qwen2.5-7B 的首次 token 时间缩短 1.18 倍至 1.25 倍。该系统在多代 Apple Silico…
-
SigLIP 2 等设备端 AI 模型展示本地处理能力
SigLIP 2 等设备端 AI 模型在 Apple Neural Engine 上运行,证明了完全本地化个人 AI 的可行性。目前的发展旨在将此能力扩展到微控制器等资源受限的设备,强调隐私、离线功能以及独立于云服务。
-
本地AI通过企业解决方案和内置硬件模型获得关注
本地AI功能正通过几项关键进展而不断发展,包括面向企业的生产就绪型开源智能体AI,以及将本地LLM集成到日常硬件和软件中。Red Hat详细介绍了一种在本地使用开源模型进行操作任务的方法,重点关注安全性和成本效益。同时,Apple Silicon Mac被发现通过第三方工具可访问内置的基础模型,从而实现离线、私密的AI功能,用于文本处理和智能家居控制等任务。此外,Sigma浏览器现在包含自己的本地LLM,直接在浏览器中提供私密的AI聊天功能。
-
Apple的SpeechAnalyzer API提升设备端转录速度
Apple推出了其SpeechAnalyzer API,专为设备端英语语音转录而设计。该新API利用Apple Neural Engine在速度和准确性方面取得了显著改进,据报道比Whisper Small快三倍,词错误率(WER)为2.12%。尽管取得了这些进展,该API目前的局限性包括仅支持英语以及缺乏说话人分离功能。
-
Apple's failed car project seeded powerful AI chip legacy
Apple's defunct self-driving car initiative inadvertently spurred the development of its powerful AI chips. The project's need for on-device AI processing led to the creation of the Neural Engine, which is now a core co…
-
Espresso 支持在 Apple Neural Engine 上进行设备端 transformer 训练
一个名为 Espresso 的新开源项目允许开发者直接在 Apple 的 Neural Engine 上训练和运行 transformer 模型。这使得在 Apple 硬件上运行的应用程序能够实现设备端 AI 处理。该项目可在 GitHub 上获取,旨在利用专用硬件高效执行 AI 模型。
-
新论文详解Apple Neural Engine的架构与性能
一篇新论文详细介绍了Apple Neural Engine的架构、编程和性能。该文件深入探讨了这款芯片的硬件和软件方面,该芯片旨在加速Apple设备上的机器学习任务。它探讨了开发人员如何利用Neural Engine来增强AI功能。
-
Apple MLX 支持在 Mac 设备上本地微调 AI 模型
Apple 发布了 MLX,这是一个针对其 silicon 优化的机器学习框架,使用户能够在 Mac 设备上本地微调语言模型。该框架无需云 GPU 和相关费用,使得本地 AI 模型训练更加便捷。MLX 旨在利用 Apple 的 Neural Engine 提升性能。
-
ANEForge 支持 Apple Neural Engine 的直接 Python 编程
一个名为 ANEForge 的新 Python 包允许开发者直接对 Apple Neural Engine (ANE) 进行编程,而无需依赖 CoreML。这种绕过方式可以更有效地利用 ANE,ANE 是 Apple 设备中专用的神经网络加速器。ANEForge 将张量图编译成 ANE 程序,支持诸如融合注意力、各种权重格式,甚至直接在引擎上进行训练步骤等操作。这使得模型执行速度显著加快,例如 ResNet-18 前向传播仅需 0.3…
-
Apple的设备端AI策略优先考虑隐私和性能
Apple正在推行一种独特的设备端AI策略,专注于隐私、性能和持久性,这与普遍的云中心AI模型形成了对比。该方法利用Apple的定制芯片(如Neural Engine)和统一内存来实现本地AI处理。该公司旨在解锁新的本地优先应用类别,用户数据将保留在设备上,提供更低的延迟和离线功能,可能减少许多任务对云AI API的依赖。
-
Apple M4 Max GPU 的张量计算路径被模拟,而非加速
研究人员逆向工程了 Apple M4 Max GPU 上的 Metal 4.1 张量计算路径,发现 fp8 matmul2d 操作是模拟的,而非硬件加速。这意味着该操作在 GPU 的着色器核心上运行,至少以 fp32 精度累积,并且不使用专用的矩阵数据路径或 Apple Neural Engine。这些发现详细记录在一篇题为“Rigel”的论文中,通过实证表征和微基准测试实现,并开发了一个融合内核,其性能比分解路径高出 12.9%。
-
移动NPU实现能效型端侧RAG
研究人员开发了一个能效型的检索增强生成(RAG)流水线,该流水线完全在移动神经网络处理单元(NPU)上运行,特别是高通公司在Snapdragon X Elite中发现的Hexagon NPU。该系统在索引和查询处理的速度、能耗和延迟方面,显著优于CPU和GPU基线。评估表明,NPU加速的RAG在答案质量方面与CPU和GPU方法相当,为私密、低延迟和可持续的端侧AI应用提供了可行的途径。
-
研究人员逆向工程Apple Neural Engine以进行自定义AI训练
一位安全研究人员逆向工程了Apple Neural Engine,这是一个专为AI任务设计的专用芯片。该过程允许研究人员直接在该引擎上训练神经网络,而Apple并未正式允许此操作。Neural Engine通常仅限于推理操作,这表明这项工作可能已将其功能推向了预期用途之外。
-
iPhone 大模型基准测试:Neural Engine 在持续性能上胜过 GPU
iPhone 17 Pro 上的端侧大模型性能测试表明,虽然 GPU 在初始生成速度上占优,但它们会迅速过热并降频。苹果的 Neural Engine 虽然启动较慢,但由于功耗显著降低,在长时间内能保持更一致的解码速率。这表明,对于需要持续大模型运行的应用,Neural Engine 是更高效且最终更快的选择,而 GPU 更适合快速、爆发式的交互。
-
MLX、LiteRT-LM 和 CoreML 在 iPhone 大模型性能方面进行基准测试
最近的一项基准测试在 iPhone 17 Pro 上测试了四种端侧大模型运行时,比较了解码速度和内存使用情况。对于 Qwen 3.5 2B 等通用模型,MLX 速度最快;而 LiteRT-LM 在 Gemma 4 E2B 模型上表现尤为出色。在内存受限的情况下,使用 Apple Neural Engine 的 CoreML 具有显著优势,消耗的 RAM 大大减少。