PulseAugur
实时 12:09:24
实体 Apple Neural Engine

Apple Neural Engine

PulseAugur coverage of Apple Neural Engine — every cluster mentioning Apple Neural Engine across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 15
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_237352 ·

    Apple Neural Engine:在不使用 CPU 或 GPU 的情况下运行模型

    本文深入探讨了 Apple Neural Engine (ANE) 的内部工作原理,重点关注其超越传统 CPU 和 GPU 处理的能力。文章探讨了如何优化模型,特别是 Qwen 模型,使其能够直接在 ANE 上执行,绕过传统的硬件加速器。该文章是 ANE 逆向工程工作的延续。

  2. TOOL · CL_236933 ·

    较旧的 LLM 量化格式在 Apple M2 上优于较新的格式

    最近在 Apple M2 笔记本电脑上对两个本地大型语言模型 (LLM) 进行的测试显示,较旧的 Q4_K_M 量化格式的表现优于较新的 MXFP4 格式。Q4_K_M 格式实现了每秒 4.7 个 token,在 44 秒内完成了 200 个 token 的生成,而 MXFP4 仅达到每秒 2.6 个 token,完成相同任务耗时 71 秒。作者推测,MXFP4 在 M2 芯片上的性能受到反量化成本以及其依赖的硬件功能 M2 不完全支…

  3. FRONTIER RELEASE · CL_218553 ·

    Apple发布M6和M5 Ultra芯片,以增强AI性能

    Apple发布了其新款M6和M5 Ultra芯片,旨在显著提升Mac设备的性能和AI能力。M6芯片采用2nm工艺制造,配备增强型CPU、GPU和双16核神经网络引擎,可实现更快的设备端AI处理。M5 Ultra采用四芯片设计架构,在CPU、GPU和内存带宽方面进行了大幅升级,成为Apple迄今为止最强大的芯片,可满足要求严苛的专业和AI工作负载。

  4. TOOL · CL_187720 ·

    Apple Silicon AI 工具利用 MLX 框架和神经网络引擎

    已发布一套针对 Apple 的 MLX 数组框架和神经网络引擎进行优化的工具、框架和模型。该计划旨在利用 Apple Silicon 的能力进行 AI 开发。MLX 被呈现为 Apple 替代 PyTorch 等流行框架的方案。

  5. TOOL · CL_168479 ·

    随着云依赖性下降,离线听写应用应运而生

    作者详细介绍了他们如何构建了一个名为 DictaFlow 的离线听写应用程序,该程序可以在 Windows 笔记本电脑、Mac 和 iPhone 等设备上本地运行语音识别模型。这与 Wispr Flow 等仍需要互联网连接才能进行听写的服务形成了对比。文章强调,现代硬件和开源模型(如 NVIDIA 的 Parakeet TDT 0.6B v3 和 OpenAI 的 Whisper)现在可以在不依赖云服务器的情况下执行转录,使得离线听写…

  6. TOOL · CL_167685 ·

    FusionML 通过 CPU-GPU 协同执行提升 Apple Silicon 的 AI 推理性能

    研究人员开发了 FusionML 系统,通过协同执行 CPU 和 GPU 操作来优化 Apple Silicon 上的 Transformer 推理。通过解决 MLX 调度器导致的串行化限制,FusionML 实现了 Transformer 预填充的行切分方法,使 Llama 模型提速 1.15 倍至 1.38 倍,Qwen2.5-7B 的首次 token 时间缩短 1.18 倍至 1.25 倍。该系统在多代 Apple Silico…

  7. TOOL · CL_165983 ·

    SigLIP 2 等设备端 AI 模型展示本地处理能力

    SigLIP 2 等设备端 AI 模型在 Apple Neural Engine 上运行,证明了完全本地化个人 AI 的可行性。目前的发展旨在将此能力扩展到微控制器等资源受限的设备,强调隐私、离线功能以及独立于云服务。

  8. TOOL · CL_145328 ·

    本地AI通过企业解决方案和内置硬件模型获得关注

    本地AI功能正通过几项关键进展而不断发展,包括面向企业的生产就绪型开源智能体AI,以及将本地LLM集成到日常硬件和软件中。Red Hat详细介绍了一种在本地使用开源模型进行操作任务的方法,重点关注安全性和成本效益。同时,Apple Silicon Mac被发现通过第三方工具可访问内置的基础模型,从而实现离线、私密的AI功能,用于文本处理和智能家居控制等任务。此外,Sigma浏览器现在包含自己的本地LLM,直接在浏览器中提供私密的AI聊天功能。

  9. TOOL · CL_140740 ·

    Apple的SpeechAnalyzer API提升设备端转录速度

    Apple推出了其SpeechAnalyzer API,专为设备端英语语音转录而设计。该新API利用Apple Neural Engine在速度和准确性方面取得了显著改进,据报道比Whisper Small快三倍,词错误率(WER)为2.12%。尽管取得了这些进展,该API目前的局限性包括仅支持英语以及缺乏说话人分离功能。

  10. TOOL · CL_138582 ·

    Apple's failed car project seeded powerful AI chip legacy

    Apple's defunct self-driving car initiative inadvertently spurred the development of its powerful AI chips. The project's need for on-device AI processing led to the creation of the Neural Engine, which is now a core co…

  11. TOOL · CL_126412 ·

    Espresso 支持在 Apple Neural Engine 上进行设备端 transformer 训练

    一个名为 Espresso 的新开源项目允许开发者直接在 Apple 的 Neural Engine 上训练和运行 transformer 模型。这使得在 Apple 硬件上运行的应用程序能够实现设备端 AI 处理。该项目可在 GitHub 上获取,旨在利用专用硬件高效执行 AI 模型。

  12. TOOL · CL_116717 ·

    新论文详解Apple Neural Engine的架构与性能

    一篇新论文详细介绍了Apple Neural Engine的架构、编程和性能。该文件深入探讨了这款芯片的硬件和软件方面,该芯片旨在加速Apple设备上的机器学习任务。它探讨了开发人员如何利用Neural Engine来增强AI功能。

  13. TOOL · CL_112619 ·

    Apple MLX 支持在 Mac 设备上本地微调 AI 模型

    Apple 发布了 MLX,这是一个针对其 silicon 优化的机器学习框架,使用户能够在 Mac 设备上本地微调语言模型。该框架无需云 GPU 和相关费用,使得本地 AI 模型训练更加便捷。MLX 旨在利用 Apple 的 Neural Engine 提升性能。

  14. TOOL · CL_96115 ·

    ANEForge 支持 Apple Neural Engine 的直接 Python 编程

    一个名为 ANEForge 的新 Python 包允许开发者直接对 Apple Neural Engine (ANE) 进行编程,而无需依赖 CoreML。这种绕过方式可以更有效地利用 ANE,ANE 是 Apple 设备中专用的神经网络加速器。ANEForge 将张量图编译成 ANE 程序,支持诸如融合注意力、各种权重格式,甚至直接在引擎上进行训练步骤等操作。这使得模型执行速度显著加快,例如 ResNet-18 前向传播仅需 0.3…

  15. COMMENTARY · CL_89607 ·

    Apple的设备端AI策略优先考虑隐私和性能

    Apple正在推行一种独特的设备端AI策略,专注于隐私、性能和持久性,这与普遍的云中心AI模型形成了对比。该方法利用Apple的定制芯片(如Neural Engine)和统一内存来实现本地AI处理。该公司旨在解锁新的本地优先应用类别,用户数据将保留在设备上,提供更低的延迟和离线功能,可能减少许多任务对云AI API的依赖。

  16. TOOL · CL_86852 ·

    Apple M4 Max GPU 的张量计算路径被模拟,而非加速

    研究人员逆向工程了 Apple M4 Max GPU 上的 Metal 4.1 张量计算路径,发现 fp8 matmul2d 操作是模拟的,而非硬件加速。这意味着该操作在 GPU 的着色器核心上运行,至少以 fp32 精度累积,并且不使用专用的矩阵数据路径或 Apple Neural Engine。这些发现详细记录在一篇题为“Rigel”的论文中,通过实证表征和微基准测试实现,并开发了一个融合内核,其性能比分解路径高出 12.9%。

  17. TOOL · CL_84921 ·

    移动NPU实现能效型端侧RAG

    研究人员开发了一个能效型的检索增强生成(RAG)流水线,该流水线完全在移动神经网络处理单元(NPU)上运行,特别是高通公司在Snapdragon X Elite中发现的Hexagon NPU。该系统在索引和查询处理的速度、能耗和延迟方面,显著优于CPU和GPU基线。评估表明,NPU加速的RAG在答案质量方面与CPU和GPU方法相当,为私密、低延迟和可持续的端侧AI应用提供了可行的途径。

  18. RESEARCH · CL_79399 ·

    研究人员逆向工程Apple Neural Engine以进行自定义AI训练

    一位安全研究人员逆向工程了Apple Neural Engine,这是一个专为AI任务设计的专用芯片。该过程允许研究人员直接在该引擎上训练神经网络,而Apple并未正式允许此操作。Neural Engine通常仅限于推理操作,这表明这项工作可能已将其功能推向了预期用途之外。

  19. TOOL · CL_70814 ·

    iPhone 大模型基准测试:Neural Engine 在持续性能上胜过 GPU

    iPhone 17 Pro 上的端侧大模型性能测试表明,虽然 GPU 在初始生成速度上占优,但它们会迅速过热并降频。苹果的 Neural Engine 虽然启动较慢,但由于功耗显著降低,在长时间内能保持更一致的解码速率。这表明,对于需要持续大模型运行的应用,Neural Engine 是更高效且最终更快的选择,而 GPU 更适合快速、爆发式的交互。

  20. TOOL · CL_65009 ·

    MLX、LiteRT-LM 和 CoreML 在 iPhone 大模型性能方面进行基准测试

    最近的一项基准测试在 iPhone 17 Pro 上测试了四种端侧大模型运行时,比较了解码速度和内存使用情况。对于 Qwen 3.5 2B 等通用模型,MLX 速度最快;而 LiteRT-LM 在 Gemma 4 E2B 模型上表现尤为出色。在内存受限的情况下,使用 Apple Neural Engine 的 CoreML 具有显著优势,消耗的 RAM 大大减少。