PulseAugur
实时 23:43:21
实体 mlx-lm

mlx-lm

PulseAugur coverage of mlx-lm — every cluster mentioning mlx-lm across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

4 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_256244 ·

    LLMeter CLI 衡量本地硬件上的 LLM 性能

    LLMeter 是一款新的命令行界面工具,旨在衡量大型语言模型 (LLM) 在用户特定硬件和配置上的性能。与在优化过的远程机器上测试模型的传统排行榜不同,LLMeter 侧重于实际运行环境,考虑了量化、提供商软件(例如 Ollama、LM Studio)和硬件特定因素。它提供了用于聊天生成、响应一致性、计时、结构化输出和工具调用的各种基准测试,并为调整部署提供了额外的性能配置文件。

  2. SIGNIFICANT · CL_247329 ·

    Edge0发布35B MoE LLM以支持低内存设备

    Edge0发布了其Edge0-35B-A3B模型的预览版,这是一个拥有350亿参数的稀疏专家混合(MoE)大型语言模型,专为在内存有限的设备上高效运行而设计。该模型通过按需流式传输专家,所需的活动RAM低于3 GiB,能够实现每秒15个token的交互速度。提供了将此模型与MLX、LM Studio和Hermes Agent等各种库和应用程序集成的说明,使其可以在Raspberry Pi等设备上本地使用。

  3. TOOL · CL_233724 ·

    Perplexity 开源适用于 Apple Silicon 的 Lily 推理引擎

    Perplexity 已开源 Lily,一个使用 Rust 和 Metal 构建的专用推理引擎,用于在 Apple Silicon 上运行 Qwen3.6-35B-A3B 模型。该引擎专为狭窄的硬件优化而设计,与 MLX-LM 等通用框架相比,解码速度提高了 1.35 倍,预填充速度提高了 1.23 倍。Lily 的架构绕过了 PyTorch 和 MLX 等传统框架,利用手工编写的 Metal 内核进行执行,并提供了一个与 OpenA…

  4. TOOL · CL_232829 ·

    Perplexity 开源 Lily 推理引擎以支持 Apple Silicon

    Perplexity 已开源 Lily,这是一个专为 Perplexity Computer 产品中的混合计算设计的本地推理引擎。Lily 专门针对在 Apple silicon 上运行 Qwen3.6-35B-A3B 模型进行了优化,将其视为一个独立的平台。基准测试显示,在 M5 Max MacBook Pro 上,Lily 在 prefill 和 decode 吞吐量方面均优于 MLX-LM,在保持输出质量的同时,有效地处理了 p…

  5. COMMENTARY · CL_202492 ·

    Apple Silicon LLM 推理受制于碎片化的软件栈

    在 Apple Silicon 上高效运行大型语言模型受到碎片化且不成熟的软件生态系统的阻碍。与 NVIDIA 的 CUDA 平台提供的集成优化不同,Apple 的平台缺乏一个统一的框架来整合关键功能,如前缀缓存、推测解码和连续批处理,以支持 Qwen 等较新模型。作者建议将精力集中在一个强大且统一的框架上,可能基于 vllm-metal 进行构建,以提高本地 LLM 推理的性能和用户体验。

  6. TOOL · CL_188516 ·

    Apple Silicon上的Gemma模型出现无声缓存bug,导致本地AI变慢

    一个影响Apple Silicon上Gemma模型的缓存bug已被发现,导致本地AI代理性能显著下降。该问题源于Gemma的滑动窗口注意力机制,当上下文长度超过一定阈值时,KV缓存重用会无声失败。修复方法是将缓存类型更改为普通的KVCache,这可以在不影响模型输出质量的情况下恢复性能,使本地编码代理的速度提高高达20倍。

  7. TOOL · CL_167685 ·

    FusionML 通过 CPU-GPU 协同执行提升 Apple Silicon 的 AI 推理性能

    研究人员开发了 FusionML 系统,通过协同执行 CPU 和 GPU 操作来优化 Apple Silicon 上的 Transformer 推理。通过解决 MLX 调度器导致的串行化限制,FusionML 实现了 Transformer 预填充的行切分方法,使 Llama 模型提速 1.15 倍至 1.38 倍,Qwen2.5-7B 的首次 token 时间缩短 1.18 倍至 1.25 倍。该系统在多代 Apple Silico…

  8. RESEARCH · CL_70649 ·

    Gemma 4 12B 本地 AI 模型需要配置调整以获得最佳性能

    Google 的 Gemma 4 12B 模型在本地 AI 设置方面显示出潜力,但用户报告称 LM Studio 等工具中的默认配置会阻碍其推理能力。需要对 Jinja 模板和采样参数进行特定调整,例如提高 temperature 和禁用 token mismatch,才能充分发挥其潜力。虽然 Gemma 4 12B 已证明能够正确重写代码并替换低效循环,但其性能受限于模型大小,像 Qwen 35B 这样更大的模型在基准测试中发现了更多 bug。