Gemma 4 - 26B-A4B
PulseAugur coverage of Gemma 4 - 26B-A4B — every cluster mentioning Gemma 4 - 26B-A4B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
大型语言模型在抽象呈现亲属关系时难以进行推理
一项新的研究论文探讨了大型语言模型如何处理亲属推理任务,发现其表现受到关系呈现方式的显著影响。与明确定义的临时谓词相比,当使用熟悉的词汇描述关系时,Qwen3.8-27B 和 Gemma 4 - 26B-A4B 等模型的表现明显更好。虽然推理预算和提示干预可以缓解这一差距,但研究得出结论,大型语言模型所表现出的关系能力并非对呈现方式漠不关心,这表明它们偏好学习到的语言联想而非形式定义。
-
稀疏MoE模型和推测性解码可大幅提升AI速度
一位开发者详细介绍了在固定硬件上,架构选择(而非配置标志)如何为其AI项目带来最显著的速度提升。使用稀疏专家混合(MoE)模型(如Gemma 4 26B-A4B),该模型每个token激活的参数更少,与密集模型相比速度提升了四倍。此外,启用多token预测(MTP)推测性解码可提升57%的速度,且感知不到质量损失,并行槽位通过允许多个并发请求,使聚合吞吐量近乎翻倍。
-
新框架在性能、延迟和内存方面评估开放LLM
一篇新的研究论文提出了一个面向推理的开放语言模型的统一评估框架,超越了简单的准确性指标。该研究在四个基准测试中测试了七种模型配置,不仅分析了准确性,还分析了延迟、内存使用和提示敏感性。Gemma-4-26B-A4B 获得了最高的加权分数,而 Gemma-4-E4B 在性能和效率之间取得了良好的平衡。研究结果表明,模型排名会根据提示策略而变化,并且特定于部署的权衡对于实际选择至关重要。
-
双模型文学翻译流水线在 Tesla P40 上实现每天 2-3 本书的翻译量
一位用户详细介绍了一个利用两块 Tesla P40 GPU 进行文学书籍翻译的双模型流水线。该流水线使用 Gemma 4 - 26B-A4B 进行翻译,速度约为每秒 40 token,并使用 Qwen3.6 35B-A3B 进行校对,速度为每秒 50-70 token。该设置利用了多 token 预测 (MTP) 推测解码和 64K 上下文窗口,以实现高效、大批量的整本书翻译。
-
Gemma 4 26B-A4B 在以自我为中心的数据任务上以 19 倍的成本匹配 Gemini 2.5 Flash
最近使用 HFlow 框架的评估,评估了几种开源权重视觉语言模型(VLMs)处理以自我为中心数据的能力。研究发现,Gemma 4 26B-A4B 在手部可见性和主动操作任务上与 Gemini 2.5 Flash 的表现相当,一致性达到 90.87%,但成本却显著降低。Gemma 和 Qwen 3.8 27B 模型都证明了自托管的实用性,提供了私有数据处理能力。这表明开源权重 VLM 越来越适合大规模的以自我为中心的数据任务,成本、吞吐…
-
Gemma 4 26B A4B 使用MoE仅激活4B参数,提升效率
Gemma 4 26B (A4B) 模型采用了混合专家(MoE)架构,在其总计260亿参数中,每个token仅激活约40亿参数。这种设计使其在保持接近小型模型的计算效率和速度的同时,拥有大型模型的知识容量,适合内存充足但计算能力有限的硬件。测试表明该模型在推理和代码相关任务上表现良好,但在严格的JSON格式化方面存在一些小问题,并且与数学提示相比,代码提示的token生成速度较慢。
-
Laguna XS 2.1 模型因在低显存硬件上的表现而受到赞扬
Laguna XS 2.1 模型因其在低端硬件上的性能而受到关注,特别是对于显存有限的用户。一位用户报告称,该模型在一台拥有 8GB 显存的笔记本电脑上运行流畅,在 60k 上下文窗口下达到了每秒 30 个 token。虽然不如 Qwen 3.6-3.8 27B 等大型模型那样完善,但据报道 Laguna XS 2.1 在特定测试提示上优于 Gemma 4 - 26B-A4B 和 Qwen 3.6 35B-A3B,尽管一些用户也注意到…
-
Gemma 4 26B-A4B 模型可在 M1 Pro MacBook Pro 上离线运行
一位用户已成功在 M1 Pro MacBook Pro 上离线运行了 Google 的 Gemma 4 26B-A4B 模型。这一演示凸显了消费级硬件处理复杂 AI 模型本地化运行的能力日益增强。
-
本地 LLM 在 SVG 生成能力方面的对比
一位 Reddit 用户对几个本地大型语言模型 (LLM) 生成可缩放矢量图形 (SVG) 代码的能力进行了并排比较。评估的模型包括 Qwen3.8-27B、Muse Glimmer 30B 和 Gemma 4 26B A4B,并使用 Google 的 Gemini 3.7 Flash 作为基于云的近似对照。用户有意避免评分,让个人能够评判原始输出,并表达了对 Qwen3.8-27B 的个人偏好,特别指出其与对照模型的差异。
-
新的 LorExperts 和 BTExperts 方法可有效压缩 MoE 模型
研究人员开发了两种新的方法,LorExperts 和 BTExperts,用于压缩混合专家(MoE)语言模型。这些技术旨在通过压缩专家权重矩阵来降低部署 MoE 模型的计算成本,同时保持准确性。LorExperts 对专家进行聚类,并使用一个主要的、全精度的专家,对其他专家进行低秩校正,保留原始路由器。BTExperts 进一步将这些专家组织成树状结构,以实现摊销计算。这两种方法在与现有基线相比时都显示出更高的性能,尤其是在专家数量增…
-
Gemma 4 26B Mac 演示澄清是 SSD 流式传输,而非 2GB RAM 使用
最近在 Mac 上演示 Google 的 Gemma 4 26B-A4B 模型引发了关于其内存需求的讨论。虽然最初被宣传为 2 GB 模型,但仔细检查后发现它利用了 SSD 流式传输来实现其专家混合(Mixture-of-Experts)架构,需要大约 3 GB 的驻留 RAM 和显著更多的磁盘空间。这项技术通过按需从 SSD 加载模型组件,而不是将整个模型保存在 RAM 中,从而实现了较低的活动内存使用量。实际内存占用量可能因具体运…
-
Gemma 4 26B-A4B 模型可在 2GB RAM 上运行,推动开源项目
开源项目 drumih/turbo-fieldfare 在 GitHub 上获得了超过 600 颗星,人气飙升。这归功于它能够使用大约 2 GB 的 RAM 运行 Gemma 4 26B-A4B 模型推理。这种效率使得在任何 M 系列 MacBook 上运行该模型成为可能,显著降低了高级 AI 推理的硬件要求。
-
Gemma 4 26B 模型在专用的 2GB 常驻内存配置下运行
一个名为 TurboFieldfare 的项目展示了 Google 的 Gemma 4 26B 模型的一种专用配置,该配置在 Apple Silicon 上使用了大约 2GB 的常驻内存。这是通过从 SSD 流式传输模型专家来实现的,而不是将整个模型保留在 RAM 中,这是 Gemma 4 的专家混合(Mixture-of-Experts)架构所支持的一种技术。虽然标题暗示了通用的 2GB 要求,但完整的系统仍需要至少 8GB 的 R…
-
开源 AI 项目 block/buzz 和 drumih/turbo-fieldfare 获得关注
两个开源 AI 项目正在 Mastodon 上获得关注。Block/buzz,一个蜂群思维通信平台,在 GitHub 上已获得超过 19,400 颗星。另外,drumih/turbo-fieldfare,它可以在内存占用极少的情况下,在 M 系列 MacBook 上实现 Gemma 4 26B-A4B 推理,已获得 2,900 颗星。
-
开源引擎在配备 2GB RAM 的 Mac 上运行 Gemma 4 26B 模型
一款名为 TurboFieldfare 的新型开源引擎允许用户在内存仅为 2GB 的 Mac 上运行 Gemma 4 26B 指令微调模型。该引擎采用 Swift 和 Metal 开发,将核心模型和 KV 缓存保留在内存中,同时从 SSD 流式传输必要的专家,从而显著降低了内存需求。这种方法使得大型语言模型可以在 Apple Silicon Mac 上运行,即使是那些只有 8GB 统一内存的设备也能运行,从而使先进的 AI 功能在消费…
-
OpenAI 大幅削减 GPT-5.6 价格;Qwen 推出新模型
OpenAI 已大幅降低其 GPT-5.6 系列的价格,其中 Terra 和 Terra Pro 模型的提示和完成成本分别削减了约 40-50%。该公司还移除了 GPT-5 Chat 和 GPT-4o Search Preview 模型,要求用户迁移。Qwen 等其他提供商推出了新模型 Qwen3.7 Flash,以具有竞争力的价格提供了 1M token 的上下文窗口,而 Z.ai 的 GLM 5.2 则出现了小幅降价。相反,NVI…
-
研究人员将LLM专家数量减半,编码能力无损
研究人员开发了一种方法,可以显著剪枝混合专家(MoE)大型语言模型,特别是针对编码能力。通过移除模型中多达一半的专家,他们在Qwen3.6 35B-A3B和Gemma 4 26B-A4B等基准测试中未发现编码性能有统计学上的显著损失。然而,最优剪枝策略在不同模型家族之间存在差异,表明需要进行特定任务的验证。该研究还强调,困惑度等传统指标可能具有误导性,并且虽然微调可以恢复部分性能损失,但剪枝仍然比激进的量化更有效。
-
Qwen3.5-122B 模型可装入 64GB 内存,提供更高质量但速度较慢
一位用户在 r/LocalLLaMA 上分享了他们在拥有 64GB 内存的系统上运行具有 UD-Q2_K_XL 量化的 Qwen3.5-122B 模型的经验。该设置允许更大的模型装入内存,与 Qwen3 Next 80B 等较小模型相比,提供了明显更好的响应质量和内部知识。然而,这以生成速度降低(约 2.9 tokens/秒)和提示处理速度大幅下降为代价,使其不适合代理任务。
-
LLM 上下文基准测试:预填充速度和 KV 缓存对代理最重要
对 13 种不同的大型语言模型在 65K 至 128K 令牌的上下文长度下进行的基准测试显示,对于代理工作负载而言,提示处理(预填充)速度是最关键的因素,而不是令牌生成速度。使用 llama.cpp 在 RX 7900 XT GPU 上进行的测试表明,KV 缓存配置和模型架构(特别是 MoE 模型)显著影响了性能。结果表明,优化预填充效率是需要广泛上下文处理的应用程序的关键。
-
开发者使用本地 LLM 构建了与游戏无关的 NPC 引擎
一位开发者创建了一个与游戏无关的 NPC 引擎,该引擎利用小型本地语言模型来增强 RPG 体验。该引擎使用 NVIDIA Parakeet 0.6 进行语音转文本,使用 Gemma 4 26B A4B 作为语言模型,并使用 Qwen3-TTS 进行语音输出,从而实现了快速响应。通过仅注入相关的游戏内操作来优化提示,防止模型过载,从而使用了检索增强生成 (RAG)。