Gemma 4 26B-A4B
PulseAugur coverage of Gemma 4 26B-A4B — every cluster mentioning Gemma 4 26B-A4B across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Gemma 4 26B-A4B 模型可在 M1 Pro MacBook Pro 上离线运行
一位用户已成功在 M1 Pro MacBook Pro 上离线运行了 Google 的 Gemma 4 26B-A4B 模型。这一演示凸显了消费级硬件处理复杂 AI 模型本地化运行的能力日益增强。
-
本地 LLM 在 SVG 生成能力方面的对比
一位 Reddit 用户对几个本地大型语言模型 (LLM) 生成可缩放矢量图形 (SVG) 代码的能力进行了并排比较。评估的模型包括 Qwen3.8-27B、Muse Glimmer 30B 和 Gemma 4 26B A4B,并使用 Google 的 Gemini 3.7 Flash 作为基于云的近似对照。用户有意避免评分,让个人能够评判原始输出,并表达了对 Qwen3.8-27B 的个人偏好,特别指出其与对照模型的差异。
-
新的 LorExperts 和 BTExperts 方法可有效压缩 MoE 模型
研究人员开发了两种新的方法,LorExperts 和 BTExperts,用于压缩混合专家(MoE)语言模型。这些技术旨在通过压缩专家权重矩阵来降低部署 MoE 模型的计算成本,同时保持准确性。LorExperts 对专家进行聚类,并使用一个主要的、全精度的专家,对其他专家进行低秩校正,保留原始路由器。BTExperts 进一步将这些专家组织成树状结构,以实现摊销计算。这两种方法在与现有基线相比时都显示出更高的性能,尤其是在专家数量增…
-
Gemma 4 26B Mac 演示澄清是 SSD 流式传输,而非 2GB RAM 使用
最近在 Mac 上演示 Google 的 Gemma 4 26B-A4B 模型引发了关于其内存需求的讨论。虽然最初被宣传为 2 GB 模型,但仔细检查后发现它利用了 SSD 流式传输来实现其专家混合(Mixture-of-Experts)架构,需要大约 3 GB 的驻留 RAM 和显著更多的磁盘空间。这项技术通过按需从 SSD 加载模型组件,而不是将整个模型保存在 RAM 中,从而实现了较低的活动内存使用量。实际内存占用量可能因具体运…
-
Gemma 4 26B-A4B 模型可在 2GB RAM 上运行,推动开源项目
开源项目 drumih/turbo-fieldfare 在 GitHub 上获得了超过 600 颗星,人气飙升。这归功于它能够使用大约 2 GB 的 RAM 运行 Gemma 4 26B-A4B 模型推理。这种效率使得在任何 M 系列 MacBook 上运行该模型成为可能,显著降低了高级 AI 推理的硬件要求。
-
Gemma 4 26B 模型在专用的 2GB 常驻内存配置下运行
一个名为 TurboFieldfare 的项目展示了 Google 的 Gemma 4 26B 模型的一种专用配置,该配置在 Apple Silicon 上使用了大约 2GB 的常驻内存。这是通过从 SSD 流式传输模型专家来实现的,而不是将整个模型保留在 RAM 中,这是 Gemma 4 的专家混合(Mixture-of-Experts)架构所支持的一种技术。虽然标题暗示了通用的 2GB 要求,但完整的系统仍需要至少 8GB 的 R…
-
开源 AI 项目 block/buzz 和 drumih/turbo-fieldfare 获得关注
两个开源 AI 项目正在 Mastodon 上获得关注。Block/buzz,一个蜂群思维通信平台,在 GitHub 上已获得超过 19,400 颗星。另外,drumih/turbo-fieldfare,它可以在内存占用极少的情况下,在 M 系列 MacBook 上实现 Gemma 4 26B-A4B 推理,已获得 2,900 颗星。
-
开源引擎在配备 2GB RAM 的 Mac 上运行 Gemma 4 26B 模型
一款名为 TurboFieldfare 的新型开源引擎允许用户在内存仅为 2GB 的 Mac 上运行 Gemma 4 26B 指令微调模型。该引擎采用 Swift 和 Metal 开发,将核心模型和 KV 缓存保留在内存中,同时从 SSD 流式传输必要的专家,从而显著降低了内存需求。这种方法使得大型语言模型可以在 Apple Silicon Mac 上运行,即使是那些只有 8GB 统一内存的设备也能运行,从而使先进的 AI 功能在消费…
-
OpenAI 大幅削减 GPT-5.6 价格;Qwen 推出新模型
OpenAI 已大幅降低其 GPT-5.6 系列的价格,其中 Terra 和 Terra Pro 模型的提示和完成成本分别削减了约 40-50%。该公司还移除了 GPT-5 Chat 和 GPT-4o Search Preview 模型,要求用户迁移。Qwen 等其他提供商推出了新模型 Qwen3.7 Flash,以具有竞争力的价格提供了 1M token 的上下文窗口,而 Z.ai 的 GLM 5.2 则出现了小幅降价。相反,NVI…
-
研究人员将LLM专家数量减半,编码能力无损
研究人员开发了一种方法,可以显著剪枝混合专家(MoE)大型语言模型,特别是针对编码能力。通过移除模型中多达一半的专家,他们在Qwen3.6 35B-A3B和Gemma 4 26B-A4B等基准测试中未发现编码性能有统计学上的显著损失。然而,最优剪枝策略在不同模型家族之间存在差异,表明需要进行特定任务的验证。该研究还强调,困惑度等传统指标可能具有误导性,并且虽然微调可以恢复部分性能损失,但剪枝仍然比激进的量化更有效。
-
Qwen3.5-122B 模型可装入 64GB 内存,提供更高质量但速度较慢
一位用户在 r/LocalLLaMA 上分享了他们在拥有 64GB 内存的系统上运行具有 UD-Q2_K_XL 量化的 Qwen3.5-122B 模型的经验。该设置允许更大的模型装入内存,与 Qwen3 Next 80B 等较小模型相比,提供了明显更好的响应质量和内部知识。然而,这以生成速度降低(约 2.9 tokens/秒)和提示处理速度大幅下降为代价,使其不适合代理任务。
-
LLM 上下文基准测试:预填充速度和 KV 缓存对代理最重要
对 13 种不同的大型语言模型在 65K 至 128K 令牌的上下文长度下进行的基准测试显示,对于代理工作负载而言,提示处理(预填充)速度是最关键的因素,而不是令牌生成速度。使用 llama.cpp 在 RX 7900 XT GPU 上进行的测试表明,KV 缓存配置和模型架构(特别是 MoE 模型)显著影响了性能。结果表明,优化预填充效率是需要广泛上下文处理的应用程序的关键。
-
开发者使用本地 LLM 构建了与游戏无关的 NPC 引擎
一位开发者创建了一个与游戏无关的 NPC 引擎,该引擎利用小型本地语言模型来增强 RPG 体验。该引擎使用 NVIDIA Parakeet 0.6 进行语音转文本,使用 Gemma 4 26B A4B 作为语言模型,并使用 Qwen3-TTS 进行语音输出,从而实现了快速响应。通过仅注入相关的游戏内操作来优化提示,防止模型过载,从而使用了检索增强生成 (RAG)。
-
新AI架构量化法律结果预测中的司法自由裁量权
研究人员开发了一种新颖的法官感知门控多任务学习架构,通过区分事实案件证据和司法自由裁量权来更好地预测法律结果。该方法在13,937个英国就业法庭判决上进行了评估,其性能优于Gemma-4 26B-A4B等大型语言模型的标准监督微调。门控架构的参数效率更高,可解释性更强,能够定位司法背景显著影响预测的案件。
-
DistilledGemma系统在人物地名关系抽取中实现高精度 · 跟踪2个来源
研究人员开发了DistilledGemma,一个从多语言历史文章中抽取人物地名关系的高效系统,在HIPE-2026共享任务中取得了0.688的平均分。该系统采用三阶段知识蒸馏流程,首先在大型语言模型上进行提示工程,然后使用QLoRA对Gemma 4 26B模型进行监督微调,最后将响应级蒸馏到一个更小的Gemma 4 E2B学生模型中。这种方法成功地减小了模型尺寸,同时保持了强大的推理能力,在标准和二元测试集的效率-准确性方面均排名第二。
-
Google Gemma 4 模型详解:从手机到高端 GPU 的显存需求
Google 发布了 Gemma 4,提供四种不同显存需求的模型变体。最小的模型适用于内存极小的设备,而最大的 31B Dense 模型需要至少 22GB 显存,最适合 RTX 5090 等 GPU。26B-A4B MoE 变体被强调为一种平衡选择,通过仔细的上下文管理可安装在 16GB 显卡上,推荐给拥有 16GB 或 24GB GPU 的用户。
-
Google DeepMind 的 Gemma 4 模型现已在 Amazon Bedrock 上可用
Amazon Bedrock 现在提供由 Google DeepMind 开发的 Gemma 4 系列开放权重模型。这些模型专为各种部署场景的高效性能而设计,包括指令微调的变体,如 Gemma 4 31B、Gemma 4 26B-A4B 和 Gemma 4 E2B。它们具有内置推理、原生函数调用以及文本和图像的多模态输入功能。Gemma 4 模型在 Apache 2.0 许可下提供,通过 AWS 的托管服务为用户提供数据保护和运营控制。
-
Google DeepMind 发布 DiffusionGemma 26B 多模态模型
Google DeepMind 发布了 DiffusionGemma 26B A4B IT,这是一个开源的多模态生成模型,能够处理文本、图像和视频输入以生成文本输出。该模型基于 Gemma 4 26B A4B Mixture-of-Experts 架构构建,拥有 252 亿个总参数和 38 亿个激活参数。它支持 256K token 的上下文窗口,跨 35 种以上语言的多语言推理,并且可以在 NVIDIA H100 GPU 上每秒生成…
-
用户寻求本地AI处理复杂文档,提及Gemma 4的局限性
一位Reddit用户正在寻求本地AI解决方案的建议,用于处理复杂的工业文档,特别是轧钢厂的试验证明。他们的目标是用一个系统替换商业产品,该系统能够将多页PDF拆分成单独的报告,提取关键元数据(如批号和合金类型),并将这些信息存储在可搜索的数据库中。用户已经尝试了Gemma 4 26B A4B,但发现它在确定页面边界和处理不同文档格式方面存在困难,尽管在对单个报告使用结构化提示时表现良好。他们正在考虑构建代理工具,并正在寻找精通工具调用…
-
Google DeepMind 发布 DiffusionGemma 26B 多模态人工智能模型
Google DeepMind 发布了 DiffusionGemma 26B A4B IT,这是一个开放权重多模态生成模型,能够处理文本、图像和视频输入以生成文本输出。该模型基于 Gemma 4 26B A4B 混合专家架构构建,拥有 252 亿个总参数和 38 亿个激活参数。它支持 256K token 上下文窗口、原生函数调用以及超过 35 种语言的多语言推理,在 NVIDIA H100 GPU 上实现了超过 1,100 toke…