Gemma 31b
PulseAugur coverage of Gemma 31b — every cluster mentioning Gemma 31b across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Reddit 用户推测即将推出的 LLM 参数大小
Reddit r/LocalLLaMA 子版块上的一场讨论推测了即将推出的大型语言模型的参数大小,提到了“barium-122”和“Gemma 31b”等名称。用户们表达了对参数量显著更高的模型的希望,特别是那些超过 310 亿参数的模型。
-
研究发现:LLM 的概念几何形状由语境决定,而非预训练
一篇题为“语境为王:语境内指定如何塑造概念的几何形状”的新研究论文探讨了大型语言模型如何表示结构化概念。研究表明,提供给模型的语境内指定可以覆盖其预训练知识,即使使用任意标记,也能决定诸如周期或树等概念的几何结构。这种效应在更大的模型(如 Gemma-31B 和 Qwen-27B)中更为明显,激活修补证实了这种强加几何形状的因果使用。
-
Gemma-4 模型已移植到 AWS Inferentia2 加速器
作者成功将包括密集型和专家混合(MoE)变体在内的整个 Gemma-4 模型家族移植到 AWS Inferentia2 加速器上运行。这需要大量手动工作,因为供应商提供的工具(如 optimum-neuron 和 Neuron vLLM)不支持 Gemma-4 的特定架构,例如 KV 共享和 MoE。该过程需要自定义跟踪和编译管道,其中 31B 密集型模型和 26B-A4B MoE 模型带来了独特的扩展和架构挑战。
-
Google Gemma 4模型现已可在Unsloth上运行和训练
Google发布了Gemma 4,这是一套包含E2B、E4B、26B-A4B和31B的全新模型。这些模型现已兼容Unsloth,一个优化模型训练和推理的平台。Unsloth使用户能够在仅6GB内存的设备上运行较小的Gemma 4模型,使其在手机等设备上可用,而较大的模型则需要约18GB内存。此次更新还显著提高了工具调用(tool calling)的准确性和稳定性,减少了错误并增加了允许的调用次数。