12b Parameter Model
PulseAugur coverage of 12b Parameter Model — every cluster mentioning 12b Parameter Model across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Google's Gemma 4 models repacked for enhanced performance on single TPU v5e
一份技术指南详细介绍了如何重新打包Google的量化感知训练(QAT)Gemma 4模型,以提高在单个Google Cloud TPU v5e芯片上的性能。重新打包后的模型,特别是12B参数版本,与bfloat16版本相比,在吞吐量和准确性方面具有竞争力,其中12B模型成为能装入该芯片的最大模型。这种优化允许在单个TPU v5e上部署各种大小的Gemma 4模型,从E2B到26B,为高效部署这些模型提供了一种实用的方法。
-
Flash AI shell作者因Ollama基础设施限制而放弃微调
Flash AI shell的作者决定因基础设施限制而放弃微调其自定义Onyx模型。Flash依赖Ollama的云端模型来服务没有强大本地硬件的用户,但这种设置不允许部署自定义权重或LoRA适配器。作者没有进行传统微调,而是专注于改进Modelfile中的系统提示和其他参数,在无需专用GPU资源的情况下取得了显著成果。
-
AI模型发布越来越倾向于更大尺寸,小型模型被抛弃
消费级硬件用户注意到一个趋势:新发布的大型语言模型主要集中在27B参数及以上,而在8B-12B范围内的新模型越来越少。这一转变使得内存有限的用户,例如使用Macbook Pro M4(16GB内存)的用户,难以找到符合其系统能力的新模型。问题在于,开发高性能的8B-12B参数级别的前沿模型是否在技术上变得不可行。
-
用户将 DeepSeek V4 Pro 蒸馏到 Gemma 26B MoE 和 12B 密集模型
一位用户详细介绍了将 DeepSeek V4 Pro 模型蒸馏成两个 Gemma 版本的过程:一个 26B 参数的 MoE 模型和一个 12B 参数的密集模型。蒸馏过程包括重新填充 Natural Questions QA 对,DeepSeek API 调用成本为 0.36 美元。用户在 Unsloth Studio 中遇到了 bug,但最终成功在一台配备两块 RTX 3090 GPU 的服务器上训练了模型。26B 模型消耗了更多的 …
-
在 Mac Mini 上探索 Gemma 4 微调的挑战
两篇文章详细介绍了微调 Google 的 Gemma 4 模型时遇到的实际挑战和个人经验。第一篇文章着重于微调过程中遇到的“障碍”,暗示用户遇到的“顺畅路径”并非理想状态。第二篇文章提供了一个具体案例研究,概述了在 Mac mini 上微调 Gemma 4 的过程,并反思了从结果中学到的经验。
-
Google 的 QATs 显示出比 Unsloth 变体更高的精度
r/LocalLLaMA 上的一位用户观察到,Google 的 QATs(量化感知训练)Q4_0 模型似乎比 Unsloth 的 Q4_K_XL 变体具有更高的精度,这与预期相反。这一观察基于文件大小和张量数量,其中 Google 的 Q4_0 模型有时比 Unsloth 的 Q4_K_XL 更大,这表明量化策略或实现方式存在差异。用户正在寻求关于为何会出现这种差异以及如何正确分析 GGUF 文件中张量数据的解释。
-
NVIDIA 将 3 个 AI 模型集成到单个检查点中,提高效率
NVIDIA 开发了一款名为 Star Elastic 的新 AI 模型,该模型将三种不同的模型尺寸(30B、23B 和 12B 参数)集成到一个检查点中。这种方法将训练成本和 token 使用量减少了 360 倍。该模型还承诺提高推理性能,有可能使其在消费级 GPU 上运行。