PulseAugur
中
实时 13:26:43
实体 12b Parameter Model

12b Parameter Model

PulseAugur coverage of 12b Parameter Model — every cluster mentioning 12b Parameter Model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_276502 ·

    Google's Gemma 4 models repacked for enhanced performance on single TPU v5e

    一份技术指南详细介绍了如何重新打包Google的量化感知训练(QAT)Gemma 4模型,以提高在单个Google Cloud TPU v5e芯片上的性能。重新打包后的模型,特别是12B参数版本,与bfloat16版本相比,在吞吐量和准确性方面具有竞争力,其中12B模型成为能装入该芯片的最大模型。这种优化允许在单个TPU v5e上部署各种大小的Gemma 4模型,从E2B到26B,为高效部署这些模型提供了一种实用的方法。

  2. COMMENTARY · CL_244143 ·

    Flash AI shell作者因Ollama基础设施限制而放弃微调

    Flash AI shell的作者决定因基础设施限制而放弃微调其自定义Onyx模型。Flash依赖Ollama的云端模型来服务没有强大本地硬件的用户,但这种设置不允许部署自定义权重或LoRA适配器。作者没有进行传统微调,而是专注于改进Modelfile中的系统提示和其他参数,在无需专用GPU资源的情况下取得了显著成果。

  3. COMMENTARY · CL_194300 ·

    AI模型发布越来越倾向于更大尺寸,小型模型被抛弃

    消费级硬件用户注意到一个趋势:新发布的大型语言模型主要集中在27B参数及以上,而在8B-12B范围内的新模型越来越少。这一转变使得内存有限的用户,例如使用Macbook Pro M4(16GB内存)的用户,难以找到符合其系统能力的新模型。问题在于,开发高性能的8B-12B参数级别的前沿模型是否在技术上变得不可行。

  4. TOOL · CL_132670 ·

    用户将 DeepSeek V4 Pro 蒸馏到 Gemma 26B MoE 和 12B 密集模型

    一位用户详细介绍了将 DeepSeek V4 Pro 模型蒸馏成两个 Gemma 版本的过程:一个 26B 参数的 MoE 模型和一个 12B 参数的密集模型。蒸馏过程包括重新填充 Natural Questions QA 对,DeepSeek API 调用成本为 0.36 美元。用户在 Unsloth Studio 中遇到了 bug,但最终成功在一台配备两块 RTX 3090 GPU 的服务器上训练了模型。26B 模型消耗了更多的 …

  5. TOOL · CL_89737 ·

    在 Mac Mini 上探索 Gemma 4 微调的挑战

    两篇文章详细介绍了微调 Google 的 Gemma 4 模型时遇到的实际挑战和个人经验。第一篇文章着重于微调过程中遇到的“障碍”,暗示用户遇到的“顺畅路径”并非理想状态。第二篇文章提供了一个具体案例研究,概述了在 Mac mini 上微调 Gemma 4 的过程,并反思了从结果中学到的经验。

  6. TOOL · CL_77165 ·

    Google 的 QATs 显示出比 Unsloth 变体更高的精度

    r/LocalLLaMA 上的一位用户观察到,Google 的 QATs(量化感知训练)Q4_0 模型似乎比 Unsloth 的 Q4_K_XL 变体具有更高的精度,这与预期相反。这一观察基于文件大小和张量数量,其中 Google 的 Q4_0 模型有时比 Unsloth 的 Q4_K_XL 更大,这表明量化策略或实现方式存在差异。用户正在寻求关于为何会出现这种差异以及如何正确分析 GGUF 文件中张量数据的解释。

  7. RESEARCH · CL_24516 ·

    NVIDIA 将 3 个 AI 模型集成到单个检查点中,提高效率

    NVIDIA 开发了一款名为 Star Elastic 的新 AI 模型,该模型将三种不同的模型尺寸(30B、23B 和 12B 参数)集成到一个检查点中。这种方法将训练成本和 token 使用量减少了 360 倍。该模型还承诺提高推理性能,有可能使其在消费级 GPU 上运行。