PulseAugur
中
实时 23:15:28
实体 GPT-NeoX

GPT-NeoX

PulseAugur coverage of GPT-NeoX — every cluster mentioning GPT-NeoX across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. COMMENTARY · CL_246232 ·

    大语言模型爱好者讨论在 8GB 与 128GB 显存上运行模型的硬件需求

    r/LocalLLaMA 子版块的用户正在讨论在消费级硬件上运行大语言模型 (LLM) 的能力和限制。一位用户正在寻求关于在拥有 8GB 显存的系统上能有效运行哪些模型的建议,并表达了对具备工具使用和多语言能力的小型模型的需求,而另一位拥有更强大的 128GB 显存设置的用户则在权衡 Qwen3.8 Flash-Next、GLM 5.3 和 Deepseek 4 Flash 之间的选择。

  2. COMMENTARY · CL_221749 ·

    AI模型托管可能转向BitTorrent,用户建议

    r/LocalLLaMA子版块上的一场讨论建议使用BitTorrent托管大型AI模型文件,例如来自Hugging Face的模型。用户提出这可以作为Hugging Face等平台的一种节省成本的措施,考虑到分发这些大型、免费可用模型所涉及的巨大基础设施支出。这种方法可以利用社区资源进行分发,类似于其他大型文件类型的共享方式。

  3. TOOL · CL_160842 ·

    新框架无需完全重新训练即可稀疏化大语言模型

    研究人员开发了一种自适应深度稀疏框架(AdaDSF),旨在无需进行大规模重新训练即可降低大语言模型的推理成本。该框架利用了 Transformer 架构中不同层的重要性差异,这些差异通过层输入和输出之间的相似性来识别。AdaDSF 为每层动态分配 token 保留比例,并使用轻量级路由器选择信息性 token,同时采用一种保留特征的对齐目标来确保表示的一致性。在 GPT-NeoX 和 Qwen2.5 等模型上的实验表明,与密集模型和其…