实体
Falcon 180B
Falcon 180B
PulseAugur coverage of Falcon 180B — every cluster mentioning Falcon 180B across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
LLM 用户寻求关于升级到 40B+ 参数模型以提高速度和知识的建议
r/LocalLLaMA subreddit 上的一位用户正在寻求关于拥有超过 400 亿参数的大型语言模型 (LLM) 的推荐。他们目前使用的是 Qwen3.6 35B,但发现它缺乏通用知识,更像一个执行者而不是助手。用户正在考虑升级到 Qwen3.5 122B,但担心速度问题,因为他们在 Strix Halo 硬件上使用 131k 上下文窗口时,目前能达到大约 30-40 tokens/秒。
-
更小的语言模型现已超越更大的模型,挑战规模化趋势
根据Sara Hooker的一篇文章,提高语言模型(LLM)规模以获得更好性能的趋势正达到极限。虽然更大的模型历来优于更小的模型,但近期证据表明,更小、更高效的模型现在正取得相当或更优的结果。这表明当前的规模化方法可能效率低下,由于未经优化的训练机制,相当一部分参数可能冗余。