Inkling-Small 276B-A12B 模型(约有 120 亿活跃参数)的新转换版本已针对在内存小于 10GB 的消费级硬件上运行进行了优化。基准测试显示,该模型在生成时速度约为每秒 2.9 个 token,但长提示预填充时间被指出是一个问题。这一发展是使大型混合专家(MoE)模型在标准硬件上可访问的持续努力的一部分。 AI
影响 使得在消费级硬件上运行大型 MoE 模型成为可能,从而可能拓宽其可访问性和用例。
排序理由 该项目描述了一个特定模型转换的优化和发布,适用于消费级硬件,属于工具范畴。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →