旨在运行 3210 亿参数 GLM5.3-Flash 模型的新系统 Project Maya 已发布。该项目通过智能管理 GPU、RAM 和 NVMe SSD 上的模型层,使用户能在消费级硬件上运行如此大的模型。早期用户报告称速度显著提升,Maya 在单个 GPU 上实现了超过 30 tokens/s 的速度,同时保持了与原始 FP8 模型相比的高准确性,并提供了 OpenAI 和 Anthropic 兼容的 API 以便集成到代理中。 AI
影响 使大型、高精度模型能在消费级硬件上运行,可能使先进的 AI 能力的获取更加普及。
排序理由 这是一个软件工具,它使得大型语言模型能在消费级硬件上运行,而不是来自前沿实验室的新模型发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →