Ling团队发布了Ling 3.0 Tiny,这是他们之前Ling 3.0 Flash模型的较小版本。这个新模型拥有80亿参数,其中13亿为激活参数,在其尺寸级别中,其性能介于Qwen和Gemma模型之间。它专为高速度而设计,在DGX Spark上可实现约100-105 tokens/秒的速度,在M4 Pro MacBook上使用8K上下文长度可实现86-90 tokens/秒的速度,同时占用约8.34 GiB内存。 AI
影响 为本地 LLM 部署提供了一个高速、更小的模型选项,有可能提高某些任务的效率。
排序理由 发布了一个新的、更小的 MoE 模型,并附带了性能和速度指标。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →