PulseAugur
实时 19:58:32

Ling 3.0 Tiny:全新 8B MoE 模型提供高速度

Ling团队发布了Ling 3.0 Tiny,这是他们之前Ling 3.0 Flash模型的较小版本。这个新模型拥有80亿参数,其中13亿为激活参数,在其尺寸级别中,其性能介于Qwen和Gemma模型之间。它专为高速度而设计,在DGX Spark上可实现约100-105 tokens/秒的速度,在M4 Pro MacBook上使用8K上下文长度可实现86-90 tokens/秒的速度,同时占用约8.34 GiB内存。 AI

影响 为本地 LLM 部署提供了一个高速、更小的模型选项,有可能提高某些任务的效率。

排序理由 发布了一个新的、更小的 MoE 模型,并附带了性能和速度指标。[lever_c_demoted from research: ic=1 ai=1.0]

在 r/LocalLLaMA 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Ling 3.0 Tiny:全新 8B MoE 模型提供高速度

报道来源 [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/-Cubie- ·

    inclusionAI/Ling-3.0-tiny · 8B A1.3B MoE· Hugging Face

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1vkqwso/inclusionailing30tiny_8b_a13b_moe_hugging_face/"> <img alt="inclusionAI/Ling-3.0-tiny · 8B A1.3B MoE· Hugging Face" src="https://external-preview.redd.it/-W9E8wIes37LVjlOsySQwQoPCsCCBxgfutu0uAUT5WA.png…