PulseAugur
实时 09:52:11
Русский(RU) Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090 Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токе

Qwen3.8 LLM 通过 llama.cpp 优化以实现更快的推理

一份技术指南详细介绍了如何使用 llama.cpp 优化 Qwen3.8 大型语言模型以实现更快的推理。作者解释了如何利用张量并行和多 token 预测,在两块 RTX 3090 GPU 上实现每秒高达 75 个 token 的速度,显著优于默认的每秒 32 个 token。该指南提供了具体的标志和配置,以解决瓶颈并最大化性能。 AI

影响 使用 llama.cpp 优化 LLM 推理速度可以加速 AI 开发者的本地部署和实验。

排序理由 文章详细介绍了使用特定软件框架对现有 LLM 进行优化的技术,而不是发布新模型或研究。

在 Mastodon — mastodon.social 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Qwen3.8 LLM 通过 llama.cpp 优化以实现更快的推理

本文如何被排名

Signal score
17 / 100
Composite score across the factors below. Higher = stronger signal that this story matters right now.
Newsworthiness bucket
Tool
文章详细介绍了使用特定软件框架对现有 LLM 进行优化的技术,而不是发布新模型或研究。
Source corroboration
Single-source cluster
Only one publisher covered this so far. Single-source stories can still rank when the publisher is high-authority, but they lack cross-source corroboration.
Topics
infra, model release
Editorial topic classification. Feeds into how the story surfaces on /topic/<slug> hub pages and into the per-entity coverage mix.
AI-industry relevance
High
Clearly on-topic for AI-industry coverage.
Story freshness
Breaking (< 6h)
Fresh story with cross-source coverage still developing. Ranking may shift as more sources report.

完整方法见我们的编辑标准

报道来源 [1]

  1. Mastodon — mastodon.social TIER_1 Русский(RU) · [email protected] ·

    Qwen3.8. llama.cpp 中的 MTP 和张量并行:两块 RTX 3090 上每秒 75 个 token;在 llama.cpp 中,一块 270 亿参数的密集模型开箱即用可达每秒 32 个 token

    Qwen3.8. MTP и тензорный параллелизм в llama.cpp: 75 ток/сек на двух RTX 3090 Плотная 27-миллиардная модель на двух RTX 3090 в llama.cpp из коробки даёт 32 токена в секунду. Интуитивно понятно, что это не предел: две карты по 24 ГБ и 936 ГБ/с каждая не должны выдавать столько, ск…