PulseAugur
中
实时 21:23:08
实体 Qwen3.8 Flash-Next

Qwen3.8 Flash-Next

PulseAugur coverage of Qwen3.8 Flash-Next — every cluster mentioning Qwen3.8 Flash-Next across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
64
90 天内 64
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
关系
时间线
  1. 2026-09-16 product_launch GSQ-RCO released new GGUF quantizations for the Qwen3.8-Flash-Next model, reducing file size and improving performance. 来源
  2. 2026-08-27 product_launch Alibaba's Qwen team released the experimental open-weight model Qwen3.8-Flash-Next, previewing the Qwen4 architecture with NVIDIA's day-zero fine-tuning support. 来源
  3. 2026-08-26 product_launch Alibaba Group released Qwen3.8-Flash-Next, a new mixture-of-experts model. 来源
  4. 2026-08-26 product_launch Alibaba released and open-sourced the Qwen3.8-Flash-Next model, a multimodal MoE model previewing the Qwen4 architecture. 来源
  5. 2026-08-26 product_launch Alibaba released and open-sourced the Qwen3.8-Flash-Next model, featuring a new architecture and improved cost efficiency. 来源
  6. 2026-08-26 product_launch Alibaba's Qwen team released Qwen3.8-Flash-Next, an open-weight multimodal MoE model previewing the Qwen4 architecture. 来源
  7. 2026-08-26 product_launch Alibaba released Qwen3.8-Flash-Next, a new multimodal model with extensive context window support and day-zero GPU compatibility. 来源
  8. 2026-08-26 product_launch Qwen announced the release of Qwen3.8-Flash-Next, a new multimodal open-weight model. 来源
  9. 2026-08-25 product_launch The Qwen3.8-Flash-Next language model is scheduled for release. 来源
  10. 2026-08-24 product_launch Alibaba's Qwen team released Qwen3.8-Flash-Next, a multimodal MoE model previewing the Qwen4 architecture. 来源
  11. 2026-08-24 product_launch Alibaba launched Qwen3.8-Flash-Next, a multimodal MoE model previewing the Qwen4 architecture. 来源
情绪 · 30 天

10 天有情绪数据

LAB BRAIN
hypothesis resolved confirmed 置信度 0.75

Qwen4 to integrate Per-Layer Embedding and Sparse Attention for improved efficiency

The experimental Qwen4-Exp model previews novel architectures like Per-Layer Embedding (PLE) and Qwen Sparse Attention (QSA). These are designed to increase model capacity without a proportional increase in compute costs, suggesting that the upcoming Qwen4 series will likely feature these optimizations for enhanced efficiency and performance.

hypothesis resolved confirmed 置信度 0.70

Qwen3.8-Flash-Next's multimodal MoE architecture will spur new multimodal applications

The release of Qwen3.8-Flash-Next as a multimodal MoE model with a 1M context window, incorporating innovations like GDN+QSA and N-gram embeddings, suggests a push towards more capable and efficient multimodal AI. This combination of features is likely to enable developers to build novel applications that can process and generate richer, more complex multimodal content.

observation resolved contradicted 置信度 0.80

Qwen3.8-Flash-Next demonstrates significant CPU performance via quantization and offloading

The Qwen3.8-Flash-Next model, despite its large size, can run on a CPU at a reasonable speed (8.34 tokens/sec) using 4-bit quantization and llama.cpp. This highlights a trend towards making large models accessible on less powerful hardware, especially when the embedding table is offloaded to the GPU, indicating a viable path for on-device or lower-resource AI applications.

查看全部假设 →

最近 · 第 1/4 页 · 共 64 条
  1. TOOL · CL_286563 ·

    Strata 通过低比特量化实现在游戏PC上运行125B LLM

    Strata 是一个新开源项目,它使得在拥有至少12GB显存的消费级游戏PC上运行大型语言模型成为可能,特别是1250亿参数的Qwen3.8-Flash-Next模型。它通过激进的低比特量化和自定义推理引擎来实现这一点,使得强大的模型能够脱离数据中心硬件,在本地进行托管。该项目为Windows和Linux提供一键安装,支持NVIDIA和AMD GPU,并提供兼容OpenAI/Anthropic的API以便与现有工具轻松集成,但它也指出…

  2. TOOL · CL_284002 ·

    180B AI 模型通过 MoE 和 SSD 流式传输在游戏本上运行

    VIDRAFT 发布了 POCKET-Darwin-180B,这是一款拥有 1800 亿参数的 AI 模型,专为包括游戏本在内的消费级硬件部署而设计。该模型利用稀疏专家混合(MoE)架构、SSD 流式传输和 llama.cpp 运行时,使其能够以显著降低的内存需求运行。该模型的主要用例是在无法使用基于云的 AI 解决方案的隔离网络或受监管环境中。

  3. COMMENTARY · CL_283184 ·

    本地Qwen3.8-Flash-Next在编码任务中挑战Claude Opus 5.5

    一位用户在本地Strix Halo笔记本上运行的Qwen3.8-Flash-Next与Anthropic的Claude Opus 5.5进行了一项复杂编码任务的性能比较。虽然Claude Opus 5.5速度明显更快,大约18分钟完成任务,而Qwen3.8-Flash-Next耗时130分钟,但本地模型产生了更高质量的输出,包含更全面的测试和边缘情况处理。用户认为本地模型的性能足以处理实际编码任务,而云模型则保留用于规划和审查。

  4. TOOL · CL_282687 ·

    本地AI模型Qwen3.8和DeepSeek-V4.1赋能代理编码任务

    两条独立的Mastodon帖子强调了使用本地AI模型进行编码任务。一位用户详细介绍了在Strix Halo笔记本上使用Qwen3.8-Flash-Next进行代理编码,并将其性能与Opus 5.5进行了比较。另一篇泰文帖子指出,一篇文章由AI使用Hermes Agent通过DeepSeek-V4.1-Flash撰写,重点在于在安装前理解AI代理代码。

  5. SIGNIFICANT · CL_282079 ·

    开放180B模型Darwin-180B-RSI引领10项Hugging Face基准测试

    一个名为Darwin-180B-RSI的开放权重模型在10个Hugging Face官方排行榜上名列前茅,超越了所有其他参与组织。该模型由VIDRAFT基于Alibaba的Qwen3.8-Flash-Next构建,不仅在MMLU-Pro和GPQA等学术基准测试中表现出色,还在文档解析(MDPBench)、结构化数据输出(IFStruct)和PDF字段提取(ExtractBench)等实际的企业级任务中展现出强大性能。该模型的训练方法,…

  6. RESEARCH · CL_282081 ·

    Bidraft 在 Hugging Face 基准测试中以 10 项第一名领先

    Bidraft 在 Hugging Face 官方排行榜的 10 个类别中均获得第一名,数量超过任何其他组织。该公司的模型在新发布的“实用”基准测试 IFStruct 和 ExtractBench 中也表现出色,在结构化数据生成和文档信息提取方面展现出强大性能。Bidraft 新推出的 ZTC(Zero-Token Confidence,无 token 置信度)技术提供了一种显著更快、更安全的人工智能代理决策方法,直接在模型的内部状态…

  7. SIGNIFICANT · CL_281429 ·

    Huihui-Qwen3.8-Flash-NEXT 模型在 Arint.info 上发布

    Qwen3.8-Flash-NEXT 模型,也称为 Huihui-Qwen3.8-Flash-NEXT,已发布并在 Arint.info 上可用。该模型与 Strata 相关,并通过 Mastodon 分享。Hugging Face 也在此发布中被提及。

  8. RESEARCH · CL_280720 ·

    Darwin-180B-RSI凭借递归自改进在9项Hugging Face基准测试中领先

    VIDRAFT的Darwin-180B-RSI模型家族在9项官方Hugging Face基准测试中均取得第一名,超越了所有其他参与组织。该开源模型采用了递归自改进技术,即它解决可验证的问题,只保留正确的解决方案,并在没有人类生成答案的情况下进行再训练。值得注意的是,它在结构化输出生成(IFStruct)和从PDF提取数据(ExtractBench)等实际任务中表现出色,展示了其在现实世界中的应用潜力。

  9. TOOL · CL_279919 ·

    Qwen3.8-Flash-Next 模型表现出 GPU 卸载行为

    Qwen3.8-Flash-Next 模型在四个 GPU 上使用自动设备映射运行时,会使第一个 GPU 空置并将 22 GB 数据卸载。这种行为表明模型在可用硬件上分配工作负载的方式可能存在效率低下或特定配置问题。

  10. COMMENTARY · CL_279738 ·

    Qwen模型幻觉出阿里云签名URL,引发数据泄露担忧

    一位用户报告称,Qwen3.8-Flash-Next语言模型在进行亚马逊产品研究时,幻觉出了一个指向阿里云存储的签名URL。生成的URL包含了阿里云的域名以及看似访问凭证的内容。用户担心此行为可能是数据泄露的尝试,但也可能是模型训练数据中的无害产物,其中可能包含与阿里云云服务的正常交互。

  11. TOOL · CL_279741 ·

    用户计划双 R9700 GPU 设置用于本地 AI 模型训练

    一位用户计划通过在其现有配置中添加第二个 R9700 GPU 来升级其本地 AI 设置。目标是提高性能,并能够以更高的量化级别运行 Qwen3.8-Flash-Next 等更大的模型。用户详细列出了其计划的组件,包括支持 x8/x8 分叉的主板,并在购买前寻求社区对其配置的反馈。

  12. TOOL · CL_279155 ·

    Intel 混合 CPU 用户可通过 Strata 校准将 LLM 解码速度提高三倍

    Reddit 用户在 r/LocalLLaMA 子版块分享了一个“PSA”(公告),建议使用 Intel 混合 CPU 的用户运行 Strata 的校准工具。据称,此校准将其本地 LLM 解码速度提高了近三倍,性能从每秒 17.2 个 token 提升到超过 53 个 token/秒。用户详细说明了具体的配置更改,包括调整工作池、推测解码设置和 PCIe 分数,这些都促成了显著的速度提升。

  13. COMMENTARY · CL_278597 ·

    64GB内存限制LLM用户在模型或工作负载之间做出选择

    一位用户在r/LocalLLaMA上分享了在拥有64GB内存的系统上运行大型语言模型(LLM)的经验,强调了内存限制带来的挑战。尽管他们发现Strata框架显著提高了Qwen3.8-Flash-Next模型的推理速度,但加载模型几乎耗尽了他们所有的系统内存。这导致没有足够的内存来运行其他要求较高的应用程序,例如在ComfyUI上使用Minimax H3进行图像和视频推理,迫使用户在工作负载之间做出选择。

  14. RESEARCH · CL_278399 ·

    Qwen3.8 Flash Next 模型针对多样化硬件上的本地推理进行了优化

    Qwen3.8 Flash Next 模型正在针对各种硬件配置上的本地推理进行优化。一位用户在使用 NInfer 的一个分支的 RTX 6000 上实现了 400 tokens/秒的性能,另一位用户通过实现流式和并行读取,展示了在带有 SSD 的 Mac Mini 上运行该模型。另一份指南详细介绍了如何在具有大量 CPU RAM 卸载的消费级 RTX 5090 上运行 125B 参数模型,还有一位用户通过采用量化和统一内存调度方法,在…

  15. TOOL · CL_278148 ·

    Strata 项目可在消费级 GPU 上运行大型本地 LLM

    Strata 项目可在包括 12GB 显存的 GPU 在内的消费级硬件上本地运行 Qwen3.8-Flash-Next 等大型语言模型。它通过将模型的负载分配到 GPU、CPU、RAM 和 SSD,并利用专家混合(Mixture of Experts)架构,仅激活每个 token 所需的组件来实现。在 RTX 3060 上的初步测试显示,生成速度约为每秒 30 个 token,缓存利用率高,使其成为本地编码任务的可行选项。

  16. TOOL · CL_277757 ·

    133 GB MoE 模型通过 NVMe 流式传输在 8 GB GPU 上运行

    一篇技术博文详细介绍了一种在消费级 8 GB GPU 上运行大型 133 GB 混合专家(MoE)模型 Qwen3.8 Flash-Next 的方法。该技术涉及从 NVMe 存储流式传输模型专家,并利用自定义的 PyTorch 和 Triton 引擎来高效管理数据加载和计算。这种方法实现了每秒 11 个 token 的速度,与模型在参考实现上的性能相当,并且是与 Claude 和 Codex 等模型的 AI 辅助协作开发的。

  17. SIGNIFICANT · CL_276902 ·

    VIDRAFT 发布可在消费级笔记本电脑上运行的 180B LLM

    VIDRAFT 发布了 POCKET-Darwin-180B,这是其 1800 亿参数 Darwin-180B-RSI 模型的 4 位量化版本。该版本兼容 llama.cpp,可以通过利用稀疏专家混合路由和一种新颖的嫁接量化技术,在包括没有专用 GPU 的笔记本电脑在内的消费级硬件上运行。该模型的尺寸已从 360 GB 减至 111 GB,与传统的企业级 GPU 设置相比,能够以显著更低的硬件成本和系统 RAM 要求进行本地推理,同时…

  18. TOOL · CL_276632 ·

    Qwen3.8-Flash-Next 在本地硬件上实现 200 tok/s 解码速度

    一位 Reddit 用户报告了 Qwen3.8-Flash-Next 模型在功耗受限的配置下取得了令人印象深刻的性能指标。使用 Strata 软件,在配备 96GB DDR5 内存的 5090 GPU 上,系统实现了 150-200 tokens/秒 的解码速度和 5-6k tokens 的预填速度。该配置还支持 128k tokens 的上下文窗口,量化级别为 IQ3_S。

  19. TOOL · CL_276152 ·

    用户在华为Ascend硬件上优化Qwen3.8 Flash-Next

    一位用户成功地在定制硬件设置上优化了Qwen3.8 Flash-Next模型的推理,该设置配备了两块华为Ascend 310P3卡,每块卡有48GB内存。该配置最初在连贯性和速度方面遇到困难,现在每秒可达到约30-61个token。用户详细介绍了他们在软件栈上的工作,包括对vLLM及其Ascend集成的修改,以克服与驱动程序支持、内存布局和自定义算子相关的挑战。

  20. TOOL · CL_276155 ·

    Qwen3.8-Flash-Next 在 R9700 系统上的性能受到质疑

    Reddit 的 r/LocalLLaMA 子版块上一位用户正在就 Qwen3.8-Flash-Next 模型在其 R9700 系统上的性能寻求反馈。他们在使用 230,000 个 token 的上下文长度时,预填充速度为 863 token/s,解码速度为 35 token/s,并且不确定这些速度是否对其硬件配置是最佳的。用户详细介绍了他们的设置,包括具体的模型版本、后端、CPU、RAM、专家卸载、上下文设置以及 ngram 表的使…