Qwen/Qwen3.8-27B
PulseAugur coverage of Qwen/Qwen3.8-27B — every cluster mentioning Qwen/Qwen3.8-27B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
15个本地LLM模型测试代理/工具使用;qwen/qwen3.8-27b领先
一位用户使用Toolery基准测试了15个本地大型语言模型在工具和代理使用方面的能力。该基准测试包含四个难度级别的143个场景,每个模型在每个场景下进行3次试验。模型在本地使用LM Studio运行,具有30k token上下文窗口和0.8的温度。qwen/qwen3.8-27b模型以71.8%的总分获得最高分,在简单和中等难度级别中表现尤为出色。
-
Grok-4 降价,Qwen、小米、Z-AI 发布新模型
2026年9月29日当周的大语言模型定价摘要报告称,Grok-4 的价格大幅下调,目前输入令牌价格为 2 美元/百万,输出令牌价格为 6 美元/百万,使其能够与中端模型竞争。此外,Qwen、小米和 Z-AI 推出了十五款新模型。Qwen 发布了五个变体,包括其 27B 模型的免费套餐,而小米推出了三个 MiMo 变体,Z-AI 推出了七款 GLM-5.3 模型,支持用于离线处理的批量端点。这些进展表明 API 路由市场上的可用模型数量…
-
Qwen 3.8 27B 基准测试揭示实际推理性能差异 · 跟踪 1 个来源
来自 g factor 的一份新基准测试报告评估了 Qwen 3.8 27B 模型在多个推理提供商(包括 Together AI、Fireworks AI 和 Doubleword)上的性能。该研究详细介绍了张量并行、数据并行和硬件配置(Nvidia H100 与 B200)等因素如何影响首个标记时间 (Time-To-First-Token) 和标记间延迟 (Inter-Token Latency) 等关键指标。研究结果强调,与供应…
-
Groq 的免费套餐按声明的 token 计费,而非生成的 token,导致错误
Groq 的免费套餐根据用户请求中声明的最大 token 数收费,而不是实际生成的 token 数。如果声明的 `max_tokens` 设置得很高,即使是小型提示也可能导致“请求过大”的错误。计费基于所有模型共享的每分钟 8,000 个 token (TPM) 预算,这意味着一次大的声明可能会消耗掉一整分钟的额度。这种行为对 AI 代理尤其成问题,因为它们经常在提示中包含工具模式,导致意外的 token 消耗和错误。
-
Groq API 速率限制错误地基于声明的 max_tokens 来阻止请求
使用 Groq API 的开发者遇到了一个问题,即速率限制是基于声明的 `max_tokens`,而不是模型实际生成的 token 数。这意味着即使提示很小且没有生成任何 token,请求也可能被拒绝并返回 413 错误。这种行为会影响托管在 Groq 上的多个模型,包括来自 OpenAI 和阿里巴巴集团的 Qwen 模型。该问题似乎是跨模型的滚动窗口,而不是特定于单个模型,如果默认 `max_tokens` 设置得太高,可能会导致代理框架失败。
-
Qwen3.8-27B-DFlash2 模型已通过两个 Hugging Face 仓库提供
Hugging Face 上出现了两个不同的仓库,incoai/Qwen3.8-27B-DFlash2-GGUF 和 z-lab/Qwen3.8-27B-DFlash2-GGUF,均提供 Qwen3.8-27B-DFlash2 模型。这些模型被设计为用于推测性解码的草稿模型,旨在与 llama.cpp、vLLM 和 Ollama 等库配合使用。DFlash 2 技术旨在通过预测 token 块来提高解码速度,并提供了集成到各种推理提供…
-
unofficial Qwen3.8-27B 衍生模型发布,抑制了拒绝行为
PocketAI Model Lab 发布了一系列 unofficial 的 Qwen/Qwen3.8-27B 模型的 MLX 衍生版本。这些变体包括 2 位 AWQ、4 位、6 位、8 位和 BF16 版本,经过修改以抑制学习到的拒绝行为,可能导致更具危害性或冒犯性的内容。模型已进行行为评估和功能验证,大多数变体通过了质量和工具调用检查,但 2 位 AWQ 版本被标记为实验性且存在局限性。