Qwen3.5 397B
PulseAugur coverage of Qwen3.5 397B — every cluster mentioning Qwen3.5 397B across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
AMD的MI355X在AI工作负载上展现出快速的性能提升 · 跟踪2个来源
SemiAnalysis注意到AMD的MI355X加速器在性能上有了显著提升,尤其是在agentic工作负载方面。这些改进在短短几周内实现,缩小了MI355X与NVIDIA B300等竞争对手之间的性能差距。在运行Qwen3.5 397B和MiniMax M3等前沿模型时,这些优化尤为明显。
-
新的 TreeWY 方法增强了混合 AI 模型的推测性验证
研究人员开发了一种名为 TreeWY 的新方法,用于门控 DeltaNet 混合模型的推测性验证。该技术无需对循环状态进行内存密集型快照,而是使用树状变换来计算草稿节点输出。在 Qwen3.5 模型上的基准测试表明,TreeWY 减少了内存压力并提高了吞吐量,尤其是在内存是瓶颈时,对首次令牌生成时间(time-to-first-token)有所改善。
-
新的BEAR-Bench评估多模态模型处理复杂的英语和俄语文档的能力
研究人员推出了BEAR-Bench,这是一个旨在评估多模态大语言模型(MLLMs)在处理复杂的、文本密集的英语和俄语文档时的推理能力的新基准。该基准解决了现有评估的局限性,这些评估通常侧重于简单的信息提取或严重偏向英语和中文。BEAR-Bench包含1000个源自商业和科学文本的人工标注问题,对包括Gemini-3.1 Pro和Qwen3.5-397B在内的16个MLLMs进行的初步评估显示,即使是表现最好的模型也有很大的改进空间。该…
-
Darwin AI 模型家族通过进化融合在 GPQA Diamond 上达到 90.9%
Darwin AI 模型家族通过融合现有的开源模型,而非传统的预训练,在 GPQA Diamond 基准测试中取得了 90.9% 的分数。这种方法结合了 Gemma-4 和 Qwen-3.5 等模型,对于小型团队来说,计算效率显著提高。虽然 Darwin 在此特定基准测试中的表现名列前茅,但其能力受到其父模型限制,并且其广泛采用主要得益于 Hugging Face 等平台上的社区创建的副本。
-
韩国初创公司Darwin-398B-JGOS模型在GPQA Diamond上全球排名第三
一家名为VIDRAFT的韩国初创公司开发了一个名为Darwin-398B-JGOS的语言模型,该模型在GPQA Diamond基准测试中位列韩国模型之首。据报道,该模型在约24个GPU上训练,在全球基准测试中获得第三名,超过了包括DeepSeek V4-Pro和NVIDIA的Nemotron 3 Ultra在内的多个知名模型。Darwin-398B-JGOS通过对开放模型进行进化融合而创建,强调方法而非大规模训练,并在旨在抵抗简单网络…
-
用户讨论在 192GB RAM 系统上运行大型语言模型
一位 Reddit 用户正在寻找可以在配备 192GB RAM 的系统上运行的大型语言模型推荐,并特别提到了他们对 Qwen3.5-397B 的积极体验。他们还对 llama.cpp 进行了自定义修改,以提高混合循环模型的性能,并希望修复工具调用和 KV 缓存的问题。用户对 GLM 4.7 357B、Deepseek V4 Flash 284B 和 Tencent Hy3 295B 等其他大型模型感兴趣,并询问社区他们的经验和比较。
-
单个神经元绕过LLM安全;新RL框架改进对齐
来自Apple Inc.和马里兰大学的研究表明,单个神经元足以绕过大型语言模型的安全对齐,从而表达有害知识。另外,一个名为Oyster-II的新框架利用强化学习来改进LLM的建设性安全对齐,超越了简单的拒绝,能够更好地处理敏感查询而不损害有用性。Oyster-II在安全泛化方面表现更优,并避免对良性提示过度应用安全推理,其性能优于先前的方法,并在安全基准测试中可与更大的模型相媲美。
-
本地语音助手Athena在GitHub上发布,集成了Qwen3.5和Whisper
一款名为Athena的新型开源语音助手已在GitHub上发布,旨在完全在消费级硬件上本地运行。这款注重隐私的助手结合使用了大型语言模型(Qwen3.5-397B)、语音识别(Whisper-small.en)和文本转语音功能,提供情感响应、长期记忆和可中断性等功能。该项目旨在提供完全离线的体验,无需依赖云服务或遥测。
-
新的VLM评估方法揭示大型模型证据使用不佳
一篇新研究论文介绍了一种名为“Ill-Posed by Design”的新颖方法,用于评估视觉语言模型(VLMs)如何利用证据。该研究提出使用单目度量对象大小估计作为一项不适定任务,迫使模型依赖各种不完美的线索,如类别先验、外观和上下文。研究人员组建了一个名为Metric VQA的数据集,并测试了12个开源权重VLMs,发现即使是最大的模型在真实场景中的表现也比仅文本的LLM差。分析显示,虽然目标身份至关重要,但当前VLMs在经过Lo…
-
里约的“本土”AI模型被揭示为现有技术的合并
里约热内卢的市政AI模型Rio-3.5-Open-397B被揭示为现有模型的线性组合,而非独立开发。研究人员发现它是Nex-N2 Pro和Qwen3.5-397B的线性组合。这一发现凸显了对AI开发透明度和信任的担忧。
-
AI智能体可实现数据策展自动化,但需要结构化指导
研究人员开发了Curation-Bench,一个旨在评估通用编程智能体自动化AI模型训练数据策展过程能力的新基准。初步测试表明,智能体可以在十次迭代内完成基本的数据选择,与现有基线相当。然而,智能体倾向于进行微小调整,而不是探索根本性的新数据策略家族。一种需要智能体引用和改编先前研究方法的脚手架式方法,促成了优越的数据选择策略的自主组合,该策略以显著更少的数据超越了已发布的基线。
-
Blackwell GPU 在 Qwen3.5 模型上出现 61% 的性能下降
SemiAnalysis 的一项性能分析表明,NVIDIA 的 Blackwell GPU 在运行 SGLang Qwen3.5 397B 模型时出现显著的 61% 性能回归,原因是机密计算不支持 NVLink 组播。此问题特别影响了在多个 GPU 之间有效分配计算的能力,从而阻碍了大型语言模型的性能。