Qwen3.5 397B
PulseAugur coverage of Qwen3.5 397B — every cluster mentioning Qwen3.5 397B across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
用户讨论在 192GB RAM 系统上运行大型语言模型
一位 Reddit 用户正在寻找可以在配备 192GB RAM 的系统上运行的大型语言模型推荐,并特别提到了他们对 Qwen3.5-397B 的积极体验。他们还对 llama.cpp 进行了自定义修改,以提高混合循环模型的性能,并希望修复工具调用和 KV 缓存的问题。用户对 GLM 4.7 357B、Deepseek V4 Flash 284B 和 Tencent Hy3 295B 等其他大型模型感兴趣,并询问社区他们的经验和比较。
-
单个神经元绕过LLM安全;新RL框架改进对齐
来自Apple Inc.和马里兰大学的研究表明,单个神经元足以绕过大型语言模型的安全对齐,从而表达有害知识。另外,一个名为Oyster-II的新框架利用强化学习来改进LLM的建设性安全对齐,超越了简单的拒绝,能够更好地处理敏感查询而不损害有用性。Oyster-II在安全泛化方面表现更优,并避免对良性提示过度应用安全推理,其性能优于先前的方法,并在安全基准测试中可与更大的模型相媲美。
-
本地语音助手Athena在GitHub上发布,集成了Qwen3.5和Whisper
一款名为Athena的新型开源语音助手已在GitHub上发布,旨在完全在消费级硬件上本地运行。这款注重隐私的助手结合使用了大型语言模型(Qwen3.5-397B)、语音识别(Whisper-small.en)和文本转语音功能,提供情感响应、长期记忆和可中断性等功能。该项目旨在提供完全离线的体验,无需依赖云服务或遥测。
-
新的VLM评估方法揭示大型模型证据使用不佳
一篇新研究论文介绍了一种名为“Ill-Posed by Design”的新颖方法,用于评估视觉语言模型(VLMs)如何利用证据。该研究提出使用单目度量对象大小估计作为一项不适定任务,迫使模型依赖各种不完美的线索,如类别先验、外观和上下文。研究人员组建了一个名为Metric VQA的数据集,并测试了12个开源权重VLMs,发现即使是最大的模型在真实场景中的表现也比仅文本的LLM差。分析显示,虽然目标身份至关重要,但当前VLMs在经过Lo…
-
里约的“本土”AI模型被揭示为现有技术的合并
里约热内卢的市政AI模型Rio-3.5-Open-397B被揭示为现有模型的线性组合,而非独立开发。研究人员发现它是Nex-N2 Pro和Qwen3.5-397B的线性组合。这一发现凸显了对AI开发透明度和信任的担忧。
-
AI智能体可实现数据策展自动化,但需要结构化指导
研究人员开发了Curation-Bench,一个旨在评估通用编程智能体自动化AI模型训练数据策展过程能力的新基准。初步测试表明,智能体可以在十次迭代内完成基本的数据选择,与现有基线相当。然而,智能体倾向于进行微小调整,而不是探索根本性的新数据策略家族。一种需要智能体引用和改编先前研究方法的脚手架式方法,促成了优越的数据选择策略的自主组合,该策略以显著更少的数据超越了已发布的基线。
-
Blackwell GPU 在 Qwen3.5 模型上出现 61% 的性能下降
SemiAnalysis 的一项性能分析表明,NVIDIA 的 Blackwell GPU 在运行 SGLang Qwen3.5 397B 模型时出现显著的 61% 性能回归,原因是机密计算不支持 NVLink 组播。此问题特别影响了在多个 GPU 之间有效分配计算的能力,从而阻碍了大型语言模型的性能。