DeepSeek-VL2-Tiny
PulseAugur coverage of DeepSeek-VL2-Tiny — every cluster mentioning DeepSeek-VL2-Tiny across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的RAPTOR框架增强了MoE AI模型的私有训练
研究人员开发了RAPTOR,一种用于专家混合(MoE)模型差分私有训练的新颖框架。现有方法将这些稀疏模型视为密集块,导致梯度抑制和更新稀释等问题。RAPTOR通过交替共享和专家优化、采用专家特定裁剪和噪声,以及使用无隐私规则来选择免受路由熵影响的层来解决这些问题。在Switch Transformer和OLMoE等模型上的实验表明,与标准的DP基线相比,性能持续提升,尤其是在更严格的隐私预算下。
-
清华大学与英伟达的具身AI评估:Gemini领先,GPT落后
来自国立清华大学和英伟达的研究人员开发了一个名为VLM-AR3L的新框架,用于评估视觉语言模型(VLMs)在具身智能任务中的性能。在他们的研究中,Gemini 2.0在各种任务中表现强劲,而GPT-4.1则显示出局限性。该框架通过使用VLMs进行离线标注,并训练更小、更轻量级的网络以实现实时指导,从而解决了高API成本和延迟的挑战。VLM-AR3L结合了绝对奖励和相对奖励,为强化学习代理提供全局方向和细粒度进度评估。
-
SpecPrefetch框架改进了内存受限设备上MoE模型的推理性能
研究人员开发了SpecPrefetch,一个参数高效的框架,旨在提高稀疏专家混合(MoE)基础模型的推理速度。该方法通过在最终路由决策做出之前预测并异步传输必要的专家,从而解决了专家卸载造成的瓶颈。SpecPrefetch在不改变模型预训练路由的情况下,实现了更好的专家召回率并降低了延迟,证明了在Snapdragon 8 Elite等内存受限设备上部署MoE模型的实际优势。