PulseAugur
实时 20:07:47
实体 DeepSeek-VL2-Tiny

DeepSeek-VL2-Tiny

PulseAugur coverage of DeepSeek-VL2-Tiny — every cluster mentioning DeepSeek-VL2-Tiny across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_245304 ·

    新的RAPTOR框架增强了MoE AI模型的私有训练

    研究人员开发了RAPTOR,一种用于专家混合(MoE)模型差分私有训练的新颖框架。现有方法将这些稀疏模型视为密集块,导致梯度抑制和更新稀释等问题。RAPTOR通过交替共享和专家优化、采用专家特定裁剪和噪声,以及使用无隐私规则来选择免受路由熵影响的层来解决这些问题。在Switch Transformer和OLMoE等模型上的实验表明,与标准的DP基线相比,性能持续提升,尤其是在更严格的隐私预算下。

  2. TOOL · CL_234159 ·

    清华大学与英伟达的具身AI评估:Gemini领先,GPT落后

    来自国立清华大学和英伟达的研究人员开发了一个名为VLM-AR3L的新框架,用于评估视觉语言模型(VLMs)在具身智能任务中的性能。在他们的研究中,Gemini 2.0在各种任务中表现强劲,而GPT-4.1则显示出局限性。该框架通过使用VLMs进行离线标注,并训练更小、更轻量级的网络以实现实时指导,从而解决了高API成本和延迟的挑战。VLM-AR3L结合了绝对奖励和相对奖励,为强化学习代理提供全局方向和细粒度进度评估。

  3. TOOL · CL_169581 ·

    SpecPrefetch框架改进了内存受限设备上MoE模型的推理性能

    研究人员开发了SpecPrefetch,一个参数高效的框架,旨在提高稀疏专家混合(MoE)基础模型的推理速度。该方法通过在最终路由决策做出之前预测并异步传输必要的专家,从而解决了专家卸载造成的瓶颈。SpecPrefetch在不改变模型预训练路由的情况下,实现了更好的专家召回率并降低了延迟,证明了在Snapdragon 8 Elite等内存受限设备上部署MoE模型的实际优势。