PulseAugur
实时 09:54:46
English(EN) DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE 为多模态 LLM 实现无重放分布式调优

研究人员推出 DistMoE,这是一种新颖的混合专家方法,专为多模态大型语言模型(MLLM)的分布式视觉指令调优而设计。该方法通过客户端特定的专家来增强标准的馈送前向网络,以获取领域知识,而无需集中式数据访问。DistMoE 通过采用使用各向同性正则化损失的公共锚定专家组合阶段来解决不同专家表示尺度的问题,从而实现跨客户端的无重放组合。该系统允许在推理过程中对公共和私有专家进行模块化路由,从而在没有显式标签的情况下实现令牌级别的领域组合,并展示了灵活的专家重用和有效的领域适应性。 AI

影响 能够更高效、更私密地将多模态 LLM 适应到不同领域,而无需集中式数据。

排序理由 研究论文,详细介绍了一种新的分布式 LLM 调优方法。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

DistMoE 为多模态 LLM 实现无重放分布式调优

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Mainak Singha, Niccol\`o Biondi, Elisa Ricci, Subhankar Roy ·

    DistMoE:分布式指令调优的混合专家模型中无需私有数据预演的路由

    arXiv:2608.09907v1 Announce Type: new Abstract: Multimodal Large Language Models (MLLMs) have shown strong multimodal instruction-following ability, but adapting them to diverse visual-language domains typically assumes centralized data access and costly joint training. This is r…