华为在 IJCAI-ECAI 2026 上发表了四篇论文,将重点从扩大模型规模转向优化效率和设计。其中一篇论文详细介绍了一个分层 Vision Transformer (ViT),该模型扩展到 300 亿参数,通过重新设计架构和训练策略,以更少的激活参数实现了高精度。另一篇论文为视频大语言模型 (Video-LLMs) 引入了一个可学习帧选择器 (LFS),该选择器智能地选择关键帧以降低计算成本并提高视频描述准确性。第三篇论文提出 RaMod 框架,通过微调 token 表示而非整个模型来高效地使大语言模型适应各种任务,显著降低了延迟和内存使用。最后,一篇论文通过使用混合专家 (MoE) 方法来对齐不同语言的语义表示,解决了代码转换语音数据稀缺的问题。 AI
影响 这些在高效模型设计和数据利用方面的进步,可能显著降低部署各种应用中高级 AI 功能的成本,并提高其可访问性。
排序理由 该集群讨论了在顶级 AI 会议上发表的多篇研究论文,重点关注 AI 模型开发中的技术进步和新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →