研究人员开发了一种新方法,以提高大型语言模型(LLMs)根据自然语言描述生成符号图形程序(SGPs),特别是可缩放矢量图形(SVGs)的能力。该方法利用具有可验证奖励的强化学习,并包含一个用于可渲染SVG的格式有效性门控以及一个利用SigLIP和DINO等视觉编码器将文本与渲染图像对齐的跨模态奖励机制。将此技术应用于Qwen-2.5-7B模型,显著提高了SVG生成质量和语义准确性,使其性能与领先的专有系统相当。该研究还引入了SGP-GenBench,一个用于评估LLM在SVG生成任务上表现的基准,涵盖对象和场景保真度以及组合性。 AI
影响 增强了LLM在跨模态对齐和精确视觉内容生成方面的能力。
排序理由 该集群包含一篇学术论文,详细介绍了LLM程序合成的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- Dino
- Haoquan Zhang
- large-language models
- Qwen 2.5 7B
- SGP-GenBench
- SigLIP
- SVG
- Symbolic Graphics Programs
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →