实体
SFT-RL
SFT-RL
PulseAugur coverage of SFT-RL — every cluster mentioning SFT-RL across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新AI方法提升模型在变化环境中的鲁棒性
研究人员开发了新的无监督域适应(UDA)方法,以提高AI模型在动态环境中的鲁棒性。一种方法SFT+RL,使用监督微调和强化学习以及CLIP的视觉编码器,以提高在基准数据集上的准确性和对抗鲁棒性。另一种方法DIRA-SS,提供了一种使用未标记目标域样本的在线域适应的自监督扩展,在操作过程中无需分类标签即可适应分类器。
-
InnerZoom框架在单次前向传播中实现SOTA GUI基础定位 · 跟踪3个来源
研究人员开发了InnerZoom,一个新颖的框架,用于在单次前向传播中实现准确高效的GUI基础定位。该方法通过在解码器层之间保留目标区域感知来解决现有多模态大语言模型(MLLM)方法的局限性,这对于GUI交互中精确坐标的生成至关重要。InnerZoom在多个基准测试中取得了最先进的性能,在提高精度的同时降低了计算成本和延迟。
-
BoxCtrl框架实现精确3D几何图像编辑
研究人员推出BoxCtrl,一个用于精确3D几何图像编辑的新颖框架。该方法利用具有不同RGB颜色的3D边界框作为视觉提示投影到2D图像上,从而能够精确控制平移、缩放和旋转。BoxCtrl采用两阶段训练过程,首先在合成数据上进行监督微调,然后使用不成对的真实世界数据进行强化学习,以弥合领域差距。实验表明,BoxCtrl在各种几何编辑任务中取得了最先进的结果。