Decision Transformer
PulseAugur coverage of Decision Transformer — every cluster mentioning Decision Transformer across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Decision Transformer优化无人机-RIS辅助D2D通信
研究人员开发了一种Decision Transformer模型,用于优化由无人机(UAV)挂载的智能反射面(RIS)辅助的动态设备到设备(D2D)通信。该方法解决了涉及无人机轨迹、姿态和RIS相位调整的复杂优化问题,以在各种约束条件下最大化平均总速率。该模型在不同场景下表现出强大的泛化能力,在零样本迁移方面优于传统的深度强化学习方法,并以更少的交互实现了有竞争力的结果。
-
新的诊断方法可审计推荐系统控制旋钮
研究人员开发了一种新的诊断方法,用于审计使用Decision Transformer的推荐系统中“返回条件”的有效性。该方法测试了返回到目标(RTG)令牌的变化如何影响预测结果,区分了应用于整个历史上下文的干预措施与仅应用于当前令牌的干预措施。在MovieLens 25M上的实验表明,修改整个上下文显著改变了犯罪预测,而仅改变当前令牌的影响很小。然而,在MyAnimeList 2020上进行的类似测试并未产生可辨别的戏剧响应,这表明奖…
-
新的生成式自动竞价方法提高了广告效果和效率
两篇新的研究论文 QGA 和 PRO-Bid 介绍了电子商务广告中生成式自动竞价的先进方法。QGA 利用带有决策 Transformer 主干的 Q 值正则化,来优化策略模仿和行动价值最大化,在实际测试中使广告 GMV 提高了 3.27%,广告 ROI 提高了 2.49%。PRO-Bid 通过采用约束解耦帕累托表示和反事实遗憾优化,解决了精确资源配速和优化效率方面的挑战,在实验中展示了卓越的约束满足和价值获取能力。
-
新框架TAF通过处理不匹配数据改进决策序列学习
研究人员开发了一个名为目标对齐融合(TAF)的新框架,用于改进在使用与目标环境不完全匹配的外部数据进行决策序列学习时的性能。TAF通过根据源数据的目标域结构和可行性一致性进行过滤和重新加权来解决动态变化问题。该方法以TAF-DT的形式实现,使用最大均值差异和最优传输等方法来选择和加权数据片段,最终在控制任务中带来更好的性能和更稳定的序列语义。
-
新的HOBA框架通过分层强化学习增强在线广告竞价
研究人员开发了HOBA,一个旨在改进在线广告竞价系统的新型分层强化学习框架。该系统在不同时间尺度上分离了战略推理、模型选择和出价执行,使用大型语言模型进行超参数推断,并使用SARSA代理进行专家模型选择。在AuctionNet基准测试和大规模A/B测试中的实验表明,HOBA的性能优于现有方法,在实际部署中目标成本提高了3.6%。
-
新的SOV-CAD框架通过分步视觉反馈重建CAD序列
研究人员开发了SOV-CAD,一个用于从图像重建计算机辅助设计(CAD)建模序列的新框架。与一次性生成整个序列的先前方法不同,SOV-CAD通过使用分步视觉反馈来模仿人类设计工作流程。该系统观察目标模型及其逐步构建状态的正交投影,以做出明智的决策,并采用带有强化学习的决策Transformer架构。实验表明,与现有的最先进方法相比,SOV-CAD在准确性和数据效率方面均优于现有方法。
-
新的GLAN框架增强了个性化着陆页推荐
研究人员开发了GLAN,一个新颖的序列建模框架,旨在改进在线平台上的个性化着陆页推荐。GLAN通过捕捉跨日用户动态和分解会话级反馈以实现更精确的局部监督,解决了先前强化学习方法的局限性。在快手平台上的在线实验表明,GLAN在日活跃用户和用户生命周期方面取得了显著的改进。
-
OnDeFog 增强了在丢帧环境下的强化学习性能
研究人员推出 OnDeFog,这是强化学习领域的一项进展,旨在处理丢帧问题。丢帧是由于通信延迟或传感器故障而在实际应用中普遍存在的问题。该新方法将 DeFog 的丢帧缓解技术与在线决策Transformer (ODT) 的在线学习能力相结合。实验结果表明,在丢帧率高的环境中,OnDeFog 的性能优于 ODT;在处理包含大量低回报数据的的数据集时,其性能也优于 DeFog。
-
SlimDT论文提出在顺序建模外注入RTG
研究人员开发了SlimDT,这是Decision Transformer (DT)模型在离线强化学习中的一种改进。SlimDT将Return-to-Go (RTG)令牌从自回归序列中移除,而是直接将其信息注入状态表示中。这种方法将序列长度减少了三分之一,从而提高了推理效率和计算收益。在D4RL基准测试上的实验表明,SlimDT的性能优于标准DT,并达到了与最先进方法相当的性能。
-
QHyer模型通过自适应历史压缩增强离线目标条件强化学习
研究人员开发了QHyer,一种用于离线目标条件强化学习的新方法,解决了部分可观察和历史依赖数据集带来的挑战。QHyer利用Q估计器指导策略拼接,并采用混合注意力-Mamba骨干进行自适应历史压缩。实验表明,QHyer在非马尔可夫和马尔可夫数据集上均取得了最先进的性能。
-
Gemma 4 31B权重通过精细的可训练接口展示跨模态迁移
研究人员已经证明,来自Gemma 4 31B文本预训练模型的冻结权重可以有效地跨不同模态进行重用,包括机器人和联想回忆任务。通过采用一个精细的、可训练的接口,这些未修改的权重在机器人操作基准测试中取得了最先进的结果,并在强化学习中与Decision Transformer的性能相匹配,而可训练参数却显著减少。该研究还确定了对文本任务和跨模态应用都至关重要的特定Transformer头,这表明模型内部存在更深层次的计算重用机制。