Test Time Training
PulseAugur coverage of Test Time Training — every cluster mentioning Test Time Training across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的TTSR框架通过自我反思增强LLM推理能力
研究人员推出了一种新颖的测试时训练框架TTSR,旨在增强大型语言模型(LLM)的推理能力。该自我演进系统遵循“先反思,后综合”的范式,模型在学生和教师角色之间交替。学生模型尝试解决问题并从其尝试中学习,而教师模型则分析失败并生成有针对性的变体问题以挑战学生的极限。TTSR还包含一个弱点记忆库,将持续存在的挑战汇编成策略笔记,指导未来的探索,并随着模型的改进而逐渐淡化。在数学推理基准上的实验表明,TTSR能够在测试时实现持续改进,并泛化…
-
新方法支持具有持久内存的实时动态新视角合成
研究人员开发了一种从流式视频进行在线新视角合成的新方法,解决了实时处理的挑战,同时保持长期记忆。所提出的技术将内存更新与逐帧应用分离,执行周期性更新以管理计算成本并防止不稳定。该方法利用跨视图注意力,并引入了辅助内存损失和内存缓存等机制,以确保保留历史上下文并将权重正则化以防止漂移,从而实现了最先进的实时性能。
-
PRISM模型在序列建模中实现174倍吞吐量
研究人员开发了PRISM,这是一种新颖的序列建模架构,旨在平衡Transformer的表达能力和线性模型的效率。PRISM通过将迭代过程重构为可并行化的形式,解决了Test-Time Training等迭代方法中存在的串行依赖问题。这通过写入-遗忘解耦策略和两阶段代理架构实现,与现有的优化方法相比,吞吐量显著提高。
-
视觉Transformer线性化,通过TTT实现更快的推理速度
研究人员开发了一种方法,将预训练的视觉Transformer模型转换为线性复杂度的测试时训练(TTT)架构。该方法对齐了架构和表示属性,允许从Softmax注意力模型高效地迁移权重。通过将此方法应用于Stable Diffusion 3.5,他们创建了SD3.5-T^5,该模型在经过少量微调后,实现了相当的图像质量和显著更快的推理速度。
-
研究发现测试时训练利用AI安全护栏
arXiv上的一篇新研究论文详细介绍了测试时训练(TTT)——一种允许AI模型在推理过程中进行适应的方法——如何被利用来绕过安全护栏。研究人员证明,攻击者可以利用TTT来显著提高攻击成功率,即使是在生产API上。该研究强调,TTT引入了一个新的攻击面,并且可能由于过拟合导致成功率膨胀,提出了一个面向有效性的评估和供应商端的检测器作为初步防御措施。
-
通过测试时训练实现视觉 Transformer 的线性化
研究人员开发了一种方法,使用测试时训练(TTT)将预训练的 Softmax 注意力模型适配到线性复杂度架构。该方法通过关注架构和表示的对齐来解决不同注意力机制之间的表示差距。该技术应用于 Stable Diffusion 3.5,产生了一个新模型 SD3.5-T$^5$,该模型在仅一小时的微调后,以显著更快的推理速度实现了可比的图像质量。