实体
Kaisi Guan
Kaisi Guan
PulseAugur coverage of Kaisi Guan — every cluster mentioning Kaisi Guan across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
苹果研究人员发布同步文本到视频音频生成新方法
研究人员开发了一个名为交叉引用重写器(CRR)的新框架,以改进文本到声音视频(T2SV)生成。这个双代理系统通过解耦视频和音频的字幕对,解决了视频和音频生成与文本提示对齐的挑战,从而减少了模态干扰。CRR旨在弥合详细训练字幕和简洁用户提示之间的差距,从而产生更同步、更具上下文相关性的视频和音频输出。
-
新框架通过解耦字幕增强文本到声音视频生成
研究人员开发了一个名为分层视觉基础字幕(HVGC)的新框架,以改进文本到声音视频的生成。该方法通过为每种模态生成独立的、解耦的字幕来解决视频和音频文本对齐的挑战,从而防止干扰。该框架与BridgeDiT集成,BridgeDiT是一个双塔扩散Transformer,使用双交叉注意力机制来确保音频和视频之间的语义和时间同步。