International Conference on Computer Vision
PulseAugur coverage of International Conference on Computer Vision — every cluster mentioning International Conference on Computer Vision across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Nvidia推出准确率达92%的AI视频检测器 · 跟踪2个来源
Nvidia开发了一款名为合成视频检测器(SVD)的新工具,用于识别AI生成的视频。该微服务是Nvidia AI for Media Private Access Program的一部分,使用Meta的DINOv2和DINOv3视觉变换器分析视频帧。它在未压缩视频上的准确率高达92%,在压缩率为50%的视频上准确率可达82%,在Nvidia RTX GPU上的处理时间低至22毫秒。SVD旨在通过验证视频内容,帮助媒体机构和广播公司打击…
-
机器学习会议论文选拔流程详解
像NeurIPS和CVPR这样的顶级机器学习和计算机视觉会议的优秀论文选拔过程复杂且对审稿人来说并不完全透明。虽然审稿人会评估论文,但“最佳论文”、“口头报告”或“重点展示”的最终决定通常由副主席(ACs)、高级领域主席(SACs)或专门的奖项委员会做出。除了初步审稿分数外,新颖性、影响力以及委员会成员之间的讨论等因素在这些高级别的选拔中起着重要作用。
-
Sat2City v2 从卫星图像生成3D城市资产
研究人员推出了Sat2City v2,这是一个从单一卫星图像生成3D城市资产的先进框架。新版本通过调整一个预训练的3D基础模型以处理弱对齐的卫星图像和纹理网格,改进了其前代产品。Sat2City v2 使用了超过16,000个卫星-网格对的真实世界数据集,并专注于创建显式的纹理网格资产,而不仅仅是渲染代理,在几何和外观基准测试中取得了卓越的性能。
-
清华大学的空间-TTT 模型在空间智能基准测试中超越 Gemini
清华大学的研究人员开发了 Spatial-TTT,一个已入选 ECCV 2026 的开源空间智能模型。该模型擅长从长视频流中持续学习和更新其空间记忆,在多项基准测试中表现优于 Gemini 和 GPT-5 等模型。Spatial-TTT 采用了一种新颖的混合架构,具有用于动态记忆的快速权重、用于更好地理解几何关系的空间预测机制,以及用于构建全面 3D 环境理解的密集场景描述监督。
-
复旦大学团队推出STI-WM机器人世界模型
复旦大学团队发布了STI-WM,一个专为机器人设计的时空统一世界模型。该模型旨在通过整合基于物理的约束和端到端集成,克服当前视觉-语言-动作模型的局限性,从而实现更强大的真实世界机器人控制。模型背后的公司Moshine Intelligence已获得巨额融资,并正与行业领导者合作,将其技术应用于各种机器人场景。