ShanghaiTech University
PulseAugur coverage of ShanghaiTech University — every cluster mentioning ShanghaiTech University across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新研究利用因果模型和改进的评估方法解决视频异常检测问题
研究人员正在探索视频异常检测的新方法,重点是提高效率和准确性。一篇论文介绍了一种严格因果流异常检测器,该检测器使用类似Mamba的状态空间模型,每帧更新时间恒定,在边缘硬件上实现了高吞吐量,但准确性低于非因果基线。另一项研究批判性地审查了弱监督视频异常检测的评估指标,发现常用的帧级指标通常反映视频级排名,而不是精确的时间定位。第三篇论文研究了视觉语言模型(VLM)在无训练异常检测中的应用,并强调了如何将VLM输出转换为异常分数会显著影…
-
新的STEP框架改进了人体姿态视频异常检测
研究人员开发了一个名为STEP(基于分数的时序能量)的新框架,用于检测人体姿态视频中的异常。该方法通过使用主成分分析(PCA)将姿态序列投影到更易于管理的空间来解决现有方法中的一个关键挑战,从而防止在训练过程中生成物理上不可能的姿态。STEP还包含一个序列级加权机制,以考虑姿态估计中的不准确性,并实现实时效率。该框架在UBnormal数据集上表现出卓越的性能,并在ShanghaiTech基准测试中取得了有竞争力的结果。
-
3D高斯溅射技术向具身AI发展,兼具效率与适应性
研究人员正将3D高斯溅射(3DGS)从高质量渲染推进到具身AI和机器人领域的实际应用。CVPR 2026 上展示的最新研究专注于使3DGS在现实世界部署中更高效、更具适应性。创新包括用于快速场景生成的前馈网络,以及根据计算资源自适应控制高斯基元密度。
-
新方法利用SAM和强化点选择增强人群实例分割
研究人员开发了一种名为密集点到掩码优化(DPMO)的新方法,以改善密集人群场景下的实例分割。DPMO集成了Segment Anything Model(SAM)和最近邻排他圆(NNEC)约束,以从点标注生成详细掩码。此外,还引入了一个使用组相对策略优化(GRPO)训练的强化点选择(RPS)框架,以选择最准确的点预测用于实例分割。这些进展在多个群体计数数据集上取得了最先进的性能,证明了掩码标注在提高计数准确性方面的价值。
-
新的AI安全方法引入“先询问”选项
研究人员开发了一种名为Safety Sentry的新方法来提高AI代理的安全性。这种方法超越了简单的二元安全/不安全分类,引入了第三个选项:请求澄清。这使得AI代理在不确定时可以寻求人类输入,而不是做出潜在的风险决策或完全停止。
-
新框架SESAD通过结构化推理改进视频异常检测
研究人员开发了一个名为SESAD的新框架,用于弱监督视频异常检测。该方法将异常检测视为对剪辑级视觉证据进行结构化推理的过程,从而解决了准确识别异常事件的挑战。SESAD重新组织剪辑表示,以选择相关的语义信息,同时抑制与场景相关的干扰,从而提高检测稳定性。该框架还包含一个几何判别模块,以增强异常决策。在UBnormal、ShanghaiTech和UCF-Crime数据集上的实验证明了SESAD的有效性,在保持计算效率的同时实现了高AUC分数。
-
中国初创公司快粼光电为高速光探测芯片融资
上海快粼光电科技有限公司(Kuai Lin Optoelectronics)已获得数千万元人民币的天使轮融资,以加速其国产超高速光电探测芯片的大规模生产。该公司由上海科技大学的博士创立,专注于III-V族高速光电探测芯片,并在AI光互连和6G通信核心光芯片方面创造了世界纪录。本轮融资将用于研发、样品验证和扩大生产规模,以满足由AI计算集群和数据中心升级驱动的高带宽光互连日益增长的需求。
-
研究发现AI监控基准在现实世界测试中失败
一项对AI监控系统的新审计显示,基准性能指标(特别是AUC分数)无法转化为实际部署能力。研究人员发现,在某个数据集和场景上训练的模型,当应用于不同数据集和场景时,其表现不比随机猜测好,AUC分数从平均0.704显著下降到0.499。这表明当前的基准高估了AI在监控中异常检测的可靠性,而表现最强的模型反而加剧了这个问题。
-
VigilFormer框架通过高效注意力增强视频异常检测
研究人员开发了VigilFormer,一种用于视频异常检测的新型框架,可在准确性和实时处理之间取得平衡。该系统利用可变形时空编码器来高效地关注相关视频片段,并利用因果异常分类器在没有帧级标签的情况下区分异常。此外,自适应置信度调度器在推理过程中动态跳过非关键帧,以进一步优化性能。
-
计算机视觉转向3D世界建模,超越2D图像
研究人员正推动计算机视觉超越2D图像识别,走向对真实世界更深层次的理解。这包括建模3D结构、跨视图一致性、时间动态以及观测过程本身。CVPR 2026上发表的论文突显了在无需重新训练的情况下从多视图估计物体姿态、使用事件相机捕捉高速人体运动、通过解决遮挡问题从单张图像生成完整的3D场景,以及仅从相机轨迹数据推断视频内容等方面的进展。
-
新框架使用边界框轨迹进行视频异常检测
研究人员开发了 TrajVAD,一个利用边界框轨迹进行视频异常检测的新框架。该方法使用归一化流对正常的运动模式进行建模,性能优于现有的基于姿态的方法。一个结合了姿态信息的扩展版本进一步提高了在 ShanghaiTech 等关键数据集上的性能。
-
LLMs enhance video anomaly detection with reasoning and spatial grounding
研究人员开发了VANGUARD,一个将视频异常检测与多模态大型语言模型相结合的新框架。该系统不仅能识别异常,还能提供可解释的思维链推理和异常事件的精确空间定位。VANGUARD采用分阶段训练方法和师生标注流程,在UCF-Crime等基准测试中取得了优异的性能,并展示了跨领域泛化能力。
-
Action Hints 论文使用 LLM 进行基于骨骼的视频异常检测
研究人员开发了一个新的零样本视频异常检测(ZS-VAD)框架,该框架利用骨骼数据中的语义典型性和上下文独特性。该方法旨在通过从大型语言模型中提取关于正常和异常行为的知识来提高对新场景的泛化能力。该方法在多个数据集上取得了最先进的结果,而无需目标域训练数据。