一项新的研究论文评估了大型视觉-语言模型(LVLMs)在自动驾驶系统中的二维目标检测能力,重点关注预期功能安全(SOTIF)条件。该研究使用了PeSOTIF数据集,将包括Gemini 3在内的十个LVLMs与YOLOv5和RT-DETRv4等专用检测器进行了比较。结果表明,在自然退化条件下,顶尖的LVLMs展现出更高的召回率和与专用检测器相当的性能,尽管在特定扰动下,后者的几何精度仍具有优势。 AI
影响 LVLMs通过提高目标检测召回率,显示出增强自动驾驶系统安全性的潜力。
排序理由 该集群包含一篇在特定基准上评估AI模型的论文。
- EfficientDet: Scalable and Efficient Object Detection
- Faster R-CNN
- Fast R-CNN
- Mask R-CNN
- R-CNN
- Region proposal networks for automated bounding box detection and text segmentation
- RetinaNet
- YOLO
- Gemini 3
- Large Vision-Language Models
- PeSOTIF
- RT-DETRv4
- Safety Of The Intended Functionality
- YOLOv5
- Zhao Yongqi
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →