实体
PerceptionBench
PerceptionBench
PulseAugur coverage of PerceptionBench — every cluster mentioning PerceptionBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
GitHub 上增长最快的 AI 项目在近期报告中被重点介绍 · 跟踪了 10 个来源
几个开源 AI 项目正在获得显著的关注,这从它们的增长分数和在 GitHub 上不断增加的星标可以看出。这些项目涵盖了各种类别,包括腾讯的 WeMM-Embedding 等多模态嵌入模型,Human-Agent-Society/reef 和 useagenthq/useagent 等 AI 代理框架,以及用于图像生成和代码辅助等任务的专用工具。报告强调了对自托管知识平台和 AI 同事日益增长的兴趣,反映了对更易于访问和可定制的 AI …
-
新PerceptionBench揭示AI模型无法通过基础视觉感知测试
一项名为PerceptionBench的新基准测试显示,即使是顶尖的AI模型在基础视觉感知任务上也表现不佳,准确率未能达到60%。该基准由Moonshot AI开发,旨在测试多模态AI模型独立于逻辑推理能力解释图像的能力。结果表明,许多AI中所谓的推理错误可能实际上源于图像解释方面的根本问题。
-
Moonshot PerceptionBench 教程详解多模态模型评估
本教程概述了使用 Moonshot 的 PerceptionBench 评估多模态视觉模型的过程。指南详细介绍了环境设置、使用流式策略加载平衡数据集以及处理图像以进行分析。它还涵盖了构建支持多种后端(包括 OpenAI 的 API 和本地 Hugging Face 模型)的评估框架,并实现了基于规则和 LLM 辅助的评判机制。