LM Arena
PulseAugur coverage of LM Arena — every cluster mentioning LM Arena across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
DesignArena 融资 790 万美元用于 AI 品味反馈工具 · 跟踪 2 个来源
人工智能反馈工具 DesignArena 的母公司 Intelligence 已获得 790 万美元的种子轮融资。该平台允许用户对 AI 生成的输出进行排名,为 AI 模型开发提供宝贵的人类反馈。DesignArena 目前在全球拥有 530 万用户,年经常性收入达 6000 万美元,是 AI 公司获取人类主导的评估数据的关键来源。
-
新的CSPF方法改进了不可验证任务的评估
研究人员开发了一种名为约束共享-私有融合(CSPF)的新方法,以应对可靠评估不可验证任务的挑战。CSPF整合了来自多个冻结奖励模型的隐藏状态表示,将它们视为互补的评估者。该方法将专家信号分解为共享和私有组件,以在保留独特观点的同时对其进行对齐。在LM-Arena和PPE评估上的实验表明,CSPF的性能优于现有基线,表明融合隐藏状态表示为偏好评估提供了一种更具表现力和实用性的方法。
-
LM Arena 缩减了对新开源 LLM 的收录
LM Arena,一个用于比较开源大型语言模型的平台,似乎正在减少对新发布的开源模型的收录。用户注意到该平台不再展示许多近期的开源模型,包括 Qwen3.6 系列和 Step 3.7 Flash 等重要模型。这一变化引发了关于该平台是否已将重点从全面覆盖开源 LLM 格局转移的猜测。
-
Boogu 发布开源统一图像生成模型
Boogu-Image-0.1-Turbo 是 Boogu 团队发布的开源统一图像生成和编辑模型。它提供了高质量的文本到图像生成、快速生成、图像编辑和双语文本渲染等功能,尽管与闭源系统相比,其训练数据规模要小得多。该团队还开发了 Boogu Arena,一个用于评估图像生成模型的平台,并强调 Boogu-Image 是一个研究项目,没有任何官方付费服务。
-
阿里巴巴发布 Qwen3.7-Plus 多模态智能体模型
阿里巴巴的 Qwen 团队发布了 Qwen3.7-Plus,这是一款除了文本之外,还能理解图像和视频的多模态大语言模型。该新模型增强了视觉能力,并保留了深度推理、自编程、工具调用和自主迭代等智能体功能。Qwen3.7-Plus 可通过阿里云的“百炼”平台获取,标志着阿里巴巴在具身智能领域为实际应用迈出了重要一步。
-
阿里巴巴预览 Qwen 3.7 Max 和 Qwen 3 Ultra 模型
阿里巴巴发布了其 Qwen 3.7 Max 模型的预览版,该模型已出现在 LM Arena 排行榜上。此次发布与 Qwen 3 Ultra 模型的预览版同时进行,表明阿里巴巴正在同时开发两个大型、拥有 720 亿参数的模型。预计该公司将在不久的将来全面发布这些模型。
-
Goblin Mode,24小时后
AI模型,特别是GPT-5.5,表现出一种被称为“Goblin Mode”的奇特行为,其特点是对与哥布林相关的图像和语言表现出异常的关注。这一现象在AI Twitter上引起了关注,用户们进行了实验并分享了观察结果。虽然一些人猜测这是RLHF训练的产物,或者是对编码提示的古怪回应,但在受控条件下直接复制该行为的尝试结果好坏参半,表明它可能不像最初认为的那样容易引发。