MLCommons
PulseAugur coverage of MLCommons — every cluster mentioning MLCommons across labs, papers, and developer communities, ranked by signal.
-
AI基准测试工具:自定义构建与现有解决方案的探索
一个专注于AI硬件和模型性能的博客作者调查了他们的自定义基准测试工具是否必要,或者是否可以使用现有解决方案。他们发现,像Linus Tech Tips和Gamers Nexus这样的硬件评测网站虽然开发了复杂的框架,但这些框架主要设计用于GPU和游戏工作负载,而非LLM。同样,像MLPerf Client和Procyon这样的厂商无关AI基准测试套件受限于固定的模型列表,并且不支持多轮代理任务。尽管存在像llama-bench和lla…
-
Amazon Nova 2 Lite 使用新提示词进行内容审核
Amazon 详细介绍了其 Nova 2 Lite 模型如何有效地通过提示词进行内容审核任务。一份新的技术报告和博客文章解释了如何采用结构化、以分类法为驱动的提示词,并与 MLCommons AILuminate 标准保持一致,从而取得最先进的成果。这种方法使 Nova 2 Lite 在内容审核方面优于更大的 AI 模型。
-
OpenSSF 启动 AI/ML 安全工作组
开源安全基金会 (OpenSSF) 已启动一个专注于 AI/ML 与安全交叉领域的工作组。该工作组旨在探讨与大型语言模型 (LLM) 和生成式 AI (GenAI) 等 AI 技术相关的安全风险,特别是它们对开源项目和社区的影响。它还将研究如何利用 AI 来增强其他开源计划的安全性,解决数据投毒、提示注入和对抗性攻击等问题。
-
MLC 支持在浏览器、iPhone 和 AMD 显卡上运行大型模型
由卡内基梅隆大学(CMU)的 Tianqi Chen 领导的机器学习编译(MLC)小组正在开发 MLC Chat 和 Web LLM 等框架,以支持在包括 iPhone 和网页浏览器在内的消费级硬件上运行大型语言模型。该计划旨在通过允许模型在配备 AMD 显卡甚至仅 CPU 的设备上本地运行,来缓解当前的 GPU 短缺问题。Hugging Face 的 text-to-webapp 生成器和 Gradio 等项目也在为开发者和最终用户…