GPQA Diamond
PulseAugur coverage of GPQA Diamond — every cluster mentioning GPQA Diamond across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新框架审计供应商托管的LLM API的质量下降问题
研究人员开发了Ventor-QTest,一个新颖的黑盒审计框架,用于验证供应商托管的大型语言模型(LLM)的推理API质量。该方法采用重复请求和长序列探测来分别测量平均保真度损失(AFL)和极端保真度损失(EFL)。研究结果表明,虽然AFL与基于logprob的指标相关性良好,但显著的EFL与长时序代理任务的性能下降有关,这表明EFL对于审计此类应用的重要性。
-
研究发现:自洽性损害小型LLM在硬科学问题上的表现
一篇新的arXiv论文揭示,常见的自洽性技术(涉及对多个模型输出进行平均)实际上会降低小型大型语言模型(LLM)在挑战性科学问题上的准确性。对于Qwen2.5-7B和Llama-3-8B等模型,在思维链上进行多数投票比使用单一推理通道导致了更低的问题特定准确性。研究表明,对于这些模型在困难的科学推理任务上,置信度分数与正确性并不可靠地相关。
-
大型语言模型提示工程:研究表明,具体性胜过礼貌性
提示工程的最佳实践正在不断发展,新研究表明,礼貌和角色设定等元素并不能可靠地提高大型语言模型的性能。沃顿商学院的研究和 EMNLP 2024 的发现表明,虽然关于输出格式和约束的具体指令会显著影响结果,但包含“魔法词”或详细的角色描述通常会增加噪音而非价值。OpenAI 和 Anthropic 等公司也在改进其指导方针,强调提示的简洁性和直接性,以获得更好、更可预测的结果。
-
Google DeepMind 的 DiffusionGemma 通过离散扩散实现每秒 1500 个 token
Google DeepMind 发布了 DiffusionGemma,这是一个开放权重的语言模型,它利用离散扩散进行文本生成,与传统的自回归模型相比,输出速度显著更快。虽然 DiffusionGemma 在单个 NVIDIA H100 上可以实现大约每秒 1500 个输出 token,但在能力基准测试上的得分低于其自回归对应模型 Gemma 4。这种在服务速度方面的创新对于需要低延迟和高吞吐量的代理系统尤其有益,预示着未来混合模型或智…
-
新的Metanym Game基准测试评估LLM的结构智能
研究人员推出了一种新颖的基准测试Metanym Game,旨在评估大型语言模型(LLM)的结构智能。该游戏作为一个自包含、自一致的系统运行,LLM通过创建和评价彼此的词语类比来进行竞争。提出了一种使用奇异值分解的独特谱解法,用于同时评估LLM的事实准确性和判断能力,而无需依赖预定义的数据集。该基准测试的设计旨在抵抗训练数据污染,并且其代码和数据是公开可用的。
-
阿里云发布Qwen3.8,提升编程和办公AI能力 · 追踪2个来源
阿里云正式发布了其新的旗舰大型语言模型Qwen3.8,总参数量达到2.4万亿。该先进模型在编程和专业办公任务方面表现出显著的改进,跻身全球顶级大型模型之列。支持视觉理解和100万token上下文长度的Qwen3.8-Max,以及Qwen3.8-27B模型,将于下周开源发布。新模型提供了增强的推理能力、更快的推理速度以及具有竞争力的API服务定价。
-
DeepSeek V4 闪电版在 MMLU-Pro、GPQA Diamond 上表现强劲
DeepSeek V4 发布了新的“闪电”版本,据报道在 MMLU-Pro、GPQA Diamond 和 TruthfulQA 等基准测试中取得了令人印象深刻的分数。该模型因其在同等规模模型中的强劲表现而受到关注,DeepSeek 团队因此次更新而受到祝贺。
-
Thinking Machines 发布 Inkling-Small,性能超越更大模型
Thinking Machines Lab 推出了 Inkling-Small,这是一款新的开源多模态模型,它优先考虑效率而非单纯的规模。尽管比其前身 Inkling 体积小得多,Inkling-Small 在各种编码和推理基准测试中表现出卓越的性能。该模型设计用于更轻松的部署,能够在一台 GPU 上运行,并根据 Apache 2.0 许可证提供。
-
Darwin AI 模型家族通过进化融合在 GPQA Diamond 上达到 90.9%
Darwin AI 模型家族通过融合现有的开源模型,而非传统的预训练,在 GPQA Diamond 基准测试中取得了 90.9% 的分数。这种方法结合了 Gemma-4 和 Qwen-3.5 等模型,对于小型团队来说,计算效率显著提高。虽然 Darwin 在此特定基准测试中的表现名列前茅,但其能力受到其父模型限制,并且其广泛采用主要得益于 Hugging Face 等平台上的社区创建的副本。
-
韩国初创公司Darwin-398B-JGOS模型在GPQA Diamond上全球排名第三
一家名为VIDRAFT的韩国初创公司开发了一个名为Darwin-398B-JGOS的语言模型,该模型在GPQA Diamond基准测试中位列韩国模型之首。据报道,该模型在约24个GPU上训练,在全球基准测试中获得第三名,超过了包括DeepSeek V4-Pro和NVIDIA的Nemotron 3 Ultra在内的多个知名模型。Darwin-398B-JGOS通过对开放模型进行进化融合而创建,强调方法而非大规模训练,并在旨在抵抗简单网络…
-
2026 LLM基准测试:没有赢家,专业化领导者涌现 · 跟踪1个来源
对2026年20个领先LLM的全面基准测试显示,没有单一的占主导地位的模型,而是出现了跨不同任务的专业化领导者。Claude Opus 5在整体人工智能分析智能指数中领先,而特定模型在编码、代理工具使用、推理和价值方面表现出色。报告强调了成本效益日益增长的重要性,中国的开放权重模型以一小部分价格提供了具有竞争力的性能。它还提醒读者注意基准测试的素养,指出经典的评估已饱和,需要在一致的条件和工具使用下比较模型。
-
韩国初创公司 VIDRAFT 凭借 24 个 GPU 实现 AI 突破
韩国初创公司 VIDRAFT 使用约 24 个 GPU 的适度配置取得了显著成果,挑战了科技巨头大规模运营的主导地位。该公司的 Darwin 模型在韩国 AI 排行榜上名列前茅,并在 GPQA Diamond 和 Polaris 药物发现基准测试等基准测试中表现出色。据报道,VIDRAFT 还开发了一种结合 Transformer 和 Mamba 组件的新型跨架构模型合并,在 IBM 量子计算机上进行了密码分析演示,并发布了一个名为 …
-
新诊断工具评估LLM测试时协作的有效性
研究人员开发了一个新的诊断框架,用于评估大型语言模型(LLM)测试时协作技术的有效性。该框架称为“固定池诊断”(Fixed-Pool Diagnostic),将自洽性(self-consistency)和批评模型(critic models)等方法的收益分解为可衡量的因素,例如可恢复质量(recoverable mass)和信号保真度(signal fidelity)。研究发现,收益通常受“Oracle Gap”和验证器判决与真实标签…
-
新定律量化LLM集成多样性提升 · 跟踪2个来源
研究人员制定了一项正式定律,用于量化使用多样化的大型语言模型(LLM)集成所获得的性能提升。该定律将集成提升分解为“挽救”和“损害”两个组成部分,并提供了一种基于准确率调整的正确率相关性($\phi_{\mathrm{adj}}$)等指标来预测性能的启发式方法。所提出的启发式方法在十个开源模型和多个基准测试的超过767,000次推理中进行了测试,显示出强大的预测能力,并能有效地迁移到未见过的数据集。
-
Mira Murati 的 Thinking Machines 发布开源 Inkling 模型
由前 OpenAI 高管 Mira Murati 联合创立的 Thinking Machines 发布了其首个模型 Inkling。与许多前沿模型不同,Inkling 的目标并非在排行榜上名列前茅,在 SWE-bench 和 GPQA Diamond 等基准测试中的得分低于 Claude Fable-5 等模型。这个拥有 9750 亿参数的多模态模型是特意设计用于微调的,并已根据宽松的 Apache 2.0 许可证发布,允许用户自由地…
-
Moonshot AI 发布 Kimi K3,拥有 1M 上下文、开源权重和有竞争力的价格
Moonshot AI 发布了 Kimi K3,这是一个拥有约 2.8 万亿参数和 100 万 token 上下文窗口的开源权重模型。该模型在 Terminal-Bench 2.0、FrontierSWE 和 GPQA Diamond 等基准测试中取得了强劲的性能。值得注意的是,在 Arena 文本任务盲测中,Kimi K3 的排名高于 Claude 3 Opus,并在前端编码能力方面领先,超越了所有美国前沿模型。此次发布还具有每百万…
-
VIDRAFT 推出双 LLM 服务引擎,兼顾 GPU 吞吐量和 CPU 覆盖范围
VIDRAFT 开发了两款不同的语言大模型服务引擎,分别针对不同的优化目标。VKAE 是一款内核级加速引擎,旨在最大化 GPU 上的吞吐量,在多请求场景下性能提升高达 23.4 倍,速度超过 10,000 tokens/秒。相比之下,VKUE 通过优化内存带宽而非原始计算能力,使得一个 34.7B 参数的模型能够在包括 CPU 在内的各种硬件上运行,适用于受监管或本地部署的工作负载。
-
Unisound U2:266B模型以低成本实现高基准分数
以语音AI闻名的中国公司Unisound发布了名为Unisound U2的2660亿参数大语言模型。该模型在GPQA Diamond基准测试中取得了87.9%的分数,该测试旨在抵御典型的AI方法。值得注意的是,Unisound U2的定价为每百万输入token 0.15美元,每百万输出token 0.30美元,以显著的低成本提供了先进的推理能力。
-
Tencent and VIDRAFT showcase sparse MoE models with reduced active parameters
Tencent has released Hy3, a 295-billion-parameter Mixture-of-Experts (MoE) model that utilizes only 21 billion active parameters per forward pass, significantly reducing inference costs. This MoE architecture, featuring…
-
研究发现:大型语言模型(LLM)的一致性是准确性的弱代理指标
一篇新的arXiv论文研究了使用大型语言模型(LLM)之间的一致性作为正确性代理指标的可靠性。该研究涉及53个不同的LLM运行者和265,000个样本,发现虽然一致性可以作为准确性的弱正向预测指标,但它并非独立的置信度分数。研究强调,模型可能因为共享的偏见或记忆的启发式方法而达成一致,而非事实准确性,特别是指出前沿模型表现出过度自信且存在重复性错误。研究结果表明,自我一致性是正确性的条件性指标,最好用于分配计算资源,而不是作为准确性的…