实体
GPT-5 Pro
GPT-5 Pro
PulseAugur coverage of GPT-5 Pro — every cluster mentioning GPT-5 Pro across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新基准揭示了高级人工智能数学证明评估中的偏见和推理差距
引入了一个名为 QEDBench 的新基准,用于评估大学数学证明自动评估中的对齐差距。该基准显示,包括 Claude Opus 4.5、DeepSeek-V3、Qwen 2.5 Max 和 Llama 4 Maverick 在内的几个人工智能大型语言模型在其评分中表现出积极偏见。此外,研究强调了 GPT-5 Pro 和 Claude Sonnet 4.5 等模型在离散数学领域性能显著下降,尽管 Gemini 3.0 Pro 取得了最先进的成果。
-
LLMCostCalc工具比较Claude、GPT-5、Gemini API成本
一款新的基于浏览器的工具LLMCostCalc,旨在帮助用户比较各种大型语言模型的API成本。它允许用户输入每日调用量和提示大小,以估算Claude Haiku、Sonnet和Opus,以及GPT-5 mini、Pro和基础GPT-5,以及Gemini 2.5 Flash和Pro等模型的月度账单。该计算器突出了显著的成本差异,一种场景显示,对于相同的工作负载,最便宜和最昂贵的选项之间的价差为230倍,并且还模拟了上下文缓存的节省,…
-
OpenAI的GPT-5 Pro模型在AI问题解决方面处于领先地位
Ethan Mollick指出,自去年夏天以来,OpenAI的GPT-5 Pro模型在单次尝试解决最具挑战性问题方面一直保持领先地位。他观察到在此期间该领域缺乏显著的竞争。