DeepSeek V4-Pro
PulseAugur coverage of DeepSeek V4-Pro — every cluster mentioning DeepSeek V4-Pro across labs, papers, and developer communities, ranked by signal.
- instance of DeepSeek-V4 Flash 90%
- used by Claude (Opus 4.8) 90%
- used by DeepSeek-V4 Flash 90%
- developed by DeepSeek Chat 90%
- developed by Fireworks AI 90%
- affiliated with deepseek-reasoner 90%
- uses DeepClaude 90%
- used by Ascend 910C 90%
- used by Tencent 90%
- uses Nexotao 90%
- used by Huawei Ascend 90%
- competes with GPT-5.5 Pro 80%
- 2026-08-18 product_launch DeepSeek V4 Pro API prices increased significantly, particularly for cache hit inputs. 来源
- 2026-08-16 product_launch DeepSeek launched its V4-Pro model with enhanced agent capabilities and a significant price increase. 来源
- 2026-08-13 product_launch DeepSeek has launched its V4-Pro model and open-sourced its agent software Harness v0.1. 来源
- 2026-08-13 product_launch DeepSeek V4-Pro and Grok 4.6 models were identified, marking new releases in the LLM space. 来源
- 2026-08-13 product_launch DeepSeek is launching its V4 lineup of AI models and updating API pricing. 来源
- 2026-08-13 regulatory DeepSeek V4 Pro's input price increased by 86%. 来源
- 2026-08-13 product_launch DeepSeek has officially released the DeepSeek-V4-Pro model. 来源
- 2026-08-13 product_launch DeepSeek officially released its V4 Pro model on August 12, 2026, featuring significant improvements in agentic coding benchmarks. 来源
- 2026-08-12 product_launch DeepSeek launched its V4-Pro-0813 model with a one-million-token context window and agent-developer tooling. 来源
- 2026-08-03 research_milestone DeepSeek V4-Pro achieved a reported 80.6% on the SWE-bench Verified benchmark, positioning it among top closed-source models. 来源
- 2026-07-20 product_launch DeepSeek V4 Pro has been released, showing competitive performance. 来源
- 2026-06-19 product_launch Together AI has released the DeepSeek V4 Pro, an open-source model featuring a novel KV cache architecture. 来源
- 2026-06-08 research_milestone DeepSeek V4 Pro has reportedly achieved superior precision scores compared to GPT-5.5 Pro. 来源
- 2026-06-06 product_launch DeepSeek V4 Pro API is made available with significant cost savings and features for businesses, particularly in Russia. 来源
- 2026-06-05 research_milestone A research group claims to have successfully completed full-parameter post-training on DeepSeek's 1.6 trillion parameter V4-Pro model using Huawei Ascend chips. 来源
29 天有情绪数据
-
Parallel Search Fast 推出,降低 AI 代理搜索成本
Parallel Search Fast 是一款专为成本效益和速度而设计的新型网络搜索引擎,尤其适用于 AI 代理。它以每 1000 次查询 1 美元的价格提供搜索结果,平均延迟为 700 毫秒。该服务声称比 Brave、Exa Fast 和 Tavily Basic 等竞争对手便宜 2.2 倍至 2.8 倍,旨在通过降低搜索成本使 AI 代理更具经济可行性。
-
Fable 5 在 NanoGPT 速度运行基准测试中领先 AI 模型
一项名为“NanoGPT Speedrun Frontier”的最新基准测试,评估了 18 种不同的前沿 AI 模型在使用 NanoGPT 优化器时的性能。该研究进行了 153 次自主运行,根据模型在设定资源预算内的最佳验证结果进行比较。Fable 5 表现最佳,完成了 81.7%,其次是 Claude Code (Opus) 和 Kimi K3。
-
Qwen Lab 发布 Qwen 3.8 27B,性能超越竞争对手
Qwen Lab 发布了 Qwen 3.8 27B,这是一款新推出的超大规模语言模型,其性能显著优于其前代产品以及 Mimo V2.5 Pro 和 DeepSeek V4 Pro 等其他开源模型。用户报告称,Qwen 3.8 27B 在处理复杂提示方面表现更好,甚至能准确渲染出地球仪等细节,而之前的模型在这方面表现不佳。开发者希望 Qwen Lab 能发布研究成果,帮助其他实验室创建类似的高质量、小型模型。
-
Unsloth Dynamic V3 在 8GB RAM 上将 Qwen3.8-27B 的准确率提高 10%
Unsloth 发布了 Dynamic V3,一种新的量化技术,可在不增加文件大小的情况下提高模型准确率。这项进展使 Qwen3.8-27B 等模型在保持相同大小的情况下准确率提高 10%,甚至使 1 位版本能够以低至 8GB 的 RAM 运行。该技术通过改进校准数据集、优化压缩层选择以及利用训练后量化来实现。这一发展对于本地 AI 运动具有重要意义,使大型模型在消费级硬件上更易于访问,并挑战了模型压缩必然导致质量下降的观念。
-
大语言模型的数学原理非专业人士解读
本文将像ChatGPT这样的大语言模型(LLM)背后的数学概念进行分解,使其对非技术受众来说易于理解。文章解释了LLM、Transformer和Attention等基本术语,并深入探讨了四个关键数学领域:线性代数用于将单词表示为数字,概率用于预测下一个单词,微积分用于通过梯度下降进行模型学习,以及信息论用于衡量不确定性。文章还阐明了三个关键方程:Softmax用于将分数转换为概率,Attention用于关注相关单词,以及梯度下降用于迭代模型改进。
-
RayNeo 发布轻量级 AI 眼镜,配备主动式助手
RayNeo 推出了其新款 iO 系列 AI 眼镜,该系列眼镜设计轻巧舒适,适合全天佩戴,外观与传统眼镜相似。该眼镜配备了“全天候主动式 AI”助手,能够学习用户习惯并提供情境感知的信息和建议。iO 系列支持多种大型语言模型,并通过硬件绑定的指示灯和强大的数据加密来强调隐私保护。
-
中国人工智能模型在用量上占据主导地位,为美国战略制造“死亡地带”
在中国OpenRouter平台上,中国人工智能模型的用量已超过美国同行,占据了超过60%的流量。尽管美国实验室在最前沿能力方面仍保持领先,但中国模型提供了显著更低的成本和更高的效率,因此被用于高用量生产工作负载。这种分化为那些既非最前沿也无成本效益的人工智能战略制造了一个“死亡地带”,可能导致美国公司尽管拥有技术领先优势,却在市场份额和开发者兴趣方面遭受损失。
-
新的 GulliBench 基准测试按“易受骗性”对 AI 模型进行排名
一个名为 GulliBench 的新基准测试旨在衡量 AI 模型的“易受骗性”。在此基准测试中表现最佳(表明最易受骗的模型)的模型包括 Opus 5 和 Fable 5。Muse Spark、Gemini 3.1 Pro 和 Kimi K3 等其他模型也表现出不同程度的易受骗性。
-
Dromeas LLM 委员会在复杂 PR 审查中优于 Claude 代码审查
对两个 AI 代码审查工具 Claude Code 的超审 (ultrareview) 和 Dromeas 代码审查 (Dromeas Code Review) 的比较发现,它们的能力存在显著差异。在对 openclaw/openclaw 存储库中一个大型、独立批准的拉取请求 (pull request) 进行测试时,超审仅发现了一个微小且无关的问题。相比之下,Dromeas 的 LLM 委员会(由三个不同的模型组成)标记了 17 项…
-
AI 模型协助定制智能手表表盘开发
一位软件工程师使用包括 Claude、Kimi K3、K2.6 以及 DeepSeek V4 Pro & Flash 在内的各种 AI 模型,为一款 27 美元的 Pine Time 智能手表开发了定制表盘。该过程涉及利用手表开源固件和模拟器,工程师通过迭代 AI 生成的代码来实现所需的设计。该项目最终形成了一个功能原型,代码已在 GitHub 上公开。
-
开发者发现付费大模型质量不相上下,评判模型结果存在偏见
一位开发者进行了一项基准测试,比较了 Llama、GPT、DeepSeek 和两个 Claude 模型五种语言模型,重点关注每查询成本、速度和答案质量。初步结果显示,付费模型之间的质量得分差异很小,表明成本和速度应是主要的决策因素。然而,在仔细检查后,开发者发现质量得分没有统计学意义,并且用于评分的评判模型是参赛者之一,这可能导致结果存在偏见。使用付费评判模型重新评分后发现,所有付费模型均获得满分,表明质量并非它们之间的区别因素。
-
Kimi K3 访问成本对比:OpenRouter 最便宜,Moonshot/DeepInfra 适合缓存命中
对四个访问 Kimi K3 大语言模型的平台进行的比较显示,根据使用模式的不同,价格差异显著。OpenRouter 以每百万 token 2.60 美元/13 美元的价格成为最便宜的 API 选择,而 Moonshot AI 的直接 API 和 DeepInfra 为缓存命中提供了更低的价格,成本降低了 90%,降至每百万 token 约 0.30 美元。Ollama Cloud 采用 GPU 时间计费模式,每 token 成本不透明…
-
采用智能体协同的研究方法,开源AI模型的研究成果可媲美顶级闭源模型
Prime Intellect 的一项新研究表明,利用小型、廉价的开源模型构建的多智能体协同系统,在研究成果上可以媲美顶级闭源模型。通过自动化诸如 nanoGPT 优化等任务中的假设生成、实验和分析过程,这种方法显著降低了 AI 驱动研究的成本和时间。研究结果表明,AI 研究基础设施的效率,而不仅仅是单个模型的原始智能,可能是加速 AI 发展的关键。
-
DeepSeek V4 Pro 发布,模型迭代迅速;强调成本效益
DeepSeek 发布了其 V4 Pro 模型,这是一个万亿规模的混合专家(MoE)模型,专为高级推理、编码和代理任务而设计。此次发布正值各大 AI 实验室迅速推出新模型之际,这促使作者质疑不断追逐最新前沿模型的必要性。作者认为,对于许多常见工作负载,如编码和代理任务,像 Gemini 3.7 Flash 这样“足够好”且更具成本效益的模型,甚至更小的开源模型,已经足够,并且可以节省大量的集成和重新评估成本。
-
AI工具J-Space被揭穿;大小模型之争加剧
一个名为J-Space Cognition Suite的近期AI项目声称通过外部工具显著提升了DeepSeek V4 Flash和V4 Pro等小型AI模型的性能,但该项目已被揭穿。GitHub用户GoForceX的独立测试显示,J-Space实际上降低了性能并增加了token消耗,与其项目声称相悖。此事件重新点燃了关于小型模型结合工具是否能真正媲美顶级大型语言模型的争论,AI先驱Jason Wei对此提出质疑,认为真正的智能在于模型…
-
Meta 的 Muse Video 泄露,Replit 提供免费 GPT-5.6 Luna,AI 监管辩论
Meta 的 Muse Video 模型已在封闭测试中揭晓,展示了其生成具有强大时间一致性和细节的 10 秒视频的能力,包括原生音频。与此同时,Replit 推出了免费模式,允许用户在日常任务中利用 OpenAI 的 GPT-5.6 Luna 模型而无需消耗积分,从而提高生产力。此外,文章还讨论了 AI 监管策略、AI 代理在基准测试中作弊的可能性,以及优化 DeepSeek-V4-Pro 等大型 AI 模型服务的方法。
-
Mistral 发布自托管 3B 审核模型 Shieldstral 1.0
Mistral 发布了 Shieldstral 1.0,这是一款拥有 30 亿参数、专为自托管文本和图像内容审核设计的模型。该模型在 Apache 2.0 许可下提供,并包含完整权重,可在单块 16GB GPU 上运行,并可与常见的推理栈集成。其主要特点是“策略自适应”审核,允许用户通过自然语言提示定义审核规则,而无需重新训练。尽管 Mistral 报告了强劲的基准分数,但这些分数尚未得到独立验证,且该模型专注于审核而非通用任务。
-
AI周报:GPT-5.6、DeepSeek V4 Pro和Meta Glimmer亮点速递
本文回顾了多项重大的AI更新,重点介绍了十二项被认为特别有影响力的进展。讨论的进展包括GPT-5.6和DeepSeek V4 Pro等新模型版本,以及Grok Bots和Meta的Glimmer等创新。回顾还涉及了Google的Gemini、Microsoft的Copilot、OpenAI的ChatGPT以及Meta的Llama 3等主要参与者的更新,以及Claude Chrome和Perplexity等特定应用。
-
Anthropic 披露内部 "Model 2" 并提高 AI 错位风险级别
Anthropic 于 2026 年 8 月 14 日发布的第二份风险报告披露了一个内部未发布的模型,代号为 "Model 2"。据报道,该模型在内部基准测试中优于其最新的旗舰模型 Mythos 5,尽管 Anthropic 指出其能力并未实现显著飞跃。该报告还标志着 Anthropic 首次调整其 "因错位造成的灾难性危害" 风险级别,将其从 "非常低" 调整为 "低",表明对 AI 可能违背人类意图的担忧加剧。
-
人工智能在高等数学领域取得进展,引发了辩论和新的研究方向
生成式AI在执行高等数学任务方面的能力日益增强,引发了关于其对该领域影响的讨论。一项关于基于证明的数学课程的试点研究发现,学生使用了AI工具,但对其有用性和准确性的看法不一。此外,AI模型在黎曼猜想等长期存在的数学问题上取得了进展,Anthropic的Claude通过提高临界线上零点的下界展示了显著的进步。这一发展引发了对数学研究未来以及人类数学家角色的疑问。