Grok 4
PulseAugur coverage of Grok 4 — every cluster mentioning Grok 4 across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Grok-4 降价,Qwen、小米、Z-AI 发布新模型
2026年9月29日当周的大语言模型定价摘要报告称,Grok-4 的价格大幅下调,目前输入令牌价格为 2 美元/百万,输出令牌价格为 6 美元/百万,使其能够与中端模型竞争。此外,Qwen、小米和 Z-AI 推出了十五款新模型。Qwen 发布了五个变体,包括其 27B 模型的免费套餐,而小米推出了三个 MiMo 变体,Z-AI 推出了七款 GLM-5.3 模型,支持用于离线处理的批量端点。这些进展表明 API 路由市场上的可用模型数量…
-
Grok 4、GPT 和 Claude 在实际应用中的比较
本文比较了 Grok 4、GPT 和 Claude 的能力,重点介绍了它们在处理实时数据、成本和特定用例方面的差异。文章指出,虽然这三者都是强大的通用模型,但它们的优势在于不同的领域,因此选择取决于用户特定的工作需求。
-
国产开源模型ZDTaichu5.0-9B引领空间AI
一款新的开源多模态大模型ZDTaichu5.0-9B已发布,在空间具身和通用智能方面展现出领先能力。该模型在九项国际空间理解基准测试中取得了顶尖性能,在需要复杂空间判断和行动规划的任务中表现出色。尽管其参数量相对较小(90亿),ZDTaichu5.0-9B在文本理解、OCR、数学推理和编码方面也保持了强劲性能,使其在该类别中跻身全球顶尖模型之列。
-
新指标解决跨裁判的 LLM 模仿模糊性问题
一位正在开发 LLM 安全网关 SemGuard 的研究人员在评估模仿威胁时遇到了显著的裁判间分歧。为了解决这个问题,开发了一个名为模仿模糊性指数 (IAI) 的新指标。该指标将模仿分解为四个不同的轴:目标真实性、欺骗意图、同意/上下文限制和下游可操作性,从而可以独立评分。
-
网络罪犯通过 Kriminal.ai 武器化 Grok 和 Claude AI 模型
网络罪犯正通过一个名为 Kriminal.ai 的服务利用 Grok 和 Claude 等前沿人工智能模型,该服务按月收费提供无安全防护的访问。该平台通过剥离合法 AI 模型的安全功能来武器化它们,从而能够进行网络钓鱼邮件、恶意软件脚本和社会工程内容生成等恶意活动。尽管声称拥有定制模型,Kriminal.ai 主要使用 xAI 的 Grok 和 Anthropic 的 Claude,这凸显了人们对强大 AI 系统安全防护不足及其被滥用的担忧。
-
大语言模型在不存在的工具上进行测试:上下文比模型选择更关键
一项实验通过询问一个名为AuriKey的不存在的工具,测试了五个当前一代的大语言模型——Claude Opus 4.7、Claude Sonnet 4.6、GPT-5、Gemini 2.5 Pro和Grok 4。在没有提供上下文的情况下,所有模型都出现了幻觉,其中Grok 4产生了最具体但完全虚构的细节,而Claude模型提供了更诚实但不太具体的回答。当提供一份关于AuriKey的简短虚构文档作为上下文时,最初观察到的显著性能差距急剧…
-
DeepSeek V4 Pro 和 Grok 4.6 模型出现,定价趋于稳定 · 跟踪到 1 个来源
两款新的大型语言模型 DeepSeek V4 Pro 和 Grok 4.6 已被识别,于 8 月 13 日出现。DeepSeek V4 Pro 被定位为其 V3 系列的升级版,预计定价具有竞争力,但具体的基准测试和上下文窗口细节仍有待公布。Grok 4.6 是 Grok 4 的渐进式更新,可能为现有用户提供细微的功能增强或调整费率限制。
-
新方法使用演绎推理改进LLM叙事转变
研究人员开发了一种新颖的神经符号方法,用于指导大型语言模型(LLM)在文本中执行叙事转变。该方法利用演绎推理和社会科学理论来提取规则,使LLM能够在保留核心信息的同时转换故事。实验表明,包括GPT-4o、Llama-4、Grok-4和DeepSeek-R1在内的各种模型在叙事转换准确性方面取得了显著改进,优于零样本基线。
-
Grok 4 训练可能受到未检测到的硬件错误影响
最近的一项分析表明,像 Grok 4 这样的先进人工智能模型的训练可能会受到未检测到的硬件错误的影响。作者认为,巨大的计算资源,特别是 Grok 4 所需的 2.46 亿小时 H100 计算时间,可能会引入细微的数学不准确性。这些潜在的错误发生在少数领先人工智能实验室使用的专用硬件中,引发了对前沿模型训练的可靠性和可验证性的担忧。
-
稀疏自编码器为LLM数据和行为提供可解释的洞察 · 追踪4个来源
研究人员正在探索使用稀疏自编码器(SAE)作为一种更具成本效益且可解释的方法来分析大规模文本语料库和理解大型语言模型的内部工作原理。这些SAE可以识别数据集之间的语义差异,揭示意想不到的概念相关性,并为基于属性的检索提供可控的嵌入。研究已将SAE应用于分析模型行为,例如比较Grok-4与其他前沿模型在歧义澄清能力上的差异,调查OpenAI模型行为随时间的变化,以及检查Whisper编码器的内部表示以揭示语言信息的层次结构。
-
开发者修正 agentproof-scan 文档,扩展功能
agentproof-scan 的开发者发布了 0.2.0 版本,该版本修正了项目文档与其实际功能之间的差异。先前版本 0.1.4 声称的覆盖范围比实际交付的更广,而该项目旨在检测到这一缺陷。新版本更新了该软件包,使其与文档中记录的功能保持一致,包括扩展的检测家族集和推理扫描模块的添加。此次更新还阐明了三个不同的指标:检测家族、端到端诱导和推理攻击探测,并强调这些数字衡量的是扫描仪性能的不同方面。
-
泄露的API密钥给LLM用户带来双重财务威胁
一位安全工具开发者发现了一个关键漏洞,泄露的API密钥可能导致两种不同的财务债务:即时发票费用和被盗用日志的长期成本。尽管用户采取了预防措施,但仍发生了涉及重大财务损失和数据删除的事件,Google等供应商以及各种编码代理提供商在实施全面修复方面进展缓慢。该开发者的工具agentproof-scan旨在识别这些风险,并指出LLM凭证泄露事件已大幅激增,而当前的前沿模型尚不足以防止此类问题。
-
SpaceXAI 发布 Grok 4.5,挑战 Anthropic 的 Opus 级模型
SpaceXAI 发布了 Grok 4.5,这是一款直接挑战 Anthropic 顶级产品的“Opus 级”模型。新模型具有增强的代理工具,用于网络搜索、X/Twitter 集成和代码执行,并声称与前代产品相比,令牌效率更高,延迟更低。虽然内部基准测试表明其性能可与 Claude Opus 4.5 相媲美,但独立评估仍在进行中。此次发布加剧了 AI 模型竞争,SpaceXAI 强调实际代理能力是关键的差异化因素。
-
AI模型在足球预测准确性方面接受测试
一项近期实验比较了六款热门AI模型——ChatGPT (GPT-5.5)、Claude Sonnet 4.6、Grok 4、Gemini 3.5 Flash、Kimi K2.6 Instant和DeepSeek——预测FIFA世界杯淘汰赛的能力。模型收到的提示相同,包括要求给出确切比分、置信度和理由。虽然大多数AI都能正确识别热门球队,并为简单的比赛提供合理的比分预测,但当面对不正确或不存在的赛程时,它们的表现各不相同,突显了它们在事…
-
Microsoft Foundry 的模型路由器增加了对 GPT-5.5 的支持,但成本很高
Microsoft Foundry 的模型路由器现在支持 GPT-5.5,允许用户根据任务复杂性和成本动态选择 AI 模型。该路由器提供三种模式:平衡、成本和质量,每种模式在模型性能和费用之间都有不同的权衡。然而,作者发现 GPT-5.5 对于开发任务来说价格过高,几小时的使用成本就超过了 1,000 新台币,而模型路由器本身就增加了总成本的 10% 以上。
-
AI预测受益于模型多样性,而非仅仅是准确性
一篇新的arXiv论文探讨了如何通过集成多样化的模型来改进AI预测系统,而不是仅仅依赖最准确的模型。研究人员发现,结合具有互补性错误的模型(如Grok 4)的预测,可以提高在Metaculus AI Benchmark的二元问题上的准确性。这表明,同时优化模型质量和多样性是加强AI预测群体的关键。
-
通过结合多样化、相关性较低的预测来改进AI预测模型
一项关于AI预测系统的最新研究表明,结合多样化的模型(而不仅仅是准确的模型)可以显著提高预测的准确性。研究人员发现,许多前沿的LLM产生的预测高度相关,这降低了集成相似模型的价值。研究强调,像Grok 4这样提供相关性较低预测的模型,对集成能力的提升贡献尤为突出。这表明,同时优化模型质量和多样性是增强AI预测能力的关键。
-
AI模型难以修复代码泄露;狭窄的提示可提高成功率
最近的一项实验测试了使用AI模型修复代码泄露(如API密钥)的有效性。研究发现,成功率因所使用的AI模型和提示方法而异。一些模型未能完全删除泄露的信息,要么将其注释掉,要么在解释中重新打印,要么在内部推理跟踪中保留它。然而,具体、狭窄的提示,明确指示AI删除秘密、使用环境变量,并避免在任何输出或推理跟踪中重现该值,在所有测试的模型中都证明是有效的。
-
美国政府因安全担忧限制 Anthropic 的 Fable 5 模型
Anthropic 的新 Fable 5 模型因其先进的推理和协作能力而受到赞誉,但已被美国政府根据出口管制指令暂停向外国国民提供访问权限,原因是国家安全担忧。Anthropic 对政府的评估提出异议,认为已识别出的安全漏洞很小,并且其他模型也能发现,该指令是基于误解。这种情况凸显了人工智能开发商的安全协议与政府监管之间更广泛的紧张关系,可能对未来模型的发布和国际合作产生影响。
-
新的DNR-Bench显示顶级LLM通过率为0%
一项名为DNR-Bench的新基准测试已被推出,用于评估大型语言模型避免响应特定提示的能力。在包括GPT-5.1、Claude Opus 4.8、Gemini 3 Pro和Grok 4在内的几款领先模型中,该基准测试报告的通过率为0.0%,表明在面对测试提示时,没有一款被测试的模型成功地避免生成任何输出。该基准测试的方法和代码可在GitHub上获取。