epoch.ai
PulseAugur coverage of epoch.ai — every cluster mentioning epoch.ai across labs, papers, and developer communities, ranked by signal.
- developed MirrorCode 90%
- instance of AI chips 90%
- instance of MirrorCode 70%
- used by MirrorCode 70%
- competes with GPT-4 70%
- affiliated with Less Wrong 60%
- affiliated with GPT-5 60%
- affiliated with Kimi k3 50%
- competes with GPT-3.5 50%
- affiliated with Hacker News 50%
- invested by Andreessen Horowitz 50%
- affiliated with Redwood Research 50%
8 天有情绪数据
-
美国难以追踪 AI 芯片,走私者规避出口管制
由于全球化的供应链和多重中间商,美国政府在执行先进 AI 芯片出口管制方面面临挑战,导致大量芯片走私到中国等国家。战略与新兴技术中心 (CSET) 的一份报告调查了位置验证方法作为检测和阻止此类走私的潜在解决方案的可行性。虽然这些方法有前景,但其成本和对加强国家安全的影响仍然是关键问题。
-
Epoch AI:AI 模型性能成本年降 13 倍
Epoch AI 报告称,过去五年人工智能模型的性能成本显著下降。具体而言,每性能等级的成本平均每年下降约 13 倍。这种快速下降表明人工智能的开发和部署取得了实质性进展和效率提升。
-
LLM基准测试平均方法存在缺陷,偏袒测试次数少的模型
最近对LLM基准测试排行榜的分析揭示了平均方法论的缺陷,尤其是在模型在不同数量的基准测试上进行测试时。最初的方法是将归一化分数跨类别平均,无意中偏袒了在较少、较容易的基准测试中取得结果的模型,而不是那些在更具挑战性的评估中进行了广泛测试的模型。这导致了数据有限的模型优于结果全面的模型,凸显了需要更稳健的方法来准确评估LLM的能力。
-
分析发现最昂贵的AI模型并非最聪明 · 跟踪2个来源
一项近期对23个大语言模型的能力和API价格进行的比较分析显示,最昂贵的模型不一定是最聪明的。Epoch能力指数(ECI)被用来根据各种基准对模型进行评分,价格数据来源于截至2026年10月的API列表。研究发现,像Claude Opus 5.5和GPT-6 Astra这样的顶级模型虽然能力很强,但并非最具成本效益。像Claude Sonnet 5.5、Gemini 3.8 Flash和DeepSeek-V4 Flash这样更便宜但仍…
-
Anthropic的Claude AI现已主导公司26%的研发工作
Anthropic报告称,其AI模型Claude现已主导公司26%的AI研究和开发工作。这一比例较2月份的不到1%有了显著增长,表明AI辅助工作流程的转变正在加速。该公司将“主导”定义为Claude根据高级提示完成任务的大部分工作,并由人类监督,而非完全自主运行。Anthropic还提出了AI发展速度和监督的新衡量标准,旨在提高行业透明度。
-
Together AI 概述迁移到开源模型的策略
Together AI 的博客文章概述了从闭源迁移到开源 AI 模型的策略,强调此类迁移可以比传统迁移更快、更简单,尤其是在利用托管服务时。该过程涉及定义特定的用例和工作负载,以识别相关的基准和候选模型。关键评估标准不仅包括排行榜上的原始性能指标,还包括每项任务的成本、令牌使用量、运行时以及验证正确答案的能力。文章还强调了在沙盒环境中进行实际测试以评估模型行为和故障模式的重要性。
-
开放权重AI模型现已可与前沿模型相媲美,焦点转向部署基础设施
根据Epoch AI的数据,开放权重AI模型的格局已显著进步,顶级的开放模型在性能上已与前沿的闭源模型不相上下。这一发展表明,AI应用的主要瓶颈正从模型能力转向运行这些模型所需的有效基础设施和“驾驭”能力。通过优化模型部署和利用先进的编排工具,组织现在可以使用工作站级GPU等更易获得的硬件来实现生产级别的推理和编码能力。
-
通用人工智能(AGI)的到来被视为渐进式涌现,而非单一事件 · 跟踪1个来源
对59场播客对话的回顾显示,通用人工智能(AGI)的到来预计不会是一个单一事件,而是一种能力和对社会影响的渐进式涌现。专家和创始人就当前人工智能系统是否代表真正的智能还是复杂的模式匹配进行了辩论,一些人认为仅靠规模化不足以实现AGI。对话突显了时间线、数据的作用与根本性突破之间的紧张关系,以及人工智能加速科学发现的潜力,表明AGI将表现为一系列日益重要的信号,而非突然的突破。
-
提议建议将AI上下文窗口限制为500万个token,以减缓增长并实现监控
一项提议建议暂时实施一项法律强制性措施,将AI上下文窗口的最大值限制在500万个token。此举旨在减缓AI能力的发展,并确保AI生成外部记忆产物,如文件或聊天记录,以便监控其对齐问题。作者认为,上下文窗口长度是前沿大型语言模型的首要限制因素,并且限制它不会显著阻碍当前的发展,因为在过去两年中,上下文窗口已基本稳定在100万个token。
-
Epoch AI:Claude 在长上下文方面延迟低于 GPT
Epoch AI 对长上下文模型延迟进行了比较,揭示了 GPT 和 Claude 模型之间存在显著差异。研究结果表明,在处理大量上下文时,Claude 的响应时间通常比 GPT 更快。这一性能差异被认为是分析中的一个关键发现。
-
GPT-6 Astra攻克最后一道FrontierMath Tier 4数学难题 · 跟踪1个来源
GPT-6 Astra已成功解决了FrontierMath Tier 4基准测试中最后一道剩余的难题,该基准测试包含一系列旨在挑战先进AI模型的科研级数学问题。这一成就标志着一个重要的里程碑,因为该严格测试套件中的所有问题现在都至少被AI解决过一次。尽管Astra的直接得分是97.6%,但它在之前未解决问题上的突破意味着FrontierMath Tier 4基准测试现在被认为是饱和的,AI展示了先进的数学推理能力。
-
通过优化数据传输效率降低GPU计算租赁成本
本文讨论了优化GPU计算租赁中的数据传输效率,这是降低AI工作负载成本和提高性能的关键因素。文章强调,GPU计算通常按小时计费,数据加载瓶颈成为一项重大的隐藏成本。文章提出了三种优化策略:通过从传统的网络文件系统(NFS)迁移到NVMe-oF全闪存阵列来增强存储架构;利用RDMA等网络协议绕过CPU和操作系统开销;以及实施缓存分层,将频繁访问的数据移近GPU。
-
人工智能数据中心每10个月翻一番
自2024年中期以来,人工智能数据中心的规模正经历指数级增长,最大的数据中心的IT电力容量大约每10个月翻一番。这种快速扩张引发了对这一趋势可持续性的疑问。
-
AI漏洞发现将有利于防御,但预计过渡期充满挑战
AI模型在发现软件漏洞方面的能力日益增强,有可能将网络安全的天平推向防御方。虽然目前像Mythos Preview这样的AI工具在发现零日漏洞方面已展现出显著能力,但长期来看,预计将过渡到一个“密集采样模式”,届时防御者可以在攻击者之前识别出大多数漏洞。然而,这一转变预计将充满坎坷,由于补丁推出缓慢,预计在2026年和2027年将面临严峻挑战。
-
敦促美国考虑对中国的通用人工智能竞赛采取军事行动
一位前白宫官员建议美国考虑采取极端措施,包括军事打击,以阻止中国率先实现通用人工智能(AGI)。新美国安全中心(Centre for a New American Security)的 Jacob Stokes 建议美国机构应评估证明此类行动合理所需的情报,并将其与核武器相关的政策制定进行类比。他合著的报告探讨了外交、间谍、网络和军事选项,以维持美国在通用人工智能竞赛中的领先地位,并引用中国在具身智能方面的进展可能对美国目前在前沿人工…
-
LLM推理成本暴跌,但用户账单因使用量增加而飙升
尽管LLM推理价格大幅下降,但由于采用了更大的模型和始终在线的代理基础设施,许多用户的账单却在增加。虽然在MMLU等基准测试中,同等性能下每token的成本已暴跌高达280倍,但六个月内LLM API的总支出却翻了一番。这种差异的出现是因为每任务成本与每token成本不同,用户选择了更复杂和持续的AI操作。来自投资组合理论的“效率前沿”等概念正被应用于LLM推理,以帮助用户优化延迟和吞吐量之间的权衡,或识别真正推动效率曲线本身的技术。
-
AI 邮件列表获得旁白播客以提高可访问性
一项新服务正在为包括 Redwood Research、Epoch AI 和 Zvi 在内的多个专注于 AI 的邮件列表提供旁白播客。这些播客旨在提供这些组织的音频版本的研究和内容。这项举措通过音频格式使 AI 研究更加易于访问,迎合了对 AI 安全和进展感兴趣的更广泛受众。
-
AI 能力成本暴跌 1000 倍,但前沿模型仍昂贵
自 2021 年以来,实现特定 AI 能力的成本已大幅降低约 1000 倍,这主要归功于更小、更高效模型的开发。然而,在更长的时间跨度内,访问最尖端 AI 模型的价格仅降低了约 25 倍。这种区别意味着,虽然 AI 在许多任务中的可及性越来越高,但最先进的模型仍然相对昂贵,因为 AI 能力的前沿仍在不断推进。
-
OpenAI、Anthropic 主导 AI 算力增长,推动行业集中化 · 跟踪 1 个来源
Dylan Patel 在 Dwarkesh 播客上表示,OpenAI 和 Anthropic 已显著增加了其 AI 算力消耗,吸收了今年约 30% 的新增算力,并锁定了明年 40-50% 的供应。Patel 强调,这些领先实验室产生的高收入密度,可能达到每兆瓦 5000 万美元,而云计算时代仅为 1000-1500 万美元,这形成了一个强大的飞轮效应。这使得他们能够通过竞价战胜竞争对手获取算力资源,从而推动 AI 行业的集中化。尽管…
-
MaaS 单元经济学:折扣和延迟侵蚀净收入
模型即服务 (MaaS) 的真实成本并非由标价决定,而是由折扣和效率低下后的净收入决定,其中折扣链和存储延迟是关键因素。存储延迟,尤其是在长上下文推理中,会显著降低 GPU 利用率高达 30%,影响吞吐量并增加净成本。优化 MaaS 单元经济学需要将重点从简单地购买更便宜的 GPU 转移到最大化现有硬件的吞吐量,并考虑计算、存储和网络性能的相互作用。