Inception Labs
PulseAugur coverage of Inception Labs — every cluster mentioning Inception Labs across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
Inception Labs 发布 Mercury 2.5 扩散式大语言模型,号称在速度和成本上实现重大突破
Inception Labs 发布了 Mercury 2.5,这是一款基于扩散式语言模型,在速度和成本效率方面显著优于传统的自回归模型。与传统的逐个 token 生成不同,Mercury 2.5 并行优化输出,速度比典型的前沿模型快 5-20 倍,同时保持了可比的质量。这种速度优势已在 AI 电话代理和上下文压缩等领域得到实际应用,并有可能将大语言模型市场细分为专业化、高性价比的工具。
-
Inception Labs 发布 Mercury 2.5 扩散式大语言模型,智能提升 40%
Inception Labs 发布了 Mercury 2.5,这是一款新的扩散式大语言模型,其智能水平比前代 Mercury 2 提高了 40%。该模型在 NVIDIA GPU 上实现了每秒 1,107 个 token 的惊人速度,并支持 260K token 的上下文窗口。Mercury 2.5 定位为具有成本效益的替代方案,可与 GPT-5.6 Luna (Low) 和 Gemini 3.5 Flash-Lite 等模型相媲美,并…
-
Inception Labs 发布 Mercury 2.5 AI 模型
Inception Labs 发布了 Mercury 2.5,这是其 AI 模型的更新版本。该版本通过 Mastodon 和 Hacker News 等多个平台宣布,并附带相关博客文章重点介绍了新版本。
-
Inception Labs 发布 Mercury LLM 以提供编码辅助
Inception Labs 开发了 Mercury,这是一款专为编码任务设计的新型大型语言模型。该模型旨在协助开发人员的编码工作流程。
-
扩散式大语言模型Mercury 2在SDLC任务中表现不佳,尽管速度很快
最近的一项实验在Ship-Bench SDLC基准上评估了Inception Labs的基于扩散的LLM Mercury 2。尽管速度惊人且提供慷慨的免费套餐,Mercury 2在实施和验证任务方面却遇到了显著困难,在这些阶段得分很低。虽然该模型在上游文档阶段(如架构和规划)表现尚可,但产生的薄弱产物导致了下游失败,实施阶段破坏了核心用户流程。作者认为,像Mercury 2这样的扩散模型最适合速度敏感、低推理的任务,正如Incepti…
-
Inception Labs 的 Mercury 2 模型通过并行结晶实现每秒 1000 个 token 的速度 · 跟踪 3 个来源
Inception Labs 发布了 Mercury 2,这是一款能够以每秒超过 1000 个 token 的速度进行推理和生成文本的新型扩散模型。该模型通过使用并行结晶而非线性写入,实现了显著的速度提升,与传统模型相比,延迟降低了 82%。Mercury 2 在基准测试中也超越了 Google 的 DiffusionGemma,对传统的 LLM 架构提出了挑战。
-
Sakana Fugu 推出多智能体系统;Inception Labs 的 Mercury 2 提供速度
Sakana Fugu 发布了一个多智能体系统,该系统作为一个单一模型运行,能够为任务选择和协调专家模型。Inception Labs 的 Mercury 2 AI 模型使用扩散技术提供快速的 token 生成,针对速度敏感的工作流程进行了优化。此外,诺贝尔奖得主 John Jumper 将离开 DeepMind 前往 Anthropic,此举是在 DeepMind 在其编码工具商业化方面面临挑战之后发生的。
-
Google发布DiffusionGemma,文本生成速度提升4倍的模型
Google发布了DiffusionGemma,一个拥有260亿参数的新型MoE模型,它利用扩散模型进行文本生成,速度比传统的自回归模型快四倍。这种方法并行处理token,类似于图像生成,从而实现更快的推理和更低的内存需求,使其可以在4090 GPU等消费级硬件上本地执行。虽然DiffusionGemma在速度和双向注意力带来的自纠正能力方面表现出色,但目前在质量上落后于标准的Gemma模型,将其定位为面向速度敏感型应用的实验性模型。
-
Together AI 将批量推理 API 的速率限制提高了 3000 倍
Together AI 已显著升级其批量推理 API,引入了更用户友好的界面,并将模型兼容性扩展到包括所有无服务器和私有部署模型。此次更新将速率限制大幅提高了 3000 倍,从每位用户每个模型的 1000 万个排队令牌增加到 300 亿个,从而能够进行更大规模的数据处理。这些增强措施旨在使高吞吐量的工作负载更具成本效益和可访问性,对于大多数无服务器模型,成本通常是其实时 API 的 50%。