Inception Labs
PulseAugur coverage of Inception Labs — every cluster mentioning Inception Labs across labs, papers, and developer communities, ranked by signal.
-
Inception Labs 的 Mercury 2 模型通过并行结晶实现每秒 1000 个 token 的速度 · 跟踪 3 个来源
Inception Labs 发布了 Mercury 2,这是一款能够以每秒超过 1000 个 token 的速度进行推理和生成文本的新型扩散模型。该模型通过使用并行结晶而非线性写入,实现了显著的速度提升,与传统模型相比,延迟降低了 82%。Mercury 2 在基准测试中也超越了 Google 的 DiffusionGemma,对传统的 LLM 架构提出了挑战。
-
Sakana Fugu 推出多智能体系统;Inception Labs 的 Mercury 2 提供速度
Sakana Fugu 发布了一个多智能体系统,该系统作为一个单一模型运行,能够为任务选择和协调专家模型。Inception Labs 的 Mercury 2 AI 模型使用扩散技术提供快速的 token 生成,针对速度敏感的工作流程进行了优化。此外,诺贝尔奖得主 John Jumper 将离开 DeepMind 前往 Anthropic,此举是在 DeepMind 在其编码工具商业化方面面临挑战之后发生的。
-
Google发布DiffusionGemma,文本生成速度提升4倍的模型
Google发布了DiffusionGemma,一个拥有260亿参数的新型MoE模型,它利用扩散模型进行文本生成,速度比传统的自回归模型快四倍。这种方法并行处理token,类似于图像生成,从而实现更快的推理和更低的内存需求,使其可以在4090 GPU等消费级硬件上本地执行。虽然DiffusionGemma在速度和双向注意力带来的自纠正能力方面表现出色,但目前在质量上落后于标准的Gemma模型,将其定位为面向速度敏感型应用的实验性模型。
-
Together AI 将批量推理 API 的速率限制提高了 3000 倍
Together AI 已显著升级其批量推理 API,引入了更用户友好的界面,并将模型兼容性扩展到包括所有无服务器和私有部署模型。此次更新将速率限制大幅提高了 3000 倍,从每位用户每个模型的 1000 万个排队令牌增加到 300 亿个,从而能够进行更大规模的数据处理。这些增强措施旨在使高吞吐量的工作负载更具成本效益和可访问性,对于大多数无服务器模型,成本通常是其实时 API 的 50%。