PulseAugur
实时 14:29:01
English(EN) Talaria: Session-Aware Serverless Serving of Hundred-Billion-Parameter LLMs

Talaria系统将大语言模型推理时间最多缩短5.3倍

研究人员开发了Talaria,一个新颖的无服务器系统,旨在高效地为拥有数百亿参数的大语言模型(LLMs)提供服务。该系统解决了工具使用型智能体(agents)的会话连续性挑战,这些智能体在短间隔内反复与大语言模型交互并维护长上下文前缀。Talaria优化了放置和准入决策以维持会话连续性,与传统的基于轮次的调度器相比,显著缩短了会话完成时间。 AI

影响 优化了大语言模型推理基础设施,可能为复杂智能体任务实现更高效的大模型部署。

排序理由 该集群描述了一篇关于为大语言模型提供服务的新颖系统的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Talaria系统将大语言模型推理时间最多缩短5.3倍

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Utopia Meng, Unicornt Zhao, Derek Li, Goalen Gao, Frank Du ·

    Talaria:百亿参数大语言模型的会话感知无服务器服务

    arXiv:2607.17181v1 Announce Type: cross Abstract: Serverless multi-model LLM systems multiplex popularity-skewed model catalogs over shared GPU pools, yet typically schedule each request independently. Tool-using agents break this abstraction: a session repeatedly calls an LLM ac…