一篇新研究论文提出了一种协作分布式推理系统,该系统结合了专用基础设施和用户贡献的资源,以提高 AI 服务的可伸缩性和效率。该方法旨在通过利用志愿资源来补充基线容量来管理不断增长的需求,从而减少集中式基础设施成比例增长的需要。该系统使用生成式马尔可夫模型进行任务调度和 QoS 感知资源分配,在请求完成率和延迟方面表现出显著的改进,同时降低了专用资源消耗,尤其是在用户数量增加时。 AI
影响 这项研究可能带来更高效、更具可伸缩性的 AI 推理服务基础设施,从而有可能降低成本并提高性能。
排序理由 该集群包含一篇发表在 arXiv 上的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →