PulseAugur
实时 10:29:35
English(EN) User-Assisted Collaborative Distributed Inference for Efficient QoS-Aware Autoscaling

新研究提出用于 AI 自动伸缩的用户辅助分布式推理

一篇新研究论文提出了一种协作分布式推理系统,该系统结合了专用基础设施和用户贡献的资源,以提高 AI 服务的可伸缩性和效率。该方法旨在通过利用志愿资源来补充基线容量来管理不断增长的需求,从而减少集中式基础设施成比例增长的需要。该系统使用生成式马尔可夫模型进行任务调度和 QoS 感知资源分配,在请求完成率和延迟方面表现出显著的改进,同时降低了专用资源消耗,尤其是在用户数量增加时。 AI

影响 这项研究可能带来更高效、更具可伸缩性的 AI 推理服务基础设施,从而有可能降低成本并提高性能。

排序理由 该集群包含一篇发表在 arXiv 上的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新研究提出用于 AI 自动伸缩的用户辅助分布式推理

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Alfreds Lapkovskis, Ali Beikmohammadi, Sindri Magn\'usson, Praveen Kumar Donta ·

    用户辅助协作分布式推理,实现高效的 QoS 感知自动扩缩容

    arXiv:2608.11840v1 Announce Type: cross Abstract: Growing demand for artificial intelligence (AI) inference services requires scalable infrastructure, yet centralized serving costs rise with demand. We propose a collaborative distributed inference system combining dedicated infra…