实体
Dedicated Model Inference
Dedicated Model Inference
PulseAugur coverage of Dedicated Model Inference — every cluster mentioning Dedicated Model Inference across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
时间线
- 2026-07-31 product_launch Together AI updated its Dedicated Model Inference service with a new resource allocation model. 来源
最近 · 第 1/1 页 · 共 2 条
-
NVIDIA 发布 Nemotron 3.5 Lightning 以实现高效的代理式 AI
NVIDIA 推出了 Nemotron 3.5 Lightning,这是一个拥有 300 亿参数的混合专家模型,专为高效的代理式 AI 工作负载而设计。与同等规模的模型相比,该模型提供了高达 4 倍的输出速度和 30% 的任务完成速度提升,并拥有 100 万个 token 的上下文窗口。随同该模型一起发布的还有 NeMo Switchyard,这是一个用于代理工具内智能路由的开源库,能够将请求定向到最合适的模型。Nemotron 3.…
-
Together AI 更新推理服务,实现动态资源分配
Together AI 更新了其专用模型推理服务,重点关注其底层的资源模型。该系统现在根据每个副本的可用容量而非固定百分比来分配请求。这种方法会自动调整部署份额,并确保只有准备就绪的副本才能获得资源,从而支持滚动更新和 A/B 测试等功能,以实现无缝的大规模推理。