RouterBench
PulseAugur coverage of RouterBench — every cluster mentioning RouterBench across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究评估了跨基准的开源 AI 模型路由器
一篇新发布的 arXiv 论文评估了四个开源模型路由器,这些系统在代理框架中负责模型选择。该研究引入了一个通用的测量协议,以在四个基准上比较这些路由器:RouterBench、BFCL v4、tau2-bench 和 WebArena。研究结果表明,三个被评估的路由器一致地将任务分配给相同的模型层级,而 vLLM Semantic Router 根据提示内容显示出更多变化,但在任何基准上均未达到最高的成功率。研究表明,观察到的性能提升…
-
WISERouter 框架在预算约束下优化 LLM 路由
研究人员推出了一种新颖的框架 WISERouter,旨在通过平衡性能和成本来优化大型语言模型 (LLM) 路由。该系统解决了当前方法的一些局限性,例如可能不严格遵守预算约束的启发式方法,以及收集密集监督学习数据集的高昂成本。WISERouter 将 LLM 路由构建为一个受约束的上下文多臂老虎机问题,能够从历史数据中进行离线学习和通过探索进行在线学习,并在实证测试中展示了卓越的性能和预算遵守能力。
-
开源工具以更低成本和更高效率优化 AI 模型
Experiential Labs 发布了一款名为 World Model Optimizer (wmo) 的开源工具,旨在降低部署 AI 模型的成本。该工具优化代理轨迹以创建更小、更高效的模型,并可以在前沿模型和更小的模型之间路由请求,以在较低成本下保持质量。它支持各种优化策略,包括模型蒸馏、部署单个模型以及为代理构建优化的工具链,并提供本地或云托管执行选项。
-
新指标评估语言模型路由策略的有效性
研究人员开发了一个新的框架来评估语言模型路由策略,重点关注行为差异化和稳定性,而不仅仅是任务准确性。他们提出采用分层社会熵(HSE)来衡量代理多样性,并使用基于扰动的指标来衡量鲁棒性。将这些方法应用于 EmbedLLM 和 RouterBench,他们发现一小部分代理就可以捕捉到大部分可用多样性,并且虽然 KNN 路由器可以提高专家社会的准确性,但它们缺乏鲁棒性,这一点与提示路由不同。
-
新算法利用用户重试来优化 LLM 路由和调度
研究人员开发了一种名为 ACQB(anytime CQB)的新算法,以改进大型语言模型(LLM)的查询路由和调度。该算法利用用户重试行为的隐式反馈,而非显式评分,来学习用户偏好并优化 LLM 分配。ACQB 旨在保持队列稳定性并减少对话式 LLM 服务中的累积遗憾,在合成数据、离线数据集和真实用户日志的实验中显示出有希望的结果。