RouterArena
PulseAugur coverage of RouterArena — every cluster mentioning RouterArena across labs, papers, and developer communities, ranked by signal.
-
OmnisRouter 因成本高昂而在基准测试中排名靠后,而非路由能力
OmnisRouter 的开发者分享了基准测试结果,该工具旨在将 LLM 请求路由到成本最有效的模型,但其排名接近底部。尽管测试设置存在初始错误,但修正后的 OmnisRouter 在 RouterArena 上达到了 72.7% 的准确率,每千次查询成本为 3.71 美元。与使用更便宜的开源模型的其他路由器相比,其高昂的成本使其排名第 16 位(共 18 个路由器)。
-
OmnisRouter 在基准测试中将 Claude Code 的成本减半 · 跟踪到 2 个来源
一个名为 OmnisRouter 的新 AI 路由系统在实际使用 Claude Code 时,成本显著降低了约一半。在 RouterArena 基准测试上的独立测试证实了这些节省。该系统旨在提高 AI 代理在修改代码和管理拉取请求等任务中的效率。
-
AI 编码代理成本:Opus 占主导地位,路由可节省 50%
对 AI 编码代理成本的分析显示,在 395 亿 token 的工作负载中,91% 由最昂贵的模型 Opus 处理,估计 API 成本接近 30,000 美元。然而,作者的个人工作负载由 Claude Max 订阅覆盖,实际支出大大减少。根据名为 OmnisBench 的配套基准测试,将请求路由到更便宜的模型(如果合适)有可能将这些成本降低 48-58%。
-
Lynkr LLM 路由器在学术基准测试中表现优于 GPT-5
Lynkr,一个 LLM 路由器,在 RouterArena 学术基准测试中进行了评估,该基准测试评估了各种指标的性能,包括准确性、成本和鲁棒性。结果将 Lynkr 置于 27 个路由器中的中游水平,但它在用作路由器时表现明显优于 GPT-5,以显著更低的成本获得了更高的 Arena 分数。Lynkr 还表现出强大的鲁棒性,即使在重新措辞查询时,其路由决策也保持稳定。
-
OrcaRouter系统智能路由LLM请求
研究人员开发了OrcaRouter,一个旨在智能地将传入请求路由到最合适的大型语言模型的系统。该路由器采用混合离线-在线学习方法,利用具有词汇和句子嵌入特征的上下文老虎机。在离线测试中,OrcaRouter达到了很高的准确率,并在RouterArena排行榜上名列第二,证明了其在生产环境中的效率和成本效益。
-
开源 A3M Router 在 RouterArena 基准测试中声称夺冠
一个名为 A3M Router 的开源项目在 RouterArena 基准测试中取得了第一名,这是开源模型首次获此殊荣。它还拥有所有评估过的 Router 中最低的成本,在准确性和价格方面均显著优于竞争对手。这种性能归功于其对多个 Provider 的并行处理以及基于置信度的响应评分,与其它 Router 使用的顺序选择方法相比,这是一种新颖的方法。