实体
OmnisBench
OmnisBench
PulseAugur coverage of OmnisBench — every cluster mentioning OmnisBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
AI 编码代理成本:Opus 占主导地位,路由可节省 50%
对 AI 编码代理成本的分析显示,在 395 亿 token 的工作负载中,91% 由最昂贵的模型 Opus 处理,估计 API 成本接近 30,000 美元。然而,作者的个人工作负载由 Claude Max 订阅覆盖,实际支出大大减少。根据名为 OmnisBench 的配套基准测试,将请求路由到更便宜的模型(如果合适)有可能将这些成本降低 48-58%。
-
AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难
一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。
-
开源LLM路由器提供透明、节省成本的模型选择
一个名为OmnisRouter的新型开源、自托管LLM路由器已被开发出来,旨在提供AI模型使用中的透明度和成本节约。这个代理工具集成了OpenAI、Anthropic和Gemini API,允许用户维护自己的提供商密钥。OmnisRouter会选择能够处理给定请求的最具成本效益的模型,并在每个响应中附带一张详细的收据,概述所选模型、其成本和置信度级别。路由决策由一个小型ONNX模型做出,该模型嵌入提示并将其映射到意图集群,确保昂贵的尖…