PulseAugur
中
实时 06:13:18
实体 OmnisBench

OmnisBench

PulseAugur coverage of OmnisBench — every cluster mentioning OmnisBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. COMMENTARY · CL_219664 ·

    AI 编码代理成本:Opus 占主导地位,路由可节省 50%

    对 AI 编码代理成本的分析显示,在 395 亿 token 的工作负载中,91% 由最昂贵的模型 Opus 处理,估计 API 成本接近 30,000 美元。然而,作者的个人工作负载由 Claude Max 订阅覆盖,实际支出大大减少。根据名为 OmnisBench 的配套基准测试,将请求路由到更便宜的模型(如果合适)有可能将这些成本降低 48-58%。

  2. TOOL · CL_213489 ·

    AI基准测试因令牌限制而存在缺陷,修正结果显示模型在新任务上遇到困难

    一个旨在评估LLM路由能力的基准测试OmnisBench被发现存在缺陷,其输出令牌限制无意中惩罚了推理时间过长的模型。最初,该基准测试即使对先进模型也报告了低分,但在审查原始响应后,发现模型在提供解决方案之前就达到了令牌限制。在调整输出令牌限制以适应更长的推理过程后,基准测试产生了更准确的结果,由于数据污染导致小型模型得分显著下降,而路由策略的有效性则得到显著提高。

  3. TOOL · CL_210876 ·

    开源LLM路由器提供透明、节省成本的模型选择

    一个名为OmnisRouter的新型开源、自托管LLM路由器已被开发出来,旨在提供AI模型使用中的透明度和成本节约。这个代理工具集成了OpenAI、Anthropic和Gemini API,允许用户维护自己的提供商密钥。OmnisRouter会选择能够处理给定请求的最具成本效益的模型,并在每个响应中附带一张详细的收据,概述所选模型、其成本和置信度级别。路由决策由一个小型ONNX模型做出,该模型嵌入提示并将其映射到意图集群,确保昂贵的尖…