研究人员开发了一个新的框架来评估语言模型路由策略,重点关注行为差异化和稳定性,而不仅仅是任务准确性。他们提出采用分层社会熵(HSE)来衡量代理多样性,并使用基于扰动的指标来衡量鲁棒性。将这些方法应用于 EmbedLLM 和 RouterBench,他们发现一小部分代理就可以捕捉到大部分可用多样性,并且虽然 KNN 路由器可以提高专家社会的准确性,但它们缺乏鲁棒性,这一点与提示路由不同。 AI
影响 为 LLM 路由系统引入了新的评估标准,可能指导更鲁棒和多样化的代理社会设计。
排序理由 学术论文,介绍了语言模型路由的新评估指标。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.MA (Multiagent) 阅读 →
- alphaXiv
- CatalyzeX
- DagsHub
- EmbedLLM
- Gotit.pub
- Hierarchic Social Entropy
- Hugging Face
- k-nearest neighbors algorithm
- National Research University – Higher School of Economics
- RouterBench
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →