研究人员开发了HuGLEN,一个新颖的评估流程,旨在评估语言大模型(LLMs)在光网络自动化中的应用。该流程采用“以LLM为裁判”的方法,并结合专家评分,创建了一种可扩展且可复现的比较方法。该系统旨在根据质量效率得分(QES)对LLMs进行排名,该得分平衡了解释质量和推理成本。结果表明,一个12B参数的LLM取得了最高的QES,证明了其在面向操作员的自动化任务中的最佳权衡。 AI
影响 这一新的评估框架可以简化网络自动化任务中LLMs的选择,提高效率和质量。
排序理由 该集群描述了一篇研究论文,详细介绍了一个用于特定领域LLMs的新评估流程。
- 12B parameters
- HuGLEN
- Large Language Models
- optical network automation
- QoT
- Hugging Face
- LLM-as-a-judge
- QES
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →