一项名为Fan-Out的新基准测试挑战已被开发出来,用于评估大型语言模型(LLM)在安全高效地处理并发工具调用方面的能力,尤其是在这些调用共享通用状态时。该基准测试衡量安全性、最优调度和速度,结果显示谷歌的Gemini模型在最难的环节中表现最佳,实现了高安全性和最优调度百分比。其他模型,如Anthropic的Claude和OpenAI的GPT-5.4-mini,也表现出不同程度的成功,一些模型在安全性方面表现出色,但在复杂的多代理场景中优化调度方面遇到困难。 AI
影响 该基准测试突显了LLM安全管理复杂并发操作的关键需求,推动了向更强大的代理能力发展。
排序理由 该条目描述了一个用于评估LLM在处理并发工具调用方面能力的新基准测试,这是对该领域的一项面向研究的贡献。[lever_c_demoted from research: ic=1 ai=1.0]
- anthropic/claude-opus-5@default
- anthropic/claude-sonnet-5@default
- AsyncFC
- EffectFence
- Fan-Out
- google/gemini-3.5-flash
- Hotragn Pettugani
- Kaggle
- openai/gpt-5.4-mini-2026-03-17
- PeakBench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →