一篇新发表在arXiv上的研究论文强调了大型语言模型在处理健康相关查询时输出的显著可变性。研究人员发现,不同的访问模式,例如直接API使用与ChatGPT和ChatGPT Health等聊天机器人界面,会产生系统性差异。这种差异对当前AI模型评估的有效性构成了挑战,因为评估通常依赖API访问,而消费者则通过用户友好的界面进行交互。该研究强调,模型提供商迫切需要允许准确复制消费者的体验和设置,以便进行可靠的审计,并确保AI提供的健康建议的可靠性。 AI
影响 强调了在健康领域对大型语言模型进行标准化审计的关键需求,以确保建议的可靠性。
排序理由 arXiv上发表的研究论文,详细介绍了关于大型语言模型可变性的发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- ChatGPT
- ChatGPT Health
- DagsHub
- Gotit.pub
- Hugging Face
- Large Language Models
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →