实体
gpt-o3-mini
gpt-o3-mini
PulseAugur coverage of gpt-o3-mini — every cluster mentioning gpt-o3-mini across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究发现:大型语言模型难以检测现实世界中的代码漏洞
一篇新近发表在arXiv上的研究评估了深度学习模型和大型语言模型在代码漏洞检测方面的实际有效性。研究发现,包括Claude 3.5 Sonnet、GPT-4o和GPT-5等知名大型语言模型在内的当前模型,在从基准数据集泛化到现实世界场景时存在困难。当在最近修复的Linux内核漏洞的新构建数据集上进行测试时,模型的性能显著下降,凸显了学术评估与实际应用之间的差距。
-
LLM在增强上下文的情况下显示出在PTSD严重程度估算方面的潜力
一项新研究发表在arXiv上,评估了11个大型语言模型(LLM)从临床叙述中估算PTSD严重程度的性能。研究发现,当提供详细的背景信息(如子量表定义和访谈问题)时,LLM的表现最佳,并且增加的推理工作量可以提高准确性。像Llama和DeepSeek这样的开放权重模型在超过70B参数后表现出现平台期,而像gpt-o3-mini和GPT-5这样的闭源模型随着新一代的出现而持续改进。该研究还表明,LLM能够区分PTSD严重程度与其他疾病,并…