实体
DeepSeek-V3.2-Thinking
DeepSeek-V3.2-Thinking
PulseAugur coverage of DeepSeek-V3.2-Thinking — every cluster mentioning DeepSeek-V3.2-Thinking across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
OptSkills系统增强了LLM在优化问题上的泛化能力
研究人员开发了OptSkills,一个旨在增强大型语言模型(LLM)在解决优化问题上的泛化能力的新系统。OptSkills根据问题潜在的原型而非表面相似性进行聚类,从而实现更鲁棒的学习。它将成功的解决问题轨迹提炼成可重用的技能,从而提高了在分布内和分布外性能。该系统在各种数据集上实现了最先进的准确性,并在具有挑战性的基准测试中超越了DeepSeek-V3.2-Thinking等现有模型。
-
新基准揭示大型语言模型在精确代码调试方面存在困难
研究人员引入了精确调试基准(PDB)框架来评估大型语言模型的调试能力。该框架将现有的编码数据集转换为调试基准,通过合成的原子级错误自动生成有缺陷的程序。PDB采用编辑级精确率和错误级召回率等新颖指标来评估模型修复代码的准确性。实验显示,像GPT-5.1-Codex和DeepSeek-V3.2-Thinking等领先模型,尽管测试通过率很高,但在精确度方面仍有困难,经常过度编辑解决方案。