实体
ChemCoTBench
ChemCoTBench
PulseAugur coverage of ChemCoTBench — every cluster mentioning ChemCoTBench across labs, papers, and developer communities, ranked by signal.
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
Latent JEPA 框架增强了 LLM 的化学推理能力
研究人员推出 Latent JEPA,一个旨在增强大型语言模型化学推理能力的新框架。该方法结合了自回归学习和联合嵌入预测,使潜在思维能够在没有明确分步口述的情况下预测未来解决方案的方面。在 ChemCoTBench 数据集上的实验表明,在分子优化和编辑方面有所改进,表示分析表明未来预测使潜在思维对分子结果更具信息量,并与化学结构更好地对齐。
-
Divergence Decoding 在无需重新训练的情况下融合 LLM 能力
研究人员推出了一种名为 Divergence Decoding 的新型训练无关框架,旨在将专业科学语言模型的能与通用模型融合。该方法使用 Jensen-Shannon 散度来监测模型间的分布差异,当专家模型显示出显著差异时,动态地路由到通用模型。在 Qwen 和 Llama 系列模型上,跨越 GPQA 和 ChemBench 等基准测试,Divergence Decoding 表现优于单一模型基线,预示着 LLM 推理时自适应协作的新范式。
-
MolViBench基准测试评估大语言模型在药物发现分子编码任务上的能力
研究人员推出MolViBench,一个旨在评估大语言模型(LLMs)在分子编码任务中能力的新型基准测试。该基准测试弥补了现有评估的不足,这些评估要么缺乏化学知识,要么侧重于召回率而非可执行代码生成。MolViBench包含跨越五个认知层级的358个任务,涵盖12个真实世界的药物发现工作流程,并采用多层框架来评估代码的可执行性和化学正确性。