实体
Olmo-3-7B-Instruct
Olmo-3-7B-Instruct
PulseAugur coverage of Olmo-3-7B-Instruct — every cluster mentioning Olmo-3-7B-Instruct across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新方法改进了语言模型代理中的角色条件行为
研究人员开发了一种名为激活引导的新方法,以改进用于社会模拟的语言模型代理的角色条件行为。该工作流程包括定义角色档案、提取角色特定方向以及在代理部署前评估一致性。与先前技术相比,该方法显示出更高的角色档案一致性,并保持了词汇多样性,为模拟构建者提供了一个实用的筛选器,用于选择单个角色的最佳引导系数。
-
新AI训练方法利用自我修正提升性能
研究人员推出了一种名为Self-Distillation Zero (SD-Zero) 的新方法,以提高语言模型训练效率。该技术训练单个模型同时充当生成器和修正器,利用二元奖励创建密集的、token级别的监督。SD-Zero在数学和代码推理任务上展示了显著的性能提升,在可比的训练样本预算下,其表现优于Rejection Fine-Tuning和GRPO等现有基线。