PulseAugur
实时 07:26:46
实体 Atsuki Yamaguchi

Atsuki Yamaguchi

PulseAugur coverage of Atsuki Yamaguchi — every cluster mentioning Atsuki Yamaguchi across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_174117 ·

    新研究详细介绍了生成高质量LLM预训练数据的最佳方法

    研究人员对为大型语言模型合成高质量预训练数据进行了系统研究,生成了超过一万亿个token。他们的发现表明,结构化输出格式(如表格、数学问题、FAQ和教程)比精选的网络文本或先前的方法更有效。研究还发现,超过1B参数的生成模型尺寸没有带来额外的好处,原始数据的选择对性能有显著影响。这项研究促成了FinePhrase的开发,这是一个包含4860亿个token的数据集,其性能优于现有的合成数据基线,同时将生成成本降低了高达30倍。