SuperGPQA
PulseAugur coverage of SuperGPQA — every cluster mentioning SuperGPQA across labs, papers, and developer communities, ranked by signal.
-
阿里巴巴预览Qwen4架构,推出成本效益高的Qwen3.8-Flash-Next模型
阿里巴巴的Qwen团队发布了Qwen3.8-Flash-Next,这是一个开放权重的多模态MoE模型,预览了即将推出的Qwen4的架构。该新模型拥有显著的成本效益,在125B的骨干网络中每个token仅激活6B参数,并额外包含51B的N-gram嵌入。它在包括编码和多模态任务在内的各种基准测试中表现强劲,同时提供原生262K上下文窗口,可扩展至1M token。该架构引入了Qwen Sparse Attention (QSA) 和 G…
-
新定律量化LLM集成多样性提升 · 跟踪2个来源
研究人员制定了一项正式定律,用于量化使用多样化的大型语言模型(LLM)集成所获得的性能提升。该定律将集成提升分解为“挽救”和“损害”两个组成部分,并提供了一种基于准确率调整的正确率相关性($\phi_{\mathrm{adj}}$)等指标来预测性能的启发式方法。所提出的启发式方法在十个开源模型和多个基准测试的超过767,000次推理中进行了测试,显示出强大的预测能力,并能有效地迁移到未见过的数据集。
-
INFUSER框架通过引导式自我进化提升LLM推理能力
研究人员开发了INFUSER,一个用于自我进化语言模型的新框架,可增强推理能力。该迭代式协同训练系统包含一个生成器(Generator),用于从文档中生成问题和答案,以及一个从中学习的求解器(Solver)。生成器根据影响分数(influence score)获得奖励,确保它生成真正能提升求解器性能的问题,而非仅仅是难题。INFUSER展示了显著的改进,一个8B模型在数学和编码任务上的表现优于一个更大的32B模型。