PulseAugur
实时 06:35:59
实体 Qwen2.5-Instruct

Qwen2.5-Instruct

PulseAugur coverage of Qwen2.5-Instruct — every cluster mentioning Qwen2.5-Instruct across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_221079 ·

    研究:对于 Text-to-SQL 任务,更大的模型优于增加的推理计算量

    一篇新的研究论文探讨了在语法受限的 Text-to-SQL 任务中,模型大小与推理计算量之间的权衡。研究发现,即使使用 Beam Search 或 Sample+Vote 等技术,增加模型大小通常比增加推理计算量能带来更高的准确性。具体而言,在可比的推理预算下,Beam Search 比 Sample+Vote 更有效,这一发现与之前关于无约束任务的研究结果不同。

  2. TOOL · CL_196128 ·

    贝叶斯优化可有效找到大型语言模型中的强大专家

    研究人员开发了一种使用贝叶斯优化方法,可以高效地识别大型语言模型中强大的单一专家,这一过程被称为无梯度后训练。该方法将贝叶斯优化应用于权重空间的随机线性嵌入中,并使用高斯过程代理,无需反向传播。在Qwen2.5-Instruct模型上的推理基准测试表明,该方法在候选评估次数显著减少的情况下,取得了与RandOpt相当或更优的结果,降低了后训练成本,同时产生了更强大的可部署模型。

  3. TOOL · CL_158682 ·

    小型种群 ES 微调 LLM 在奖励调整下显示出潜力

    一篇新的研究论文探讨了进化策略(ES)在微调大型语言模型(LLM)方面的有效性,特别是在使用二元奖励时。研究发现,在二元奖励训练中,ES 对大型种群规模的感知需求可能源于奖励设计和归一化,而非内在限制。通过禁用 z-score 优势归一化,研究人员证明了具有小型种群规模(N=2)的 ES 可以在 GSM8K 和 TREC 等基准测试上显著提高性能,甚至优于那些崩溃或性能下降的归一化变体。这表明,通过仔细的奖励设计和归一化,可以用最少的…

  4. TOOL · CL_143810 ·

    Mirror Theory 提出可行路径熵用于衡量 AI 能力

    研究人员提出了 Mirror Theory,该理论提出根据智能系统在重复反思下进行持续、连贯的能力来评估智能系统。该理论通过可行路径熵 (VPE) 来实现,VPE 是在有限预算内对已验证的续写能力的一种衡量标准。在 Qwen2.5-Instruct 模型上使用 GSM8K 基准进行的实验表明,增加 token 预算可显著提高已验证的可达性和模式多样性。值得注意的是,Qwen2.5-1.5B 模型表现出比更大的 Qwen2.5-3B 模…

  5. TOOL · CL_86853 ·

    大型语言模型标注者在社会科学研究中表现出社会期望偏差

    一篇新论文调查了用于计算社会科学的大型语言模型标注者中的社会期望偏差。研究人员发现,三个开源模型(Zephyr、Mistral-Instruct 和 Qwen2.5-Instruct)表现出不同类型的偏差,例如在标记有害内容时存在宽容或过度纠正。研究还表明,常用的提示技术不能有效减轻这些偏差,有时甚至会加剧它们,这凸显了计算社会科学研究中需要更可靠的验证方法。

  6. TOOL · CL_62890 ·

    VeriGate 增强 GRPO 以改进 AI 推理模型训练

    研究人员开发了 VeriGate,它是 Group Relative Policy Optimization (GRPO) 的一个扩展,旨在改进推理模型的训练。VeriGate 在验证器奖励退化时使用过程监督来解决稀疏监督问题,并将步进分数转换为未来累积奖励,以实现更好的信用分配。该方法在 MATH 数据集上使用 Qwen2.5-Instruct 模型时,平均准确率提高了高达 20%,并减少了零梯度失败和奖励破解等问题,显示出显著的改进。

  7. TOOL · CL_47693 ·

    Arcee AI 迁移至 Together 端点以实现成本高效的 SLM

    Arcee AI 已将其专业小型语言模型 (SLM) 从 AWS 迁移到 Together 专用端点,以寻求改进成本、性能和运营敏捷性。该公司专注于训练参数量在 720 亿以下的、用于编码和通用文本生成等特定任务的高效模型。Arcee AI 还开发了 Arcee Conductor,这是一个推理路由系统,可将查询定向到最合适的模型,包括 GPT-4.1 和 Claude 3.7 Sonnet 等第三方选项,以优化成本和性能。