PulseAugur
实时 02:13:20
实体 Cotulla–La Salle County Airport

Cotulla–La Salle County Airport

PulseAugur coverage of Cotulla–La Salle County Airport — every cluster mentioning Cotulla–La Salle County Airport across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 5
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 5 条
  1. TOOL · CL_217570 ·

    新的 Scaffold CoT 数据集旨在改进小型 LLM 的推理能力

    一个名为 Scaffold CoT 的新数据集已发布,包含约 400 万个示例和 30 亿个 token。该数据集旨在通过提供结构化的思维框架来提高小型语言模型(50 亿参数以下)的推理和响应准确性。该框架包含三个一致的部分:“Inventory”(清单)、“Interaction”(交互)和“Execution”(执行),这有助于模型专注于内容而非格式,从而减少错误并提高连贯性。Scaffold CoT 还包括多样化的类别和深度层级…

  2. TOOL · CL_155481 ·

    人工智能失常源于复杂交互:数据、目标、架构

    人工智能系统表现出令人惊讶的行为,是由于包括数据偏见、训练目标、神经网络架构、系统级安全防护以及对话上下文在内的复杂因素相互作用所致。理解这些组成部分对于识别、缓解和预防人工智能失常至关重要。训练数据质量问题,如不平衡或导致人工智能“作弊”的微妙线索,是这些问题的重要原因。此外,特定的训练目标(通常由损失函数定义)以及后续的训练后阶段,如人类反馈强化学习(RLHF)和思维链(CoT)微调,进一步塑造了人工智能的运行行为及其与预期结果的一致性。

  3. COMMENTARY · CL_140501 ·

    Reddit用户质疑对LLM进行总结推理轨迹微调

    Reddit上的一篇讨论质疑了在总结或审查过的思维链(CoT)轨迹上微调大型语言模型的做法。用户认为,这种方法,特别是使用Anthropic的Fable微调模型,可能不会提高输出质量,甚至可能降低输出质量。这是因为提供的推理轨迹可能无法准确反映模型的内部思考过程,从而导致次优结果。

  4. TOOL · CL_106811 ·

    研究表明,RLVR 在 LLM 推理方面优于 SFT

    一篇新论文分析了为什么强化微调,特别是具有可验证奖励的强化学习(RLVR),在提高大型语言模型的推理能力方面优于监督微调(SFT)。通过将思维链推理建模为图路径查找问题,研究表明 SFT 在没有负面示例的情况下难以进行有效回溯。相比之下,RLVR 仅使用结果奖励就能学会有效回溯,从而在推理时间计算上产生指数级差异,并为困难决策提供更好的资源分配。

  5. TOOL · CL_50864 ·

    新框架将大语言模型推理解读为k-means聚类

    研究人员提出了一个名为KCoT的新框架,该框架将大语言模型中的思维链(CoT)推理解释为一种聚类形式。该方法提供了对迭代推理如何在文本属性图(TAGs)上操作的k-means解释。该框架通过将CoT推理与图表示学习相结合,旨在提高语义-拓扑交互和可解释性,有望增强大语言模型在图结构数据上的能力。