reasoning
PulseAugur coverage of reasoning — every cluster mentioning reasoning across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的SORT方法通过指导学习信号来增强AI推理能力
研究人员开发了一种名为SORT(选择性离策略参考调优)的新方法,以改进AI推理任务的强化学习。该技术通过从参考解决方案中推导出计划来解决标准方法在复杂提示上失败的问题。SORT然后比较有计划和无计划下的标记概率,为在计划指导下更可预测的标记分配更高的权重。这种方法将困难的提示转化为结构化的学习信号,在各种推理基准上,尤其是在能力较弱的模型上,比现有方法有了显著的改进。
-
新方法优化 LLM 评估小组以提高效率和准确性
一篇新的研究论文提出了一种优化大型语言模型(LLM)评估小组选择和部署的方法。该方法将评判小组设计为一个条件化角色分配问题,根据审计集和成本估算不同评判员的目标相对角色。这形成了一个策略,规定何时删除冗余评判员、添加互补评判员、有条件地路由专家,以及在验证收益减少时停止流程。该方法在推理、代码、安全和数学等多个领域进行了测试,证明了其在创建 LLM 评估的可重用和可审计调用计划方面的有效性。
-
新的图推理代理增强了AI对混合知识图谱的导航能力
研究人员开发了一种图推理代理(GRA),旨在导航和查询混合知识图谱,这些图谱将文本概念与关系表相结合。GRA利用一套通用工具在运行时发现领域特定的信息,在一个工业基准测试中,其准确性更高,输入的token数显著减少,从而优于全上下文代理。这一进展突显了选择性导航结构化数据对于提高代理性能的有效性,并表明可靠的工具驱动能力是其成功的关键。
-
新研究表明用于推理的强化学习效率低下,并提供了更廉价的替代方案
一篇新论文表明,用于改进语言模型推理的强化学习(RL)仅影响一小部分token。研究人员通过一种需要显著更少计算能力(约1000倍少)的简单方法,成功复制了通过RL实现的性能提升。这一发现对增强模型推理能力所需的复杂RL技术的必要性提出了质疑。
-
德国情报机构因传播俄罗斯僵尸网络的“联邦特洛伊木马病毒蠕虫”而受阻
据报道,包括德国宪法保护局和联邦情报局在内的德国情报机构,由于“联邦特洛伊木马病毒蠕虫”的传播而无法运作。据称,该恶意软件正在促进一个名为“Reasoning”的俄罗斯僵尸网络的全球传播,该网络据称已渗透到北约网络。
-
AI推理:有效性与伦理考量探讨
一篇近期文章探讨了AI推理的潜在陷阱,质疑当前AI系统是否正在发展有效推理的能力,还是仅仅在模仿人类的反应而没有真正的理解。文章深入探讨了AI是否可能通过有缺陷或不恰当的方法得出正确结论的可能性,引发了对这种推理的可靠性和伦理影响的担忧。
-
AI模型质量从规模转向嵌入式推理
AI模型质量完全依赖于规模的时代正在结束。未来的进步将侧重于将推理直接嵌入模型权重,而不是依赖草稿本或复杂提示等外部工具。这种方法有望提高复杂任务的效率和一致性。
-
新框架通过减轻过拟合和改进验证来增强LLM的自我演化
研究人员正在开发新框架以增强大型语言模型(LLM)的自我演化能力。SkillBoost是一个三阶段框架,旨在通过结合结构化利用失败、先验指导探索以及验证接受候选修复来减轻技能过拟合。另一种方法Skill Self-Play(Skill-SP)使用一个包含提议者、求解器和技能控制器的协同演化框架,以平衡任务多样性和验证可靠性。此外,具有自可验证奖励的强化学习(RLSVR)将开放式任务转化为可验证的代理环境,以实现LLM在确定性正确性领域…
-
风险投资重点转向AI推理、智能体和专用基础设施
一篇Reddit上的讨论探讨了在未来5-10年内,风险投资家可能会如何在AI技术栈中分配资金。参与者正在考虑长期经济价值和防御性将体现在何处,特别是随着焦点从预训练转向推理、智能体和专用基础设施。关键的争论领域包括应用层商品化与垂直应用价值捕获的潜力,以及与NVIDIA等成熟公司相比,专用硬件初创公司的可行性。
-
AI词汇表发布,旨在揭开行业术语的神秘面纱
一个AI词汇表已发布,用于定义人工智能行业内的常用术语。该资源旨在使AGI、AI代理和思维链推理等概念的AI术语更容易被广大受众理解。该词汇表是一份动态文档,随着AI领域的不断发展,将持续更新。
-
AI 社区讨论尽管进展迅速但能力仍未充分发展
关于当前 AI 能力的讨论正在进行中,重点关注尽管在其他领域取得了重大进展,但在某些方面却令人惊讶地未充分发展。参与者正在分享他们对 AI 发展的期望,并确定了他们认为现在应该更成熟的特定能力。这次对话凸显了不同 AI 领域之间不均衡的进展。
-
精心策划SFT数据集以增强AI推理能力
本文提供了专门针对推理任务精心策划监督微调(SFT)数据集的指导。它强调了数据集质量和结构对于提高模型在复杂问题解决场景中的性能的重要性。
-
MathFormer模型在符号数学任务上达到高精度,表明是模式匹配而非推理
一个名为MathFormer的、拥有400万参数的小型序列到序列模型在符号数学展开任务上达到了近98.6%的准确率。这表明该模型学习的是结构化标记转换,而不是真正的数学推理。研究结果暗示,大型语言模型可能通过广泛的模式匹配来展现出明显的数学推理能力,而非真正理解数学原理。