Artificial Intelligence In Medical Epidemiology
PulseAugur coverage of Artificial Intelligence In Medical Epidemiology — every cluster mentioning Artificial Intelligence In Medical Epidemiology across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
新课程方法提升AI模型数学解题能力
研究人员开发了一种名为“问题引出问题”(Question-begets-Question, QbQ)的新型自演化课程方法,以提高语言模型在竞赛数学等复杂任务上的性能。该方法通过生成多样化的问题变体,解决了数据稀缺和模型训练中常见的平台期效应。通过将强化学习集中在模型大部分能解决的问题上,QbQ 已被证明能够突破性能瓶颈,显著提高模型的解题能力,且没有饱和迹象。
-
新方法应对大语言模型长上下文效率挑战 · 跟踪 3 个来源
研究人员正在开发新方法来提高大语言模型长上下文推理的效率。一种名为 LISA 的方法将线性注意力与稀疏注意力机制相结合,将计算复杂度从 O(n^2) 降低到 O(nM),在某些模型上实现了 50% 的推理速度提升。另一种方法 ELSAA 使用稀疏和低秩分支来近似注意力分数,从而能够在不具体化完整注意力矩阵的情况下进行更长上下文的训练。第三篇论文 Lil 探讨了稀疏注意力可能由于序列更长而导致复杂性增加的“少即是少”问题,并提出了一种提…
-
新的 Step-Tagging 框架增强了对语言推理模型的控制
研究人员引入了一个名为 Step-Tagging 的新框架,以更好地控制语言推理模型(LRM)的生成过程。该框架使用轻量级句子分类器实时标注推理步骤,并采用一种名为 ReasonType 的新分类法。通过监控特定推理步骤的数量,可以建立有效的提前停止标准,从而在保持 MATH500、GSM8K、AIME、GPQA 和 MMLU-Pro 等基准测试相当准确率的同时,显著减少 token 使用量(20-50%)。这种方法为研究和控制 LR…
-
KV-PRM论文提出高效的多智能体LLM奖励建模方法
研究人员提出了一种名为KV-PRM的新方法,用于提高多智能体系统中使用的过程奖励模型(PRM)的效率。与现有的重新编码整个轨迹的基于文本的PRM不同,KV-PRM直接利用LLM推理过程中生成的KV缓存。这种方法将计算成本从O(L^2)显著降低到O(L),使其更适合长上下文场景。在MATH、GSM8K和AIME等基准测试上的实证结果表明,KV-PRM在性能上能媲美或超越文本-PRM,同时在FLOPs、延迟和内存占用方面提供了显著的降低。
-
研究发现:大型语言模型(LLM)的一致性是准确性的弱代理指标
一篇新的arXiv论文研究了使用大型语言模型(LLM)之间的一致性作为正确性代理指标的可靠性。该研究涉及53个不同的LLM运行者和265,000个样本,发现虽然一致性可以作为准确性的弱正向预测指标,但它并非独立的置信度分数。研究强调,模型可能因为共享的偏见或记忆的启发式方法而达成一致,而非事实准确性,特别是指出前沿模型表现出过度自信且存在重复性错误。研究结果表明,自我一致性是正确性的条件性指标,最好用于分配计算资源,而不是作为准确性的…
-
新的AdaPrefix-GRPO方法提升AI在难题上的推理能力
研究人员开发了一种名为AdaPrefix-GRPO的新技术,以改进语言模型在复杂推理任务上的训练。该方法在训练过程中自适应地调整提供给模型的参考解前缀量,旨在将成功率保持在梯度信号最强的约50%左右。一旦训练完成,模型无需此辅助即可解决问题,在具有挑战性的数学问题上显示出显著的准确性提升,尤其对较小的模型而言。
-
KVpop 方法在保持性能的同时大幅减少了 LLM 缓存内存使用量
研究人员开发了 KVpop,一种用于压缩自回归解码中键值缓存的新颖方法,这是大上下文窗口的一个重要瓶颈。KVpop 通过使用未来注意力目标直接监督保留或丢弃决策来学习驱逐策略,在保持高性能的同时实现了显著的内存节省。该方法在 Qwen3-4B 和 Qwen3-8B 等模型的数学推理任务上取得了强劲成果,优于现有的驱逐基线,并显著降低了内存成本。
-
新的相对惊奇度指数增强了 RLVR 中 LLM 的推理能力
研究人员引入了相对惊奇度指数 (RSI),这是大型语言模型中用于可验证奖励强化学习 (RLVR) 的一项新指标。RSI 旨在通过同时考虑 Token 熵和概率来调和 RLVR 中的冲突方法。提出的 RSI 选择 (RSI-S) 方法在稳定的 RSI 区间内过滤 Token,去除冗余和不稳定的 Token。实证结果表明,RSI-S 在各种 Qwen2.5 模型规模的 AIME 和 AMC 等基准测试中提高了准确性。
-
HARD-KV 框架将 LLM 推理速度提升 2 倍
研究人员开发了 HARD-KV,一个旨在优化长上下文大型语言模型 (LLM) 推理的新框架。该系统解决了头自适应压缩算法(通过动态内存预算提供准确性)与需要静态内存模式以提高效率的现代推理引擎(如 vLLM)之间的冲突。HARD-KV 引入了级联缓存 (Cascade Cache) 层级结构和逻辑校准 (Logits Calibration) 机制,以统一重要性指标并为不同模型头实现一致的预算分配。实验表明,HARD-KV 在保持超过…
-
新的SIGMA框架通过多代理知识集成提升AI数学推理能力
研究人员开发了SIGMA,一个旨在提高AI代理数学推理能力的新框架。SIGMA采用多代理系统,其中专业代理独立进行推理、执行定向搜索并通过协调者合成信息。这种方法通过让每个代理生成假设性段落来优化检索,从而实现上下文敏感且高效的知识集成。SIGMA在MATH500、AIME和GPQA等具有挑战性的基准测试中表现出色,比现有系统提高了7.4%的绝对性能。
-
Fireworks AI 发布 GLM-5.2,拥有 100 万上下文窗口,针对编码进行了优化
Fireworks AI 推出了 GLM-5.2,这是一款拥有 100 万 token 上下文窗口的新前沿模型,针对编码任务进行了优化。该模型已在 SWE-bench 和 GPQA 等基准上进行了独立验证。Fireworks AI 强调其作为端到端推理提供商的角色,区别于仅将调用转发给其他 API 的路由器,提供生产级延迟和零数据保留。
-
全新 7B 统一扩散语言模型 'Sumi' 发布,伴随扩散模型进展
研究人员推出了 Sumi,一个拥有 70 亿参数的统一扩散语言模型 (UDLM),该模型在 1.5 万亿 tokens 上从头开始预训练。这个开源模型在知识、推理和编码任务上表现出与自回归模型相当的性能,但在常识基准测试上表现稍逊。发布内容包括模型权重、检查点以及完整的训练方法,旨在为大规模研究 UDLM 提供参考。此外,其他研究探索了扩散语言模型的进展,包括生成 CUDA 核的方法、通过自生成错误训练改进 Token 编辑,以及开发…
-
新HSD方法通过同伴回滚指导增强LLM推理能力
研究人员开发了一种名为“后见之明自蒸馏”(HSD)的新方法来改进大型语言模型(LLM)的推理能力。传统方法在为长推理链中的单个token分配信用时存在困难,通常依赖于最终的标量奖励。HSD通过将教师模型条件化为一个来自同一训练组的成功同伴回滚,从而提供更详细的、token级别的指导信号来解决这个问题。该方法在数学和代码基准测试中表现出优越的结果,尤其是在答案简洁的任务上,其性能优于现有的强化学习和自蒸馏基线。
-
MixReasoning 框架通过调整推理深度来优化 AI 模型效率
研究人员开发了一个名为 MixReasoning 的新框架,该框架可以在单个响应中动态调整推理深度。这种方法允许模型对复杂步骤应用详细推理,同时对更简单的步骤使用更简洁的推理。在 GSM8K 和 MATH-500 等基准测试上的实验表明,MixReasoning 在不牺牲准确性的情况下提高了效率并缩短了推理长度。
-
新框架解析LLM管道在检测和纠正方面的失败
一篇新的研究论文介绍了一个框架,用于理解在多阶段大型语言模型(LLM)管道中观察到的令人费解的行为,例如准确性平台和逆转。所提出的模型将代理响应分解为两个决策:检测(是否信任上游内容)和条件生成。该分析揭示了“检测而非纠正”是一种重要的故障模式,在各种基准测试和模型家族中,条件性错误纠正率持续占主导地位。
-
新框架使大型语言模型能够在推理过程中共享见解
研究人员推出了一种新颖的、无需训练的协作并行思维(CPT)框架,旨在提高大型语言模型测试时扩展(TTS)的效率。CPT通过实现不同分支之间的搜索时信息共享,解决了并行TTS方法中冗余探索的问题。这使得各分支能够重用他人已有的发现,而不是重新发现相同的信息,从而在HMMT和AIME等基准测试中改善了准确性-延迟权衡。
-
研究发现 MoE 模型在复杂推理任务上错误路由 token
研究人员发现混合专家(MoE)语言模型中存在一个重大问题,即路由机制(将 token 指向特定专家)经常选择次优路径。虽然标准路由器在置信度高的 token 上表现良好,但在复杂推理任务上却无法识别出性能更好的路径。这种错误路由存在于包括 Qwen3、GPT-OSS、DeepSeek-V2 和 OLMoE 在内的几款主流 MoE 模型中。研究表明,即使对路由器进行微小的更新,而不改变专家本身,也能提高在具有挑战性的数学和推理基准测试上…
-
新的DASE启发式方法通过自适应停止优化LLM集成准确性
研究人员开发了一种名为DASE(Deliberative Adaptive Stopping Ensemble,审慎自适应停止集成)的新启发式方法,以提高大型语言模型(LLM)集成的准确性。DASE在达成共识时帮助集成模型更早地确定答案,并在证据分散时使用回退机制,从而防止过度审议导致性能下降。该系统在AIME数据集上展示了显著的路由差距,与现有方法相当,并表明自适应停止是准确性提高的主要驱动因素,而非注入带宽。
-
AI模型评估需要第三方审计以确保可靠的进展跟踪
AI实验室之间的模型评估方法不一致,导致基准测试结果无法比较,并可能做出有缺陷的发布决策。OpenAI、Anthropic和Google DeepMind等公司已经改变了它们的评估设置,包括试验次数和使用的工具,使得直接比较变得困难。作者建议将评估转移给第三方审计机构,类似于其他高风险行业,以确保可靠性和透明度。
-
Qwen 3.6 Plus 在价格和质量基准测试中胜过 DeepSeek V4 Pro
最近对六个四月发布的大型语言模型 (LLM) 进行的一次实测显示,Qwen 3.6 Plus(发布于 22 天前)的表现优于更新的 DeepSeek V4 Pro。尽管 DeepSeek V4 Pro 拥有先进的推理架构,并在 AIME 和 SWE-bench 上取得了最高分,但在测试中仅获得 89 分,而 Qwen 3.6 Plus 得分为 92 分。测试还突显了显著的成本差异,DeepSeek 的 Flash 版本比其 Pro 版…