PulseAugur
实时 09:23:31
English(EN) ChronoState: Hidden Elapsed-Time Conditioning for Temporal-State Action Selection in Frozen-Backbone Language Models

新基准测试LLM追踪已用时间的能力

研究人员开发了ChronoState,这是一个旨在测试语言模型如何处理基于已用时间和符号任务状态的时间决策的新基准。使用Qwen2.5-3B-Instruct模型,ChronoState证明了通过非token通道注入的隐藏已用时间条件化,可以显著提高时态状态动作选择的性能。然而,该系统泛化到未见过的时间相关概念的能力及其自主时间追踪能力仍然有限,在某些场景下,prompt注入的时间戳被证明更有效。 AI

影响 这项研究探索了将时间感知能力整合到LLM中的方法,有可能提高它们在时间敏感应用中的性能。

排序理由 该集群包含一篇介绍语言模型评估新基准和方法论的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准测试LLM追踪已用时间的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Sam Siavoshian, Omar Ramadan, Amir K. Saeed, Benjamin A. Johnson, Amin Mohamed El-Amin Diab, Benjamin M. Rodriguez ·

    ChronoState:在冻结骨干语言模型中用于时间状态动作选择的隐藏已用时间条件

    arXiv:2608.09124v1 Announce Type: new Abstract: Temporal decisions in language-model systems often depend on both symbolic task state and elapsed wall-clock time, such as cache expiration, job completion, quota resets, deadlines, or stale sessions. We study whether elapsed time c…