test
PulseAugur coverage of test — every cluster mentioning test across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
LLM研究探讨参数重要性、提示复杂性和任务依赖鲁棒性
近期研究探讨了大语言模型(LLM)及其参数的复杂性。一项研究表明,“超级权重”(Super Weights)在完整时对模型性能至关重要,但在单独训练时却会产生负面影响,这表明参数重要性并不等同于单独训练能力。另一篇论文引入了“提示复杂性”(prompting complexity)作为从LLM获得特定输出所需的最短提示的度量标准,并提出它作为Kolmogorov复杂性的LM相对类比。此外,研究表明提示鲁棒性因任务而异,主观问题比客观问…
-
新AI基准挖掘调查文章生成21K研究问答查询
通过挖掘调查文章,开发了一个新的研究问答基准,无需手动创建问题。该基准从75个领域的调查中提炼出21,000个查询和评分标准,可作为AI系统的压力测试。即使是表现最佳的模型,也只能达到75%的评分标准覆盖率,并且引用的文献不足11%。
-
LLM代理验证错误被发现过于僵化
一个软件开发团队发现,其LLM代理大约三分之一被拒绝的工具调用是由于过于僵化的验证规则造成的,而不是模型本身的错误。这些错误的拒绝发生在当合法的用户意图被旨在防止特定不良情况的检查所阻止时,例如时区差异影响取消窗口或ID验证问题。通过实施每周审查被拒绝的调用,并向代理提供更具体的失败原因,该团队将错误的拒绝减少到十分之一以下,并显著减少了与代理拒绝合法请求相关的支持票证。
-
人工智能集成挑战自主系统的安全性、可靠性和认证
一篇新论文讨论了在集成人工智能和机器学习组件的自主系统中确保可靠性所面临的挑战。由于人工智能的不可预测性,传统的安全、安保和可靠性方法已不足以应对。该论文探讨了新的方法和框架,以弥合人工智能创新与可认证的系统级可靠性需求之间的差距。
-
新研究解决大语言模型的事实准确性、架构推断和专业化评估问题
研究人员正在开发新方法来提高大语言模型(LLM)的准确性和可靠性。Google Research 推出了 SLED(Self Logits Evolution Decoding)技术,该技术利用 LLM 的所有层来增强事实准确性,而无需额外的微调或外部数据。同时,研究也在探索如何通过限制性 API 访问来推断 LLM 的架构属性,并创建新的基准来评估 LLM 在金融服务和编译器问题解决等专业领域的表现。此外,研究还在调查 LLM 集成…