prediction
PulseAugur coverage of prediction — every cluster mentioning prediction across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的基准评估大型语言模型在真实世界可穿戴健康数据上的推理能力 · 跟踪 2 个来源
研究人员开发了两个新的基准测试 HealthLoopQA 和 WearableQA,旨在评估大型语言模型 (LLM) 在解读来自可穿戴设备的复杂、纵向健康数据方面的能力。HealthLoopQA 专注于糖尿病护理,包含一个包含十一种推理能力的分类法以及一个用于设备故障和网络物理攻击的模拟测试平台。WearableQA 则使用了来自 200 名用户、为期 500 天的真实世界数据,包含 16 种类型的 4,084 个多项选择题,以评估数…
-
新框架和基准推动多模态大语言模型视觉推理能力发展
研究人员正在开发新方法来增强多模态大语言模型(MLLM)的视觉推理能力。一种名为 Beacon 的方法侧重于通过智能地仅在必要时调用工具并确保工具真正扩展模型能力来改进“模式适应性”和“工具效应”。另一个框架 LanteRn 使 MLLM 能够通过将语言与紧凑的视觉表示交织在一起,直接在潜在空间中执行视觉推理。此外,正在引入 ViSTR-Bench 和 ConVBench 等新基准,以更好地评估 MLLM 在复杂时空推理和逻辑一致性方…
-
Meta 据报道正在开发预测市场应用 'Arena'
Meta 据报道正在开发一款名为 Arena 的新应用,将进入预测市场领域。这款由 Mark Zuckerberg 指导的实验性应用旨在利用 Meta 在 Facebook 和 Instagram 等平台上的庞大用户群,与 Polymarket 和 Kalshi 等现有参与者竞争。最初,Arena 可能会使用类似电子游戏的积分系统,但该公司正在考虑未来像其过去的预测市场应用 Forecast 一样纳入真实货币。
-
分析发现:AI代理账单因Token膨胀而隐藏真实成本
最近的一项分析强调了AI代理计费中一个重大的会计错误,即每Token成本的关注点掩盖了每成功任务成本的真实开销。这种转变是由代理工作负载消耗远超标准聊天交互的Token量驱动的,导致意外的成本升级。文章详细介绍了这种Token膨胀的三种常见模式:递归自我纠正循环、未被尊重的流式重试以及代理的代理递归,并提供了一个Shell检查来识别和缓解这些隐藏成本。
-
AI 代理账单因隐藏的成本机制可能飙升 10 倍至 700 倍
AI 代理的账单可能出乎意料地高,比最初的试点成本高出 10 倍到 700 倍不等。这种飙升通常是由于五种潜在机制,包括递归自我纠正循环、无界工具调用和上下文填充。这些问题可能导致显著的成本超支,而底层模型或提示没有任何变化。开发人员可以通过分析 LLM 日志、检查会话令牌计数和检查提示大小来诊断这些问题,从而识别和缓解过度支出。