Daniel Kahneman
PulseAugur coverage of Daniel Kahneman — every cluster mentioning Daniel Kahneman across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
TypeSafe AI 发布 Jev,用于快速、低成本的 AI 评估
Jev 是 TypeSafe AI 推出的新型 AI 评估模型,旨在实现快速、低成本的决策。与提供解释的传统 LLM judge 不同,Jev 为预定义的类别提供带有概率的类型化答案,使其在特定任务上速度更快、成本更低。Rhesis 已将 Jev 集成作为分类指标的模型提供商,从而可以在 AI 测试中使用它来执行诸如分类支持工单或评估客户情绪等任务。
-
Jev AI 专注于决策而非文本,具有校准的置信度
Jev 是一个新的人工智能系统,旨在做出决策而非生成文本,这使其区别于 ChatGPT、Claude 和 Gemini 等模型。Jev 由 TypeSafe AI 开发,该公司由曾在 OpenAI 工作过的 Diogo Almeida 创立,Jev 旨在实现类似于“系统 1”思维过程的快速、即时判断。它回答固定问题并提供预定义响应,例如是/否或按比例评分,并为其决策提供置信度级别,旨在通过提供即时、可靠的答案而不是冗长的文本来简化业务流程。
-
决策AI模型提供结构化输出,挑战传统LLM
一种新的AI模型类别——“决策AI”正在兴起,其重点在于提供结构化输出,如选择、分数或概率,而非自由文本。TypeSafe AI的Jev模型,被描述为“System One模型”,通过提供代码可直接操作的校准概率引领了这一趋势。Fastino Labs等竞争对手迅速推出了类似模型,开源替代方案也正在涌现,旨在通过提高速度和可靠性来改进代理控制流、分类和验证任务。
-
杰文斯悖论应用于人工智能判断:效率驱动使用量增加
杰文斯悖论最初应用于资源消耗,表明效率的提高会导致总体使用量的增加,因为每单位工作的成本会降低。这一原理现在被应用于人工智能判断,像以杰文斯命名的System One这样的模型,其判断成本仅为几分之一美分。预期这种成本的大幅降低将导致判断数量的爆炸式增长,而不是判断总数的减少。这种现象与ATM机进行了比较,ATM机自动化了常规交易,导致出纳员角色的重新分配,而不是劳动力的显著减少,人类出纳员处理更复杂和面向客户的任务。
-
大型语言模型缺乏真正推理能力,反映了直觉思维与审慎思维的对比
最近的一项分析表明,大型语言模型不具备真正的推理能力,这与丹尼尔·卡尼曼关于直觉思维和审慎思维的理论相呼应。文章强调了大型语言模型的三个关键局限性:它们无法维持状态、缺乏独立的信念体系,以及倾向于模拟审慎思考而非进行真正的认知过程。
-
大型语言模型(LLM)缺乏AlphaGo的推理能力,依赖模式补全
尽管2016年AlphaGo战胜李世石被视为机器直觉的展示,但作者认为这实际上是一种复杂的推理形式,结合了用于直观落子的策略网络和用于评估未来后果的搜索机制。这种双重系统与当前的大型语言模型(LLM)形成对比,后者主要依赖于类似系统1的下一个词元预测过程。尽管链式思考(chain-of-thought)提示等技术提高了LLM的性能,但它们仍然缺乏独立的推理引擎,依赖于迭代的模式补全而非真正的审议。作者认为,未来的AI系统需要真正的推理…
-
TypeSafe AI 为电商推出经济高效的分类模型
TypeSafe AI 发布了一款名为“System One”的新模型,该模型专为分类任务而非文本生成而设计。该模型的定价为每百万输入 token 0.042 美元,输出免费,旨在为电商商店提供更快、更便宜的决策制定。作者认为,零售业中的许多 AI 调用,例如确定客户情绪或对产品进行分类,本质上都是分类问题,可以通过 TypeSafe AI 的专用模型等更具成本效益的方式来处理,而不是使用通用的大型语言模型。
-
新的“System One”AI模型提供更快、更便宜的代理决策
一类新的AI模型,被称为“System One”,正在兴起,通过比通用大语言模型更有效地处理特定、有限的任务来优化AI代理的性能。这些模型,以TypeSafe的Jev和Convai Innovations的Laya为例,旨在处理状态输入并回答具有预定义选项的类型化问题,例如选择、评分或是/否。这种方法旨在通过避免为简单决策调用复杂的大语言模型来降低成本和延迟,类似于使用专用工具而不是通用推理引擎。
-
TypeSafe AI推出Jev,一款用于自动化的“智能switch语句”模型
TypeSafe AI推出了Jev,一款针对自动化任务进行了优化的新模型,它提供具有校准概率的类型化决策。与传统的LLM不同,Jev不生成字符串,而是根据结构化文本状态回答问题,契合了Agent决策过程中的“switch语句”模式。该公司声称,Jev在特定System One任务上具有显著的速度和成本优势,与前沿模型相比,成本可能降低444.6倍,速度可能提高193.6倍,尽管这些数据被呈现为最佳情况。
-
前OpenAI研究员推出Jev,一款用于校准决策的AI
Diogo Almeida,一位前OpenAI研究员,也是ChatGPT和RLHF的联合发明人,通过他的公司TypeSafe AI推出了一款名为Jev的新AI模型。该模型被设计为“System One Model”,专注于自动化,与传统LLM不同,它不生成文本。相反,Jev接收世界状态和类型化问题,以提供具有概率的校准决策,目标是降低延迟和成本。其训练方法是用于校准决策的强化学习(RLCD),专注于认知上诚实的概率,并利用并行采样器在…
-
新的强化学习交易系统ViperQ集成了拍卖市场理论
研究人员开发了ViperQ,一个专为交易设计的强化学习系统,它融合了拍卖市场理论的原理。该系统利用源自市场微观结构特征(如成交量控制点和价值区域位置)的独特状态表示。在对特斯拉和NVDA的机构逐笔数据进行评估时,ViperQ实现了可控回撤下的显著回报,证明了微观结构感知输入在金融时间序列决策中的有效性。
-
神经符号循环在生产环境中对抗 LLM 幻觉
本文提出了一种“神经符号循环”来解决大型语言模型 (LLM) 在生产应用程序中使用时出现的幻觉问题。文章认为,作为“系统 1”(直观和创造性)的 LLM 需要与“系统 2”(严谨和确定性)的符号求解器和图数据库相结合。所提出的架构强制 LLM 生成的产物(如代码或查询)通过验证过程,以确保在影响生产环境之前具有逻辑和数学上的一致性。文章讨论了使用 TypeScript 实现来自动捕获、解析和纠正 LLM 错误。
-
研究发现:过度依赖AI会削弱批判性思维
越来越多的专业人士过度依赖AI工具,导致批判性思维和基本工作技能下降。一项研究发现,对生成式AI的信心越高,对其输出的批判性评估就越少,角色从任务执行转向监督,但缺乏足够的验证能力。这种被称为“自动化悖论”的现象,在网络安全等领域尤其令人担忧,因为人类判断的丧失可能导致严重后果。
-
消费者对 AI 购物的信任度仍然很低,尤其是对于昂贵的商品
消费者不愿信任 AI 来做重要的购买决定,主要是因为担心收到糟糕的推荐和过度消费。一项调查表明,大多数购物者只会在 25 美元以下且无需自己研究的情况下让 AI 购买,随着价格的上涨,信任度会迅速下降。这种犹豫源于对经济损失的心理厌恶以及对不透明的“黑箱”算法的不信任,即使 AI 提供了自信的回答。提高 AI 数据来源和推理过程的透明度被认为是建立消费者对代理式商业信任的关键因素。
-
人工智能引入第三种思维模式,挑战人类认知
一种新认知理论表明,人工智能在人类直觉和推理之外引入了第三种思维模式。这种“三系统理论”突出了“认知投降”现象,即个人在不经批判性评估的情况下接受人工智能生成的答案。虽然人工智能可以自动化推理任务,但这种转变改变了思维的经济学,如果管理不当,可能会导致组织无意中削弱员工的批判性思维能力。领导者必须通过培养认知增强(人工智能辅助人类判断)或认知放大(人类与人工智能迭代协作)来应对这一挑战。
-
Kahneman和Tversky的可得性启发式解释
可得性启发式的概念,由Kahneman和Tversky描述,表明人们倾向于高估那些更容易回忆或理解的事件的可能性。这种认知偏差影响我们对概率的感知,使其基于心理可得性而非客观频率。
-
System 2 Attention 通过重新生成上下文来提高 LLM 的准确性
System 2 Attention (S2A) 是一种旨在提高 LLM 回答可靠性的新颖技术,它解决了“软注意力”问题,即上下文中不相关或误导性的信息仍然会影响输出。S2A 不直接用可能有噪声的上下文来回答提示,而是首先使用 LLM 本身重新生成一个干净的上下文版本,去除意见、猜测和不相关的句子。然后,将重新生成的上下文用于最终的回答步骤,确保模型只关注相关信息。这个两步过程,灵感来自 Kahneman 的 System 1 和 S…
-
Scott Alexander 反驳自由主义因缺乏幸福感而失败的论点
Scott Alexander 在 Astral Codex Ten 博客上发表的文章,回应了 Cassie Pritchard 关于自由主义因人们尽管取得了前所未有的财富和进步却并未更幸福而失败的论点。Alexander 反驳说,幸福感与收入呈对数关系而非线性关系,这意味着尽管财富大幅增加,但幸福感的相应增长更为温和。他引用 Our World in Data 和 Maddison Project 的数据说明,自中古时代以来收入增加…
-
生成式AI通过认知外包,可能侵蚀人类判断力
闪存和智能手机的广泛采用导致了一种称为认知外包的现象,即个人越来越依赖外部搜索引擎而非内部记忆。生成式AI进一步放大了这种转变,它现在可以检索和综合信息,从而减少了人类搜索的需要。研究人员正在探索“系统0”思维、“认知投降”和“认知殖民化”等概念,以描述对AI进行信息检索和决策的依赖如何可能侵蚀独立判断力,并将AI设计者的意图巧妙地嵌入用户的认知过程中。
-
新的基准测试质疑 LLM 作为裁判的同行评审的可靠性
开发了一个名为 Kahneman4Review 的新基准,用于评估 LLM 作为裁判的同行评审的认知可靠性。该基准包含 3,563 条评分评审,分析了九个文本维度、八个偏见诊断和一个连续的推理质量分数。初步研究表明,LLM 作为裁判可能没有遵循与人类评审相同的标准,公开展示的代理评审得分更高,但这主要是由于长度和展示平台而非内在质量。研究还注意到,随着 LLM 可用性的增加,评审诊断也发生了变化,但尚未确定直接的因果关系。