temperature
PulseAugur coverage of temperature — every cluster mentioning temperature across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
语言模型采样参数与增强创造力的物质进行比较
一篇博文将语言模型中的采样参数与影响人类创造力的物质进行了类比。它将温度等参数比作大麻如何改变思维中的过滤机制,从而产生更多不寻常的联想。作者指出,虽然这些参数会影响模型如何选择下一个词,但较新的推理模型正在抽象化对这些设置的直接控制,而是专注于通过计算来增强思维。
-
工程师指南:理解 LLM 的数学之外的行为
本文旨在为工程师提供对大型语言模型(LLM)如何运作的实际理解,侧重于心智模型而非复杂的数学。文章解释说,LLM 本质上是在预测序列中的下一个词元(token),而涌现的智能就源于这个过程数十亿次的重复。文章详细介绍了从提示(prompt)到词元化(tokenization)、模型前向传播(model forward pass)、采样(sampling)和反词元化(detokenization)的推理流程的核心组成部分,以帮助工程师理…
-
LLM采样参数顺序会悄无声息地改变模型输出
temperature、top_k 和 top_p 等采样参数的应用顺序,对大型语言模型的输出有着显著影响。存在两种常见的堆栈顺序:先应用 temperature,然后是 top_k,最后是 top_p;或者先应用 top_k,然后是 top_p,最后是 temperature。在 top_p 之前应用 temperature 会改变 top_p 所测量的累积质量,从而导致不同的 token 选择。这种差异通常是悄无声息的,这意味着由…
-
揭秘 AI:为日常用户解读关键概念
理解人工智能需要掌握几个核心概念,即使没有计算机科学背景。AI 处理文本不是将其视为单词,而是“标记”(tokens),这是定价、内存限制和处理时间的基本单位。“上下文窗口”(context window)定义了 AI 一次可以考虑的文本量,这会影响其回忆对话或文档早期部分的能力。“温度”(temperature)是一个控制 AI 创造性与可预测性之间平衡的设置,较低的设置会产生更保守的输出,而较高的设置会鼓励更具新颖性、有时甚至是无…
-
Anthropic Python SDK v1.0 弃用关键参数,造成文档混乱
Anthropic 发布了其 Python SDK 的 1.0.0 版本,该版本在其 Messages API 中移除了对 temperature、top_p 和 top_k 参数的支持。此更改将于 2026 年 8 月生效,并将最低 Python 版本提高到 3.10,并将 HTTP 层更新到 httpx2。然而,SDK 的文档和 API 参考目前在这些参数方面提供了冲突的信息。API 参考仍将 temperature、top_p …
-
自由意志被比作温度,是一种有用的抽象概念
自由意志的概念可以被理解为类似于温度,它是一种有用的抽象工具,用于分析人类行为等复杂系统。正如温度有助于模拟气体行为,因为精确的原子细节不切实际,自由意志也有助于预测人类行为,因为精确的环境和个人条件并非完全未知。这种观点表明,这两个概念都是理解过于复杂而无法进行完全确定性建模的系统的有用近似。
-
语言模型温度:它如何影响标记选择
文章解释说,语言模型中的“温度”参数实际上并没有增加创造力,而是影响模型选择不太可能出现的标记的意愿。温度在 softmax 函数之前作为除数应用于 logits,softmax 函数将原始分数转换为概率。较低的温度会锐化概率分布,将质量集中在排名靠前的标记上,而较高的温度会使分布变平,从而为排名较低的标记赋予更多权重,但不会改变它们的根本排名。
-
LLM 温度:并非创造力,而是概率分布控制
LLM 温度参数常被误解为创造力旋钮,但它实际上控制着在采样下一个 token 之前如何重塑模型的概率分布。温度为 1.0 时按原样使用分布,而较低的温度会通过偏向更可能的 token 来锐化分布,较高的温度则通过让不太可能的 token 有更大的机会被选中来使分布变平。对于需要正确性的任务,如分类或结构化输出,开发者应默认使用温度 0,仅在需要方差时(如开放式生成)才增加它。
-
LLM温度0的输出因共享请求批次而异
即使语言模型设置为温度0(意味着它应该产生确定性的输出),响应中的差异也可能发生。这不是由于浮点不准确或随机种子。相反,不同的答案源于恰好共享相同处理时间的特定请求批次。
-
LLM 温度:在生产环境中平衡确定性和创造性
大型语言模型(LLM)中的温度参数控制着文本生成过程中 token 选择的随机性。温度为 0 会始终选择最有可能的 token,从而产生确定性的输出;而较高的温度会通过从更广泛的概率范围进行采样来增加随机性。对于生产环境,建议在数据提取和分类等任务中使用较低的温度(0-0.3),在事实问答和摘要等任务中使用中等温度(0-0.5),在营销文案等创意生成任务中使用较高的温度(0.7-1.0)。需要注意的是,即使温度为 0,由于浮点数运算和…
-
LLM 解码策略:贪婪搜索、Beam Search、Sampling、Top-K 和 Top-P 详解
语言模型通过将概率分布转化为 token 序列来生成文本,不同的解码策略会导致不同的输出。贪婪解码在每一步选择最有可能的 token,这可能导致重复的文本。Beam search 保留多个序列以寻找整体上更好的句子,但可能产生平淡的结果。Sampling 方法,如 temperature、top-k 和 top-p(nucleus sampling),引入随机性以生成更多样化和富有创意的文本,现代模型通常将这些技术与重复惩罚相结合。
-
TSCoNet模型对环境变量进行不确定性预测
研究人员开发了TSCoNet,一种结合了CNN和LSTM架构以及高斯Copula的新型两阶段模型,用于对具有不确定性量化的多个相互关联的环境变量进行预测。该方法旨在解决深度学习模型中准确性和不确定性报告之间的权衡问题,特别是对于相关数据。TSCoNet首先生成准确的均值预测,然后优化共享表示以估计预测方差,在不牺牲点准确性的情况下提供校准的预测区间。该模型已在模拟空间场和真实世界的降水及温度数据上进行了评估,证明了其提供精确预测和可靠…
-
大语言模型类比:星系代表语义空间,提示词是入口点
一种新的类比将大语言模型比作夜空中的星系,每个星系代表一个语义空间。用户的提示词既是方向,也是进入其中一个星系的入口点。模型在空间中的遍历受到温度等参数的影响,温度控制着标记(星辰)之间的“跳跃距离”,而上下文则塑造了导航路径。
-
将自由意志概念化为变分自编码器中的一个学习参数
本文提出将自由意志视为一个模型参数,而不是算法的二元状态,类似于变分自编码器(VAE)中的标准差(σ)。与语言模型的温度或强化学习代理的 epsilon(全局且由用户设置)不同,VAE 的 μ 和 σ 是输入相关的并且是学习到的。作者认为,VAE 中用于平衡泛化与过拟合的 KL 散度项代表了灵活性与约束之间的学习平衡,从而将自由意志形式化为每个维度的、学习到的属性。
-
新方法使用环境信号探测地理空间自监督学习表示
研究人员开发了一种新方法来评估地理空间卫星图像中的自监督学习(SSL)表示。该方法不依赖于下游任务,而是使用来自ERA5数据集的共址环境变量(如温度、降水和土壤水分)来探测表示。这使得能够评估SSL模型是否固有地捕捉到与这些物理环境因素的统计关联,从而在任务特定性能之外提供对其能力的更细致的理解。
-
优化 AI API 使用:关键参数与成本节约误区
来自 dev.to 的两篇文章为使用 AI API 的开发者提供了实用建议,重点关注成本优化和性能提升。第一篇文章详细介绍了五个关键 API 参数——temperature、max_tokens、top_p、frequency_penalty 和 stream——这些参数可以提高 AI 应用速度、降低费用并提高输出质量。第二篇文章指出了导致 AI API 成本高昂的三个常见错误:缺乏速率限制、忽略对重复提示的缓存以及为简单任务使用昂贵…
-
LLM 创造力由温度和采样参数控制
LLM 使用温度和采样参数来控制其输出的创造性和可预测性。温度重塑了潜在下一个词的概率分布:低温度(接近 0)倾向于最可能的词,导致确定性和重复性的响应,而较高的温度(大于 1)则使分布变平,让不太可能的词有机会出现,从而产生更具创造性但可能出错的文本。top-k 和 top-p 采样等技术通过修剪概率尾部来进一步优化词语选择,在保持多样性的同时防止出现荒谬的词语选择。最佳设置取决于任务,低温度适用于事实性任务,而较高温度适用于创意性工作。
-
LLM采样:为什么你只应该调整温度或Top-P
文章解释了大型语言模型中温度(temperature)和top-p(nucleus sampling)采样的不同功能,并警告不要同时使用两者。温度会重新调整词元(token)的概率分布,影响所有词元的几率;而top-p通过保留累积概率达到阈值之前最有可能的词元来截断分布。同时使用这两个参数会导致不可预测的交互,并使模型行为的推理变得困难,因为它们的效果并非相互独立,且应用顺序通常无法控制。作者建议选择一个参数进行调整,并将另一个保留在…
-
LLM 采样参数详解:Temperature、Top-P、Top-K 和 Min-P
本文解释了如何有效调整大型语言模型(LLM)中使用的采样参数,以实现期望的输出特性。文章详细介绍了四种常用参数:temperature、top-p、top-k 和 min-p,并解释了每个参数如何修改 token 生成的概率分布。该帖子旨在帮助开发者为其特定用例选择合适的参数,超越可能不适合生产环境的默认设置。