fontange
PulseAugur coverage of fontange — every cluster mentioning fontange across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
论文分析 MoE 路由故障和硬件瓶颈
本文深入探讨了混合专家(MoE)架构的复杂性,特别研究了 Top-K 负载均衡中的故障。文章探讨了这些模型中专家崩溃、路由熵衰减以及硬件层面的通信瓶颈等概念。
-
LLM采样参数顺序会悄无声息地改变模型输出
temperature、top_k 和 top_p 等采样参数的应用顺序,对大型语言模型的输出有着显著影响。存在两种常见的堆栈顺序:先应用 temperature,然后是 top_k,最后是 top_p;或者先应用 top_k,然后是 top_p,最后是 temperature。在 top_p 之前应用 temperature 会改变 top_p 所测量的累积质量,从而导致不同的 token 选择。这种差异通常是悄无声息的,这意味着由…
-
Anthropic Python SDK v1.0 弃用关键参数,造成文档混乱
Anthropic 发布了其 Python SDK 的 1.0.0 版本,该版本在其 Messages API 中移除了对 temperature、top_p 和 top_k 参数的支持。此更改将于 2026 年 8 月生效,并将最低 Python 版本提高到 3.10,并将 HTTP 层更新到 httpx2。然而,SDK 的文档和 API 参考目前在这些参数方面提供了冲突的信息。API 参考仍将 temperature、top_p …
-
新的EAHR方法提高了RAG的准确性和效率
研究人员开发了精确自适应混合检索(EAHR),这是一种新颖的检索增强生成(RAG)系统方法,它超越了固定的Top-L截断。传统的RAG系统通常会截断密集检索器和稀疏检索器的结果,这可能导致排名不准确和成本效率低下。EAHR旨在通过将通道深度视为动态执行状态来实现完整列表的精确融合,确保在不依赖历史查询数据的情况下准确确定Top-K成员资格和顺序。该方法在各种测试集合和语料库快照中表现出一致的准确性,并且在延迟方面显著优于固定深度方法。
-
11 种用于生产与演示环境的 RAG 策略
本文深入探讨了十一种检索增强生成(RAG)策略,区分了适用于生产环境的策略和最适合用于演示的策略。它为实践者提供了关于选择和实施 RAG 技术以有效扩展其管道的实用指导。
-
LLM 解码策略:贪婪搜索、Beam Search、Sampling、Top-K 和 Top-P 详解
语言模型通过将概率分布转化为 token 序列来生成文本,不同的解码策略会导致不同的输出。贪婪解码在每一步选择最有可能的 token,这可能导致重复的文本。Beam search 保留多个序列以寻找整体上更好的句子,但可能产生平淡的结果。Sampling 方法,如 temperature、top-k 和 top-p(nucleus sampling),引入随机性以生成更多样化和富有创意的文本,现代模型通常将这些技术与重复惩罚相结合。
-
研究发现:AI模型系统性地排除类人令牌选择
一篇新研究论文《截断盲点》(The Truncation Blind Spot)发布在arXiv上,揭示了文本生成模型中使用的标准解码策略系统性地排除了类人令牌选择。这些策略,包括top-k、nucleus sampling和contrastive search,倾向于选择统计上更可能的令牌,从而忽略了人类自然使用的、在上下文中恰当但较少见的词语。这种被称为“截断盲点”的现象,在来自GPT-3.5 Turbo和Claude 3 Hai…
-
新研究分析MoE模型校准和不连续性 · 追踪4个来源
两篇新研究论文探讨了专家混合(MoE)模型的复杂性,特别是关于校准和不连续性。第一篇论文研究了专家级校准如何在分布变化下影响MoE性能,并提出了一种对抗性重加权方法来提高软路由模型的准确性和校准性。第二篇论文对稀疏专家混合(SMoE)架构中的不连续性进行了严格的几何和随机分析,发现低阶不连续性占主导地位,并提出了一种平滑机制来增强语言和视觉任务中的连续性和经验性能。
-
LLM 采样参数详解:Temperature、Top-P、Top-K 和 Min-P
本文解释了如何有效调整大型语言模型(LLM)中使用的采样参数,以实现期望的输出特性。文章详细介绍了四种常用参数:temperature、top-p、top-k 和 min-p,并解释了每个参数如何修改 token 生成的概率分布。该帖子旨在帮助开发者为其特定用例选择合适的参数,超越可能不适合生产环境的默认设置。
-
新的 Qrita 算法提高了 LLM 采样效率
研究人员开发了 Qrita,这是一种旨在提高大型语言模型中 Top-k 和 Top-p 采样效率的新型算法。通过采用基于高斯的 sigma 截断和四元枢轴搜索,Qrita 在确保确定性输出的同时,显著减小了搜索空间和内存使用量。这种新方法已被集成到 vLLM 中作为默认采样器,与现有的高性能 LLM 执行引擎相比,服务吞吐量提高了 1.4 倍。
-
新指标揭示LLM采样过滤器压制语言多样性
一项名为词汇覆盖率得分(WCS)的新指标已被引入,用于评估大型语言模型(LLM)的标准采样过滤器如何无意中减少语言多样性。WCS量化了诸如Top-p和Top-k之类的采样方法对上下文适宜的、低频人类词汇的修剪。研究表明,这些默认的采样参数可以充当审查机制,导致文本同质化,并抹平独特的人类表达。