32B model
PulseAugur coverage of 32B model — every cluster mentioning 32B model across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
如果接受率过低,推测性解码会拖慢大语言模型的速度
推测性解码是一种旨在加速大语言模型推理的技术,但如果配置不当,它会适得其反地降低性能。该方法涉及一个较小的“草稿”模型生成候选 token,然后由较大的“目标”模型进行验证。只有当接受率——目标模型接受的草稿 token 的比例——足够高以抵消草稿模型的计算成本时,这种方法才有效。在一用户的经验中,由于接受率低,一个 32B 的模型速度变慢了 47%,这凸显了根据不同工作负载衡量此接受率并优化草稿长度和模型匹配的重要性。
-
Large language models struggle to identify honest reporters despite detecting liars
Researchers investigated the ability of large language models to detect deception in a corrupted reward channel using a verified record. They found that models, particularly larger ones like the 70B class, were effectiv…
-
LLM调优:聊天模板比量化更重要
最近对本地大型语言模型(LLM)调优的分析显示,聊天模板配置对模型性能的影响远大于量化水平。虽然量化(例如,Q4与Q8)被广泛讨论和量化跟踪,但更改模板可能导致模型无效,在基准测试中得分归零。相反,使用最小的有效量化级别可以释放资源,以实现更快的推理或更大的上下文窗口。
-
LLM框架DeepScrub通过可追溯的推理增强虚假订单欺诈检测
研究人员开发了DeepScrub,一个利用大型语言模型(LLM)检测线上到线下服务中虚假订单欺诈的新框架。该系统将各种风险信号整合到LLM的文本描述中,通过持续预训练增强领域知识,并通过专家反馈优化推理路径。在测试中,DeepScrub取得了85.3%的宏观F1分数,优于现有方法,并且一个较小的8B模型由于有效的领域适应性,表现优于一个较大的32B模型。现场试点显示,精确率和召回率显著提高,大大减少了人工审查工作量并节省了大量成本。