PulseAugur
实时 04:40:06
实体 DeepSeek-R1-Distill

DeepSeek-R1-Distill

PulseAugur coverage of DeepSeek-R1-Distill — every cluster mentioning DeepSeek-R1-Distill across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_213136 ·

    大型语言模型简洁提示可省钱,缩短输入提示成本更高

    一项新研究发现,指示大型语言模型(LLM)在输出时保持简洁,可以在不影响准确性的情况下显著降低成本。该研究测试了包括 OpenAI、Anthropic 等公司模型在内的九种不同大型语言模型,结果显示平均节省成本 1.5 倍,在某些情况下甚至高达 3 倍。相反,缩短输入提示被证明是适得其反的,会导致成本增加和准确性下降,因为模型会试图弥补丢失的信息。研究还指出,虽然简洁的输出通常是正确的,但它们并不总是能反映模型不受限制的推理过程。

  2. TOOL · CL_32717 ·

    新的 KV 缓存压缩方法 alpha 优于现有技术

    研究人员开发了一种新的 KV 缓存压缩方法 alpha,它使用多样性惩罚幸存者方法。在数学推理任务的设计空间研究中,该方法被发现优于其他七种机制。alpha 方法只有一个可调权重,在特定的模型和预算组合上取得了显著成果,突显了最小评分修改比更重的结构性更改更有效。