PulseAugur
中
实时 08:11:15
实体 DeepSeek-Qwen-32B

DeepSeek-Qwen-32B

PulseAugur coverage of DeepSeek-Qwen-32B — every cluster mentioning DeepSeek-Qwen-32B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_273402 ·

    Gemma-2-2B 在叙事填空基准测试中表现优于更大的大型语言模型

    引入了一个新的叙事填空基准测试,旨在评估大型语言模型(LLMs)在故事中重建缺失句子的能力。该基准测试包含四种叙事类型,约9.2K个实例,用于测试20个开源LLMs。出人意料的是,模型规模与性能不相关;Gemma-2-2B 获得了最高的定性分数,超越了 DeepSeek-Qwen-32B 和 LLaMA-3.3-70B 等更大的模型。明确的推理技术仅提供了边际改进,表明叙事特征和长度是当前LLMs任务难度的更重要因素。