C Eval Benchmark
PulseAugur coverage of C Eval Benchmark — every cluster mentioning C Eval Benchmark across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
MetaNet 优化 MoE 模型,通过动态调整专家激活
研究人员开发了 MetaNet,一种新颖的方法来优化专家混合(MoE)模型,通过根据任务难度动态调整每层的激活专家数量。该方法可以显著降低计算负载,平均激活更少的专家,同时在 MMLU 和 C-Eval 等基准测试中保持可比的性能。例如,MetaNet 可以将专家激活减少多达 62%,而准确度仅略有下降,并且学习到的控制器在无需重新训练的情况下可以迁移到新任务。
-
Qwen3-0.6B-Base模型在注意力线性化中遭受“接口损伤”
研究人员在Qwen3-0.6B-Base语言模型注意力层线性化中发现了一个特定问题,模型过度依赖答案标签而非内容。尽管通过蒸馏实现了与原始模型接近的困惑度,但线性化版本在多项选择任务上表现不佳,持续偏好第一个选项。有针对性的KL蒸馏阶段成功修复了这种“接口损伤”,显著提高了基准准确性并降低了标签粘滞性。
-
DeepSeek、GLM 和 Qwen:免费API使用的中国LLM对比
三家领先的中国AI实验室,DeepSeek、智谱AI(GLM)和阿里云(Qwen),提供强大的免费LLM API,可满足不同的项目需求。DeepSeek-V2 采用混合专家模型(Mixture-of-Experts)架构,提供最慷慨的免费每日配额,并在长上下文推理方面表现出色,非常适合高流量、成本敏感型项目。GLM-4 是一款密集型Transformer模型,在中文任务和工具调用方面表现优越,适用于面向中国市场的应用。Qwen2.5-…
-
新框架指导LLM层更新以实现高效的预训练
研究人员开发了LayerTracer,一个用于指导大型语言模型层在持续预训练过程中选择性更新的新框架。该方法分析层的表示演变和敏感性,以识别哪些层对于任务执行和稳定性至关重要。实验表明,与全参数微调或反向策略相比,冻结深层而训练浅层在C-Eval和CMMLU等基准测试上能带来更好的性能。
-
新的K-12知识图谱基准测试大型语言模型课程认知
研究人员开发了K12-KGraph,一个新颖的知识图谱,旨在专门评估和训练K-12教育领域的大型语言模型(LLMs)。该图谱源自官方教材,捕捉了课程结构,包括先决条件和概念关系,超越了简单的事实回忆。为了支持这一点,他们创建了K12-Bench(一个包含23,640个问题的基准测试集)和K12-Train(一个微调数据集)。实验表明,当前的大型语言模型在课程认知方面存在困难,而K12-Train数据集在教育基准测试上显著提高了性能,且样本效率高。