PulseAugur
实时 10:47:19
实体 Qwen2.5-Coder 14B-Instruct

Qwen2.5-Coder 14B-Instruct

PulseAugur coverage of Qwen2.5-Coder 14B-Instruct — every cluster mentioning Qwen2.5-Coder 14B-Instruct across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_62660 ·

    Qwen2.5-Coder 和 DeepSeek-Coder V2 领跑本地编码LLM竞赛

    对于拥有8GB显存的用户来说,Qwen2.5-Coder 7B模型是编码任务的首选,它提供了令人印象深刻的基准分数和一个大的上下文窗口。拥有12-16GB显存的用户则面临权衡:是选择像Qwen2.5-Coder 14B-Instruct这样的密集型14B参数模型,它提供更快的推理速度;还是选择DeepSeek-Coder-V2-Lite,一个每个token激活参数较少的混合专家模型,但由于专业专家可能具有更高的质量。

  2. TOOL · CL_56174 ·

    新的FPMoE模型提升函数式代码生成能力

    研究人员开发了FPMoE,一个旨在改进函数式编程语言代码生成的新型开源模型。与以往在跨语言干扰方面遇到困难或未能捕捉共享抽象的旧方法不同,FPMoE采用了稀疏专家混合架构,为Haskell、OCaml和Scala设有专门的专家,并设有一个用于常见函数式模式的共享专家。这种设计使得FPMoE能够以显著更少的激活参数实现具有竞争力的性能,在FPEval基准测试中表现优于更大的模型。

  3. RESEARCH · CL_70261 ·

    新研究解决大语言模型的事实准确性、架构推断和专业化评估问题

    研究人员正在开发新方法来提高大语言模型(LLM)的准确性和可靠性。Google Research 推出了 SLED(Self Logits Evolution Decoding)技术,该技术利用 LLM 的所有层来增强事实准确性,而无需额外的微调或外部数据。同时,研究也在探索如何通过限制性 API 访问来推断 LLM 的架构属性,并创建新的基准来评估 LLM 在金融服务和编译器问题解决等专业领域的表现。此外,研究还在调查 LLM 集成…