Qwen3.5-4B-Base
PulseAugur coverage of Qwen3.5-4B-Base — every cluster mentioning Qwen3.5-4B-Base across labs, papers, and developer communities, ranked by signal.
-
AMD 发布拥有 2.8B 激活参数的开源 Instella-MoE-16B LLM
AMD 发布了 Instella-MoE-16B-A3B,这是一款开源的专家混合(Mixture-of-Experts)语言模型。该模型拥有 160 亿总参数,但每个 token 仅激活 28 亿参数,利用了门控多头潜在注意力(Gated Multi-head Latent Attention)和 FarSkip-Collective 连接等架构创新,以提高训练和推理速度。虽然训练代码采用 MIT 许可且高度可重用,但模型权重是在 R…
-
AMD发布在自家GPU上训练的开源Instella-MoE AI模型
AMD发布了Instella-MoE,这是一款使用其自有GPU和软件开发的新型开源混合专家(Mixture-of-Experts)语言模型。该模型有多种形式可供选择,包括预训练、中度训练和微调版本,其训练代码和框架也公开可用。Instella-MoE拥有160亿总参数和28亿活跃参数,在某些基准测试中表现出竞争力,尤其超越了Gemma-4-E4B。
-
新的LKValues资源将大型语言模型与斯里兰卡社会价值观对齐
研究人员开发了LKValues,这是一个新的资源套件,旨在将大型语言模型(LLMs)与斯里兰卡的特定社会价值观对齐。现有的基准通常反映西方规范,未能捕捉到像斯里兰卡这样的多语言国家独特的文化动态。LKValues包括一个基于调查的资源套件、一个僧伽罗语和英语的指令语料库以及一个评估基准,以弥补这一差距。对包括Qwen系列模型微调在内的各种LLMs进行的实验表明,LKValues可以改善文化价值观的对齐并减少跨语言差异,为低资源、特定国…
-
新的PMC-InterCPT数据集增强了生物医学多模态模型
研究人员开发了PMC-InterCPT,一个旨在改进生物医学应用多模态模型的新数据集。该数据集通过在图注旁边加入相关的文章周围文本,解决了现有图文对的局限性。该流程清理并重建了交错的图文样本,使用LLM监督分类器来过滤质量和医学相关性,并通过重采样解决了模态不平衡问题。