实体
Decoder-only streaming transformer for simultaneous translation
Decoder-only streaming transformer for simultaneous translation
PulseAugur coverage of Decoder-only streaming transformer for simultaneous translation — every cluster mentioning Decoder-only streaming transformer for simultaneous translation across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
小型语言模型展示出有限的可迁移抽象推理能力
一项发表在arXiv上的新研究调查了小型语言模型的抽象推理能力,特别考察了decoder-only、encoder-decoder和mixture-of-experts架构。研究利用ARC-TGI基准来分析这些模型如何习得可迁移规则,而非拟合训练数据的特异性。研究结果表明,虽然可以实现相当大的in-distribution准确率,但模型的性能高度依赖于优化、训练数据广度和评估分布,在训练集之外通常会急剧下降。
-
MoE模型获得更智能的剪枝、检索和推理效率
研究人员正在探索用于混合专家(MoE)语言模型的先进技术,以提高其效率和性能。一篇论文介绍了HOPE(Higher-Order Pruning of Experts),一种考虑专家协同交互的新型剪枝目标,在稀疏率较高和复杂代理任务上表现优于现有方法。另一项研究表明,MoE模型可以作为强大且高效的信息检索系统,在激活参数较少和编码时间较短的情况下优于密集模型。此外,一个名为DynaExq的系统在推理过程中动态量化专家,以管理单GPU上的…