实体
Falcon-H1
Falcon-H1
PulseAugur coverage of Falcon-H1 — every cluster mentioning Falcon-H1 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的阿拉伯语问答基准旨在检测大型语言模型的幻觉
研究人员推出了 HalluTruthQA,这是一个新的细粒度基准,旨在评估阿拉伯语问答大型语言模型中的幻觉检测、定位和解释能力。该基准包含 2,400 个专家策划的跨四个领域的示例,提供详细的注释,包括字符级别的错误跨度以及针对错误答案的人工编写的解释。对四个开源大型语言模型的评估显示,它们在不同任务上的表现各不相同,表明当前模型在全面的幻觉评估方面存在困难,突显了超越简单检测、转向更细致评估的必要性。
-
组件感知自推测解码提升混合语言模型推理效率
研究人员开发了一种名为组件感知自推测解码的新方法,提高了混合语言模型的效率。该技术利用了这些模型内部的架构差异,特别是分离 Mamba-2 和线性注意力等子图以加快草稿生成。这种方法的有效性因模型的架构而异,并行混合模型的性能提升远高于顺序模型。