MCqasim
PulseAugur coverage of MCqasim — every cluster mentioning MCqasim across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
语音到SFT管道消融研究揭示数据质量提升不总能促进下游性能
一篇新发表在arXiv上的研究论文详细介绍了一个语音到SFT管道的因子消融研究,调查了不同精炼阶段对数据质量和下游模型性能的影响。研究发现,虽然QA数据质量的提高持续提高了LLM评估者的得分,但这些收益并未均匀地转化为下游选择题QA基准测试的更好性能。改进的积极迁移集中在与家庭领域对齐的配对上,这表明SFT数据组成与MCQA探针的性质之间可能存在格式不匹配。
-
新的GGC框架通过选择性校正提高文本到SPARQL的准确性
研究人员推出生成器-门控器-校正器(GGC)框架,该框架旨在提高基于大型语言模型的文本到SPARQL生成的可靠性。GGC首先生成查询,然后由门控器判断是否需要校正,最后校正模块仅优化高风险查询。这种选择性方法提高了准确性和效率,将查询级准确率从90.23%提高到98.33%,同时与校正所有查询相比,推理开销降低了45%。
-
新指标揭示LLM在MCQA任务中的个性化生成不稳定
研究人员开发了新的指标来评估大型语言模型(LLM)在多项选择题问答(MCQA)任务中个性化生成(PDGs)的不稳定性。他们的发现表明,不稳定性因模型家族、大小和问题领域而异,其中数学和常识性问题表现出更大的不稳定性。研究还发现,任务提示格式对预测不稳定性有显著影响,其影响程度超过了温度等超参数。此外,研究强调了不稳定性与任务准确性之间的关系,表明特定的实验设置可能导致给定任务的最佳和最差表现的个性化生成截然不同。
-
研究比较了法语医疗问答大语言模型适配方法
一项新近发表在arXiv上的研究,以法语医疗问答为案例,探讨了将大语言模型(LLMs)适配到特定领域和语言的各种方法的有效性。该研究分别并组合比较了持续预训练(CPT)和监督微调(SFT)在不同模型家族和规模上的表现。研究结果表明,对于选择题,CPT+SFT通常能产生最佳结果,尽管单独使用SFT也是一种成本效益高的方法。对于开放式问题,CPT可以改善基于重叠度的指标,而SFT可能会降低质量,其中指令微调和CPT+SFT在基于大语言模型…