Mistral-7B-Instruct
PulseAugur coverage of Mistral-7B-Instruct — every cluster mentioning Mistral-7B-Instruct across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
研究发现大型语言模型存在显著的社会和区域刻板印象 · 已追踪2个来源
两篇新研究论文探讨了大型语言模型(LLMs)如何编码和延续刻板印象。第一篇论文STEREODISCO使用了一个改编自社会心理学的框架来识别LLM内部表征中的刻板印象轴,发现LLaMA-3-8B-Instruct和Mistral-7B-Instruct等模型在社会群体刻板印象上比人类感知更一致。第二篇论文引入了刻板印象到决策(S2D)框架来评估LLM中的区域偏见,特别关注中国,并揭示这些模型在感知温暖度和能力方面存在系统性区域偏见,这与…
-
新的剪枝方法可保留LLM推理性能
研究人员开发了一种名为因果归因剪枝(CAP)的无训练新方法,可在不损害其推理能力的情况下减小大型语言模型的规模。CAP通过衡量注意力头对推理任务的因果影响来识别和剪枝不那么关键的注意力头。与Wanda等现有方法相比,该方法在ARC-Challenge等基准测试上表现出显著的改进,并在中等稀疏度水平下对Llama-3和Mistral-7B-Instruct等模型显示出潜力。
-
新方法改进会议记录中的主题-时间戳对齐
研究人员开发了一种新方法,用于将自然语言主题与长会议记录中的特定时间戳对齐。该方法将时间戳预测重构为一种受约束的时间候选选择过程,系统从中选择最相关的时间戳记录片段,而不是生成时间码。这项技术显著提高了时间戳预测的召回率并降低了平均绝对误差,即使在使用 Mistral-7B-Instruct 等模型时也是如此,这凸显了检索质量和输出设计的重要性,而不仅仅是语言模型选择。
-
LLM通过提示工程在代码提交分类中实现高准确率
研究人员探索了使用大型语言模型(LLM)对常规提交进行分类,而无需进行模型微调。他们评估了在Mistral-7B-Instruct、LLaMA-3-8B和DeepSeek-R1-32B模型上的零样本、少样本和思维链提示策略。研究发现,少样本提示产生了最高的准确率,DeepSeek-R1-32B模型表现最佳,这表明更大的模型在此任务上更有效。
-
LLM的可回答性由早期层的几何偏差发出信号
研究人员开发了一种新方法,可以在大型语言模型生成响应之前预测其是否能回答问题。该技术分析了模型内部表示的几何偏差,发现无法回答的数学查询显示出独特的模式。该信号在模型的早期层中最强,并且似乎是形式条件性的,在数学和代码提示上表现良好,但在事实性提示上则不然。