Qwen 2.5 7B Instruct
PulseAugur coverage of Qwen 2.5 7B Instruct — every cluster mentioning Qwen 2.5 7B Instruct across labs, papers, and developer communities, ranked by signal.
-
新的 SomaliBench 基准揭示了开源 LLM 在索马里语方面存在巨大的拒绝差距
一项新的基准 SomaliBench v0 被开发出来,用于评估索马里语(一种低资源语言)中开源语言模型的安全拒绝能力。研究发现,Llama-3.1-8B-Instruct、Aya-23-8B、Qwen-2.5-7B-Instruct 和 Gemma-2-9B-Instruct 等模型在英语和索马里语的拒绝率方面存在显著差距。对于许多模型来说,在索马里语中不拒绝通常会导致输出不清晰或不连贯,而不是直接有害的合规。
-
新研究使用有效秩审计LLM对齐偏移
一篇新研究论文引入了一种“有效秩”审计方法,用于分析对齐技术如何改变大型语言模型的内部工作机制。该研究考察了三个开源模型:Llama-3.1-8B-Instruct、Gemma-2-9B-it 和 Qwen-2.5-7B-Instruct。研究结果表明,虽然有效秩可以指示模型的脆弱性,但它并非安全性的直接衡量标准,也不能保证鲁棒性。
-
新研究解决大语言模型的事实准确性、架构推断和专业化评估问题
研究人员正在开发新方法来提高大语言模型(LLM)的准确性和可靠性。Google Research 推出了 SLED(Self Logits Evolution Decoding)技术,该技术利用 LLM 的所有层来增强事实准确性,而无需额外的微调或外部数据。同时,研究也在探索如何通过限制性 API 访问来推断 LLM 的架构属性,并创建新的基准来评估 LLM 在金融服务和编译器问题解决等专业领域的表现。此外,研究还在调查 LLM 集成…
-
MachinaCheck 自动化数控可制造性分析,支持本地部署AI
一个名为MachinaCheck的新系统已被开发出来,用于自动化数控零件的可制造性评估,将处理时间从一小时缩短到30秒。这个多智能体AI系统利用运行在AMD MI300X硬件上的Qwen 2.5 7B Instruct模型,确保敏感的客户设计数据保留在本地,解决了制造业中的关键隐私问题。该系统解析STEP文件以提取几何特征,然后使用LLM确定所需的数控操作和工具,并提供一份全面的报告。