Mistral 24B
PulseAugur coverage of Mistral 24B — every cluster mentioning Mistral 24B across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
鼓手发布Artemis 31B v1和v1.1,并计划推出共享推理平台
开发者drummer发布了其Artemis 31B模型的两个新版本:v1和v1.1。v1版本以其散文和写作能力而闻名,尽管在口吃等问题上需要一些用户干预。v1.1版本在保持质量的同时提高了稳定性,开发者因社区偏好而发布了这两个版本。开发者还提到了其他成功的微调模型,并正在开发一个类似HordeAI的共享本地推理平台。
-
新基准“TalkFa”发布,用于波斯语对话生成与理解
研究人员推出了 TalkFa,这是一个旨在评估波斯语对话系统的全新基准。该基准包含三个数据集:用于知识驱动生成的 Wiki-FADIAL,用于对话行为和情感的 DAILYDIALOG-FA,以及用于戏剧对话和情感分析的 PLAYDIAL-FA。使用各种 LLAMA 和 Mistral 模型进行的实验表明,LoRA 微调显著提高了对话生成能力,并且 FABERT 和 LORA-MISTRAL-7B 等特定模型在分类任务上表现强劲。该基准…
-
AI 代理提示改进在 4 个模型中因搜索策略缺陷而失败
作者测试了包括 Qwen 4B、Mistral 24B、Mistral 30B 和一个 1B 模型在内的四种不同的语言模型,试图改进一个自改进 AI 代理的提示。尽管进行了数千次 LLM 调用的大量测试,但没有一个模型能够生成可推广的编辑。作者得出结论,问题不在于模型本身的能力,而在于代理所采用的搜索策略,因为所有模型都收敛于相似的、无效的编辑。
-
AI Agent的自我编辑改进未能达到统计晋升阈值
作者详细介绍了改进AI Agent自我编辑提示的努力,重点关注统计验证。v0.1.0的初步测试在26个任务中显示出真实但统计上不显著的改进。随后的v0.2.0工作将任务集扩展到40个并使用了Mistral 24B模型,但该Agent仍未能达到统计晋升阈值。确定的核心问题不在于任务数量,而在于Agent在不引入回归的情况下找到一致改进性能的编辑的能力有限。
-
本地大模型竞技场 #3:GPT-OSS-20B 在 MacBook M4 上领跑基准测试
本地大模型竞技场基准测试的第三轮在 16GB MacBook M4 上测试了五个模型。GPT-OSS-20B 成为综合最佳表现者,提供强大的推理能力以及在波兰语和德语翻译方面的良好表现,速度约为每秒 20 token。Qwen 27B 在波兰语任务和文档理解方面表现出色,但速度明显较慢,约为每秒 3 token。Mistral 24B 在所有测试中均获得满分,表现稳定,而 Gemma 12B 速度很快但经常生成空响应。Bonsai 2…
-
大型语言模型在类似人类的指代消解能力方面表现不一
一篇新研究论文探讨了大型语言模型(LLMs)如何处理指代消解,这是一项语言任务,其中一个词或短语指代另一个词。该研究使用模仿人类认知过程的方法测试了五种开源LLMs——GPT-2 XL、Llama-3.1:8b、Pythia-12B、Mistral:7b 和 Mistral 24B——例如测量模型的“意外度”来近似阅读时间,并将模型的准确性与人类理解力进行比较。研究结果表明,一些LLMs在消解指代时表现出对语篇突出度和距离等因素的类似…
-
新的GRACE-RAG架构改进了机构问答系统
研究人员开发了GRACE-RAG,这是一种新颖的检索增强生成(RAG)架构,旨在改进机构环境中的问答系统。该系统通过将结构化推理外部化到一个专用的检索层,解决了向量检索在复杂、实体密集型领域中的局限性。实验表明,GRACE-RAG通过减少碎片化和计算负载,在包括Mistral 24B和Gemini 2.5 Flash在内的各种模型尺寸上,将响应质量提高了多达20%,而无需依赖专有系统。
-
新的MLIP方法提高了准确性并实现了研究自动化
研究人员正在开发先进的机器学习原子间势能(MLIPs),以改进原子模拟。像Stein Kernelized Molecular Dynamics (SKMD)这样的新方法增强了主动学习的数据采集,从而以更少的迭代次数获得更准确的模型。其他工作探索了MLIPs的笛卡尔张量框架,并引入了像Bond Smoothness Characterization Test (BSCT)这样的新基准,以识别和纠正模型架构中的物理不准确性。此外,LLM…