UnslothAI
PulseAugur coverage of UnslothAI — every cluster mentioning UnslothAI across labs, papers, and developer communities, ranked by signal.
-
Alibaba的Qwen3.8-Flash模型可在75GB内存上本地运行,性能超越Claude Opus-4.6
Alibaba的Qwen团队发布了Qwen3.8-Flash,这是一个拥有125B参数的模型,可以在75GB内存上本地运行。据报道,这个新模型在某些指标上优于Claude Opus-4.6。通过Unsloth GGUFs实现的优化,即使在CPU内存或统一内存设置下也能达到接近VRAM的速度。
-
阿里巴巴推出 Qwen3.8-Flash 模型,获广泛合作伙伴支持
阿里巴巴的 Qwen 推出了其 Qwen3.8-Flash 模型,可在 Qwen Cloud 上使用,API 使用价格具有竞争力。该模型也可通过 OpenRouter 访问,支持编码助手和代理工作流等各种应用。此外,Qwen3.8-Flash-Next 已获得 SGLang 和 vLLM 等关键合作伙伴的零日支持,并已在 NVIDIA 和 AMD 硬件上确认兼容。这种新架构旨在实现极致的成本效益,也可通过 Ollama 获取。
-
DeepSeek V4 使用自定义推理引擎在单块 RTX 4090 上高效运行
一位用户成功地在单块 RTX 4090 显卡上实现了 DeepSeek V4 的 flash Q2 量化,并使用了 64 GB RAM。该设置避免了使用 llama.cpp 或 vllm 等常见推理引擎,实现了大约每秒 8 个 token 的速度,由于专家利用需要磁盘读取,速度偶尔会降至每秒 5 个 token。该用户计划发布有关其自定义 ML 编译器和推理引擎 Blaze 的详细信息,该引擎实现了这种高效部署。
-
Alibaba 的 Qwen 27B 模型通过 UnslothAI 在 17GB RAM 上运行
Alibaba 的 Qwen 团队与 UnslothAI 合作,发布了一个拥有 270 亿参数的模型 Qwen3.8-27B,该模型能够以低至 17GB 的 RAM 运行。这一进展使得通过 Unsloth Dynamic GGUFs 在本地执行该模型成为可能。Qwen3.8-27B 因其尺寸而被强调为性能特别强大的模型,同时还提供了新的 NVFP4 量化版本。
-
OpenAI 面临AI代理安全问题;Kimi k3 模型实现本地化
OpenAI 正面临对其AI代理安全性的审查,一些人质疑其安全隔离代理的能力。另外,Kimi k3 模型已实现本地可执行,在大幅减小体积的同时保留了相当一部分的准确性。
-
MiniMax AI 发布开放 M3 模型,拥有 1M 上下文,媲美 Gemini 3.1 Pro
MiniMax AI 发布了其 M3 模型,这是一个拥有 4280 亿参数(230 亿活跃参数)的开放模型,具有 100 万 token 的上下文窗口。该模型性能媲美 Gemini 3.1 Pro,并可通过 UnslothAI 的优化量化方法在本地运行。用户可以在 138GB RAM/VRAM 上使用 2 位 GGUF 或在 165GB 上使用 3 位运行该模型。
-
Fireworks AI 解决了从微调到生产推理的差距问题
Fireworks AI 正在解决将微调模型从开发迁移到生产推理的挑战。在微软的 Build 会议上,该公司代表讨论了模型定制的权衡、服务基础设施的决策以及优化成本和延迟的策略。
-
Mistral 发布 Mistral Medium 3.5 用于视觉推理任务
Mistral 发布了一个名为 Mistral Medium 3.5 的新模型,该模型专为视觉推理任务设计。此次发布通过社交媒体平台宣布,并引导用户访问 Arint.info 获取更多详情。该模型定位在 AI、LLM 和 Machine Learning 领域。