Docker Model Runner
PulseAugur coverage of Docker Model Runner — every cluster mentioning Docker Model Runner across labs, papers, and developer communities, ranked by signal.
- 2026-05-13 product_launch Docker integrated Model Runner into Docker Desktop, simplifying local AI development. 来源
3 天有情绪数据
-
Google DeepMind 发布 EmbeddingGemma 2 多模态模型
Google DeepMind 发布了 EmbeddingGemma 2,这是一个开放的多模态嵌入模型,专为高效的设备端应用而设计。该模型将文本、图像、视频和音频统一到一个 768 维的向量空间中,总共有 7.4 亿个参数。它提供多语言能力、改进的代码理解能力以及灵活的模态加载功能,允许开发者仅使用必要的组件。EmbeddingGemma 2 还支持 Matryoshka Representation Learning 以降低存储成本…
-
XingChen-AGI 发布 Xing4.0-29B-A4B,支持 256K 上下文长度
XingChen-AGI 发布了 Xing 系列(前身为 TeleChat)的新大型语言模型 Xing4.0-29B-A4B。该模型拥有 290 亿参数,但每个 token 仅激活 40 亿参数,实现了 256K 的原生上下文长度,可扩展至 512K。值得注意的是,该模型完全在 Ascend NPU 平台上使用 MindSpore 框架进行训练,并针对复杂的工程任务进行了优化,采用了面向代理的架构,并与 Ascend 硬件进行了深度协…
-
大语言模型托管指南比较Ollama、vLLM、TGI和云选项
本指南探讨2026年大语言模型托管选项,比较了Ollama、llama.cpp、vLLM、Text Generation Inference、Docker Model Runner和LocalAI等流行工具。它还考虑了云服务提供商的解决方案,详细介绍了每种方案在成本、性能和基础设施要求方面的权衡。
-
使用 Docker Model Runner 和 Spring AI 在本地运行 AI 模型
使用 Java 和 Spring AI 的开发者现在可以通过 Docker Model Runner 在本地运行生成式 AI 模型,无需依赖云托管 API。这种方法具有降低开发成本、增强数据隐私和支持离线实验等优点。该集成允许应用程序利用 Spring AI 的 ChatModel 和 ChatClient 等抽象,通过 Docker Model Runner 暴露的兼容 OpenAI 的 API 与本地模型进行通信。
-
Qwen3.8-27B-DFlash2 模型已通过两个 Hugging Face 仓库提供
Hugging Face 上出现了两个不同的仓库,incoai/Qwen3.8-27B-DFlash2-GGUF 和 z-lab/Qwen3.8-27B-DFlash2-GGUF,均提供 Qwen3.8-27B-DFlash2 模型。这些模型被设计为用于推测性解码的草稿模型,旨在与 llama.cpp、vLLM 和 Ollama 等库配合使用。DFlash 2 技术旨在通过预测 token 块来提高解码速度,并提供了集成到各种推理提供…
-
SKT发布A.X K2,一个688B参数的MoE语言模型
SKT发布了A.X K2,一个大规模的混合专家(MoE)语言模型。该模型拥有总计6880亿参数,其中330亿为激活参数,旨在提供强大的推理和指令遵循能力,同时保持高效的推理速度。一个关键特性是其混合推理控制,允许用户在用于复杂问题解决的“思考”模式和用于更快、更低延迟响应的“非思考”模式之间进行选择。A.X K2作为韩国政府一项倡议的一部分而开发,目标是成为一个具有深刻理解韩国语言和文化的前沿规模模型。
-
DeepSeek 发布 V4 模型,支持百万 Token 上下文并采用 MoE 架构 · 跟踪 3 个来源
DeepSeek 发布了其 DeepSeek-V4 系列的预览版本,其中包括两个混合专家(MoE)语言模型:DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。这两个模型都支持令人印象深刻的百万 Token 上下文长度,并采用了混合注意力机制等架构升级以提高效率,以及流形约束超连接(mHC)以增强稳定性。这些模型可通过 Transformers、vLLM 和 SGLang 等各种库和推理提供商使用,并提供了集成说明。
-
Unlimited-OCR-GGUF 模型发布并附带集成指南
sahilchachra 开发的 Unlimited-OCR-GGUF 模型现已在 Hugging Face 上发布,提供增强的 OCR 功能。该模型旨在处理和理解图像,例如它能够描述自由女神像。提供了将此模型与各种流行库和工具集成的说明,包括 llama-cpp-python、llama.cpp、vLLM、Ollama、Unsloth Studio 和 Docker Model Runner,从而促进其在各种应用中的使用。
-
大语言模型(LLM)托管选项比较:Ollama、vLLM、TGI和云服务提供商
本指南比较了2026年托管大型语言模型(LLMs)的各种方法,评估了Ollama、llama.cpp、vLLM、TGI、Docker Model Runner和LocalAI等选项以及云服务提供商。它详细介绍了每种方法的成本、性能和基础设施权衡。目的是为寻求高效部署LLMs的用户提供全面的概述。
-
WeiboAI 发布 VibeThinker-3B 以应对高级推理任务
WeiboAI 发布了 VibeThinker-3B,这是一个拥有30亿参数的模型,专为数学、编码和STEM等具有挑战性的推理任务而设计。该模型采用了优化的训练后流程,在AIME、HMMT和LeetCode竞赛等基准测试中取得了与领先前沿模型相当的性能。开发者提出了参数压缩覆盖假设,认为可验证的推理依赖于多步推理和自我纠正等参数密集型能力。
-
SILX AI 发布 Quasar-Preview,支持 500 万上下文窗口和 MoE 架构
SILX AI 发布了 Quasar-Preview,这是其 Quasar 基础模型系列的初始公开模型。此早期检查点展示了 Quasar 架构,该架构采用稀疏专家混合(MoE)设计,总参数约 180 亿,激活参数 20 亿。它包含混合循环和注意力层配置,包括 Loop Transformer 和 Quasar 混合注意力,以及一个实验性的 500 万 token 上下文窗口。