Ollama 发布了 v0.33.3-rc2 版本,为 Gemma4 模型引入了图像和音频输入支持。此次更新利用 MLX 引擎处理多模态输入,其中图像由 Transformer 塔和统一嵌入器架构处理,音频则通过一个接受 WAV 字节和音频转录的专用输入通道处理。系统会智能地将模态路由到兼容的检查点,确保没有特定音频或视觉功能的模型仅作为文本模型运行并拒绝不支持的输入类型。 AI
影响 增强了本地 AI 模型部署的多模态能力。
排序理由 这是用于集成 AI 模型的工具的软件发布,而不是前沿模型本身的发布。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →