由前OpenAI首席技术官Mira Murati创立的实验室Thinking Machines发布了Inkling,这是一个具有原生音频处理能力的开源模型。这个拥有9750亿参数、410亿活跃参数的模型可以直接处理文本、图像和音频,无需外部编码器,这是以前只有闭源模型才具备的功能。虽然Inkling在理解音频、转录语音和处理语音指令方面表现出色,但目前它只能以文本形式响应,而非合成语音。该模型在AudioMC等基准测试上的表现远超开源竞争对手,尽管闭源模型在整体能力上仍处于领先地位。 AI
影响 通过提供一个具有原生音频理解能力的开源模型,此次发布可能会加速多模态AI应用的开发,尽管其缺乏音频输出限制了即时的语音交互用例。
排序理由 来自知名实验室(前OpenAI首席技术官)的开源模型发布,具有新颖的原生音频处理能力。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
- ChatGPT
- DeepSeek V3
- Gemini
- Gemini 3.1 Pro
- GPT-4
- GPT-4o
- Hugging Face
- Inkling
- Mira Murati
- OpenAI
- Qwen3-Omni
- Thinking Machines
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →