DeepInfra
PulseAugur coverage of DeepInfra — every cluster mentioning DeepInfra across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
AI系统管理员警告:LLM价格摘要可能具有误导性
一位名为Väinämöinen的AI系统管理员在Pulsed Media工作,在比较API摘要中的LLM价格时遇到了差异。这些摘要汇总了不同提供商的数据,导致比较不准确,因为最便宜的价格和最长的上下文长度可能并非由同一提供商提供。Väinämöinen发现,使用每个提供商的API端点对于获取准确的定价和上下文长度信息至关重要,因为聚合列表视图可能具有误导性。这次经历凸显了查阅特定提供商的数据,而不是仅仅依赖汇总目录信息的重要性。
-
DeepSeek API 2026年定价:高峰/非高峰计费及国际访问
DeepSeek 2026年的API定价采用高峰和非高峰计费模式,高峰时段成本翻倍。国际用户因官方平台要求提供中国手机号和人民币支付而面临挑战。第三方网关通过提供与OpenAI兼容的端点并接受国际支付方式来解决这些问题,简化了全球开发者的访问。
-
MiniMax API 定价已澄清,转售商价格基本与官方一致
MiniMax 针对其 M3 和 M2.7 模型的 API 定价已得到澄清,显示 M3 的标准费率为每百万输入 token 0.30 美元,每百万输出 token 1.20 美元,并声明永久享受比更高标价低 50% 的折扣。缓存读取成本显著降低,每百万 token 仅需 0.06 美元(针对 M2.7),而缓存写入的成本高于标准输入。对于 M3 超过 512K token 的扩展上下文窗口的定价结构目前处于受限层级,需要联系销售人员;…
-
Kimi K2 模型定价在不同平台间差异巨大,影响总成本
Moonshot 的 Kimi K2 模型定价在不同平台之间存在显著差异,同一模型变体的输出成本每百万 token 价格从 3.20 美元到 4.50 美元不等。这种价格差异是由于该模型通过多层渠道转售,每一层都会增加自己的利润。具体模型变体(例如,通用用途的 Kimi K2.6 与代码任务的 Kimi K2.7-code)和使用的平台等因素,都可能导致成本上的巨大差异。此外,对于重复使用上下文的工作负载至关重要的缓存输入 token…
-
多家LLM提供商调整定价,Narev Bot 报道 · 跟踪10个来源
Narev Bot 报道了多家提供商的LLM定价发生的多项变动。这些更新包括对百度、GMICloud、StreamLake、腾讯、阿里巴巴集团、Relace、Inceptron、Io Net、Novita、DeepSeek 和 Morph 的调整。这些报告发布于9月9日,表明这些实体的模型价格已被更改。
-
Hugging Face 模型路由器在 14 家提供商之间分配模型
Hugging Face 的 Inference Providers 路由器会动态地将模型分配给各种后端提供商,但具体提供商并不总是对用户显而易见。最近的检查发现 14 家提供商中有 135 个模型,其中像 'openai/gpt-oss-120b' 这样的模型由多达 11 家不同的提供商提供服务。这种动态路由意味着用户可能并不总是为给定模型使用最快或最合适的提供商,因为同一模型权重的性能在不同提供商之间可能存在显著差异。用户可以通过…
-
开发者寻求 Hugging Face 的替代方案,Together AI 和 Groq 等平台日益受到关注
随着 Hugging Face 面临用户不满,开发者们正在探索用于托管和运行大型语言模型的替代平台。主要竞争者包括 Together AI 和 Fireworks AI,它们提供与 OpenAI 兼容的 API,并为 Llama 3.3-70B 等模型提供有竞争力的定价。对于那些优先考虑特定模型速度的用户,Groq 是一个亮点,而 RunPod 则为喜欢自行管理服务堆栈的用户提供最便宜的原始 GPU 访问。其他选项,如 OpenRou…
-
TokenPAPA 提供比 DeepInfra 更广泛的中文 LLM 访问
TokenPAPA 和 DeepInfra 提供经济高效的 LLM API 访问,但在模型覆盖范围和目标受众方面有所不同。DeepInfra 在以低廉的价格提供 Llama 和 Mistral AI 等广泛的开源西方模型方面表现出色,并提供简单的定价和自动扩展功能。TokenPAPA 则通过提供 DeepSeek V4、Qwen 3.7 和 Minimax M3 等独家中文模型,以及 GPT 5.6 Luna 和 Claude 等西方…
-
Hugging Face 聚焦多样化的AI工具和项目
Hugging Face 通过其博客展示了各种AI项目和工具。最近的帖子包括来自TII UAE的Falcon Perception、DeepInfra作为推理提供商的角色,以及Hcompany的AI浏览器合作伙伴HoloTab。此外,还展示了OpenAI的Web应用隐私过滤器、nunchaku的4位扩散推理集成到diffusers中,以及Baseten宣布成为Hugging Face推理提供商。
-
Kimi K3 访问成本对比:OpenRouter 最便宜,Moonshot/DeepInfra 适合缓存命中
对四个访问 Kimi K3 大语言模型的平台进行的比较显示,根据使用模式的不同,价格差异显著。OpenRouter 以每百万 token 2.60 美元/13 美元的价格成为最便宜的 API 选择,而 Moonshot AI 的直接 API 和 DeepInfra 为缓存命中提供了更低的价格,成本降低了 90%,降至每百万 token 约 0.30 美元。Ollama Cloud 采用 GPU 时间计费模式,每 token 成本不透明…
-
OpenRouter替代品:TokenPAPA在中文大模型方面领先,Groq在速度方面领先
多个平台提供了访问大语言模型的OpenRouter替代方案,各有优势。TokenPAPA因其以有竞争力的价格访问DeepSeek V4 Flash和Mimo V2.5等中文大模型,以及简化的注册流程而受到关注。DeepInfra被认为是开源模型经济实惠的选择,而Together AI则提供更全面但价格更高的全栈解决方案,包括微调。Groq凭借其LPU硬件专注于速度,适用于延迟敏感的应用,而Fireworks AI则提供了快速服务和微调能力的结合。
-
阿里巴巴的Qwen3.8-2.4T-A95B模型在多个平台上线
阿里巴巴的Qwen团队发布了其Qwen3.8-2.4T-A95B模型,这是一款拥有2.4万亿总参数和950亿激活参数的大型稀疏混合专家模型。该模型现已通过多个平台提供,包括DeepInfra、DigitalOcean Serverless Inference、Modal和Nebius Token Factory,合作伙伴强调开发者可即日使用。Qwen3.8-Max版本拥有100万个token的上下文窗口,非常适合长时程编码和复杂推理任务。
-
蚂蚁集团 Ling 3.0 Flash 模型发布,支持本地部署
蚂蚁集团 inclusionAI 推出的 Ling 3.0 Flash,一个拥有 124B 参数的混合专家模型,已获得 MIT 许可并在 Hugging Face 上发布。该模型专为本地运行而设计,由于其每个 token 只激活 5.1B 参数的架构,相比 Kimi K3 等其他大模型,所需的内存显著减少。它支持长上下文的混合线性注意力,并默认支持推理,也可选择禁用推理以获得更快的响应。该模型可以在拥有 96GB 统一内存的 Mac …
-
Hugging Face 重点介绍新的推理提供商和 AI 工具 · 跟踪 4 个来源
Hugging Face 正在重点介绍几家正在增强其推理能力的公司和项目。DeepInfra 已被列为推理提供商,而 Hcompany 的 HoloTab 被介绍为 AI 浏览器合作伙伴。此外,Nunchaku 的 4 位扩散推理已集成到 diffusers 中,Baseten 也被宣布为该平台的推理提供商。
-
阿里巴巴发布Qwen3.8模型,增强编码和智能体能力 · 跟踪1个来源
阿里巴巴发布了其新的Qwen3.8大模型,在编程和智能体能力方面有了显著提升,使其跻身全球顶级模型之列。该模型支持100万token的上下文窗口和视觉理解,在编码和视觉基准测试中表现强劲。发布后,包括OpenRouter和Vercel在内的众多国际AI平台已集成Qwen3.8,从而促进了更广泛的开发者使用和在企业场景中的应用。阿里巴巴计划下周开源Qwen3.8-Max和Qwen3.8-27B,进一步扩大其已有的庞大开源模型生态系统。
-
Hugging Face 博客文章涵盖 AI 智能体、推理和批处理 · 跟踪 3 个来源
此集群汇总了来自 Mastodon 的三篇帖子,每篇都链接到一篇 Hugging Face 博客文章。第一篇帖子讨论了 Vakra 的内部工作原理,重点关注 IBM Research 详细介绍的智能体推理、工具使用和失败模式。第二篇帖子重点介绍了 DeepInfra 对 Hugging Face 推理提供商的看法。第三篇帖子探讨了在连续批处理中异步的使用。
-
苹果将与Klarna合作推出设备租赁服务“Apple Upgrade”
据报道,Apple 计划于7月28日推出一项名为“Apple Upgrade”的新设备租赁服务。该计划将涵盖 iPhone、Mac、iPad 和 Apple Watch 的各种型号,标志着 Apple 硬件销售策略的潜在转变。该公司预计将与金融科技公司 Klarna 合作,为该租赁计划提供融资。
-
Hugging Face 博客文章涵盖 Vakra AI、DeepInfra 和异步处理 · 跟踪 3 个来源
该集群重点介绍了 Hugging Face 的几篇技术博客文章,涵盖了各种 AI 主题。其中一篇深入探讨了 Vakra(一种 AI 智能体)的内部工作原理,检查了其推理、工具使用和失败模式。另一篇文章介绍了 DeepInfra 在 Hugging Face 平台上的推理提供者角色。最后,第三篇文章探讨了连续批处理中异步的复杂性。
-
Hugging Face博客文章涵盖AI代理内部机制、推理提供商和异步处理 · 跟踪3个来源
该集群重点介绍了来自Hugging Face的三个技术博客文章,每篇文章都侧重于AI基础设施和研究的不同方面。第一篇文章深入探讨了AI代理Vakra的内部工作原理,检查其推理、工具使用和故障模式。第二篇文章介绍了DeepInfra,讨论其在Hugging Face上作为推理提供商的角色。最后,第三篇文章探讨了连续批处理中异步处理的复杂性。
-
Cursor IDE 用户探索集成自定义 API 和模型
Reddit 的 r/cursor 子版块上一名用户正在询问是否可以将自己的 API(特别是通过 DeepInfra 驱动的 DeepSeek V4 Flash API)集成到 Cursor IDE 中。他们希望通过使用现有的模型访问权限来完成编码任务,从而避免 Cursor Pro 的额外订阅费用。