OpenAI GPT OSS 120B
PulseAugur coverage of OpenAI GPT OSS 120B — every cluster mentioning OpenAI GPT OSS 120B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
使用真实提示词测试 LLM 护栏的有效性
最近的一项实验通过评估一个包含输入分类器、核心模型(openai/gpt-oss-120b)和输出分类器的系统来测试 LLM 护栏的有效性。测试涉及 34 个提示词,分为良性、边缘良性和越狱尝试。实验发现,护栏可能过于严格,会阻止合法的查询,并且策略本身是实现有效安全的关键要素。
-
Groq 的免费套餐按声明的 token 计费,而非生成的 token,导致错误
Groq 的免费套餐根据用户请求中声明的最大 token 数收费,而不是实际生成的 token 数。如果声明的 `max_tokens` 设置得很高,即使是小型提示也可能导致“请求过大”的错误。计费基于所有模型共享的每分钟 8,000 个 token (TPM) 预算,这意味着一次大的声明可能会消耗掉一整分钟的额度。这种行为对 AI 代理尤其成问题,因为它们经常在提示中包含工具模式,导致意外的 token 消耗和错误。
-
Groq API 的模型列表包含非聊天模型和隐藏的令牌限制
对 Groq API 模型列表的审查发现,十四个已宣传的模型中有五个无法进行聊天补全。这些非聊天模型包括语音转文本和文本转语音变体,以及一个错误地将自身标识为 OpenAI GPT OSS 120B 的路由器模型。此外,一些模型存在无法发现的输出令牌限制,例如 llama-prompt-guard 模型最多需要 512 个令牌,而 allam-2-7b 模型需要 4096 个令牌,这些在模型列表中并未标明。
-
Groq API 速率限制错误地基于声明的 max_tokens 来阻止请求
使用 Groq API 的开发者遇到了一个问题,即速率限制是基于声明的 `max_tokens`,而不是模型实际生成的 token 数。这意味着即使提示很小且没有生成任何 token,请求也可能被拒绝并返回 413 错误。这种行为会影响托管在 Groq 上的多个模型,包括来自 OpenAI 和阿里巴巴集团的 Qwen 模型。该问题似乎是跨模型的滚动窗口,而不是特定于单个模型,如果默认 `max_tokens` 设置得太高,可能会导致代理框架失败。
-
Hugging Face 模型路由器在 14 家提供商之间分配模型
Hugging Face 的 Inference Providers 路由器会动态地将模型分配给各种后端提供商,但具体提供商并不总是对用户显而易见。最近的检查发现 14 家提供商中有 135 个模型,其中像 'openai/gpt-oss-120b' 这样的模型由多达 11 家不同的提供商提供服务。这种动态路由意味着用户可能并不总是为给定模型使用最快或最合适的提供商,因为同一模型权重的性能在不同提供商之间可能存在显著差异。用户可以通过…
-
AI API模式拒绝困扰Gemini、Groq;模型在生成前失败
最近对API调用的分析显示,大量结构化输出请求失败并非由于模型错误,而是因为API提供商拒绝了JSON Schema本身。Toolkit Labs发现,72个调用中有28个导致了HTTP 400错误,其中Google AI Studio的Gemini 3.1 Flash-Lite拒绝了其所有18个测试Schema。其他提供商如Groq也遇到了Schema拒绝,通常是由于对'required'或'additionalProperties…
-
Groq 将 Llama-3.3-70B-Versatile 限制为企业客户
Llama-3.3-70B-Versatile 模型现在仅在 Groq 上提供给企业客户,这意味着它不再可以通过自助密钥或免费套餐访问。这一变化已反映在 Groq 的文档中,该模型标有“企业”徽章,要求用户联系销售部门了解定价和速率限制。免费套餐用户可以使用诸如 openai/gpt-oss-120b 等模型,该模型提供类似的上下文窗口,或者使用较小的安全分类器。
-
Groq 的每日 14,400 次请求免费套餐适用于提示防护模型,而非聊天模型
Groq 公布的每日 14,400 次请求的免费套餐速率限制对于聊天模型具有误导性,因为这个更高的限制仅适用于提示防护模型,而不适用于文本生成的大语言模型。像 OpenAI GPT OSS 120B 和 Qwen/Qwen3.6-27B 这样的聊天模型的实际限制是每天 1,000 次请求。这种显著的差异意味着基于较高数字计划代理循环的开发者将比预期更早遇到速率限制。
-
AWS Bedrock AgentCore 支持隔离租户的多租户 AI
Amazon Bedrock AgentCore 现在通过支持共享基础设施和隔离租户,为多租户 AI 应用提供支持。这使得开发者能够构建服务于多个客户的应用,例如为不同诊所构建的医疗 AI 代理,同时确保完全的租户隔离。该解决方案展示了服务层级区分、每个租户的精细成本跟踪以及可扩展多租户 AI 架构的最佳实践模式,使用 Mistral Ministral 3 8B Instruct 作为基础层级,并使用 OpenAI GPT OSS …
-
新的SIA框架通过更新脚手架和权重来自我改进AI
研究人员推出了一种新颖的自我改进AI系统SIA,该系统可同时更新智能体的脚手架(工具、提示、逻辑)及其模型权重。这一方法在最新论文中进行了详细介绍,它结合了两个先前独立的研究方向:脚手架更新和测试时训练。通过整合这些方法,SIA旨在克服AI开发和改进中的人为瓶颈。在法律分类、GPU内核优化和RNA去噪任务上的评估表明,与仅更新脚手架或权重的现有方法相比,性能有了显著提升。
-
使用 LangChain、Groq 和 FAISS 构建 AI 问答生成器
本项目详细介绍了如何使用 Python、LangChain、Groq LLMs、Hugging Face Embeddings 和 FAISS 构建生成式 AI 问答生成器。该应用程序接收 PDF 文件,提取内容,将其分割成可管理的数据块,并使用向量数据库存储和检索信息,以生成准确的问题和答案。它强调了数据块划分对于提高检索质量和 LLM 响应准确性的重要性,并演示了如何设置包含 API 密钥的环境和加载文档。