openai/gpt-4o-mini
PulseAugur coverage of openai/gpt-4o-mini — every cluster mentioning openai/gpt-4o-mini across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
FastAPI 教程展示如何将 LLM 响应流式传输到浏览器
本文详细介绍了如何使用 FastAPI 和 uvicorn 创建一个流式端点,该端点可将 LLM 响应高效地发送到 Web 浏览器。它强调了避免服务器和客户端之间缓冲以实现真正流式传输的重要性。提供的 Python 代码演示了如何设置一个异步生成器端点,该端点连接到 LLM API(例如 OpenAI 的 gpt-4o-mini),并将输出格式化为服务器发送事件 (SSE),并带有独立的 'token'、'error' 和 'done…
-
GEPA方法使用AI评论优化LLM提示,无需GPU
一种名为GEPA(Genetic-Pareto Evolutionary Prompt Adaptation)的新方法已被推出,旨在优化LLM管道,而无需为微调投入大量GPU资源。GEPA由加州大学伯克利分校Sky Computing Lab的研究人员开发,并在ICLR 2026的口头论文中进行了详细介绍。GEPA利用LLM生成的评论来演进提示,其性能优于GRPO和PPO等现有方法。这种方法适用于任何黑盒LLM,包括GPT-4o、Cl…
-
Buildkite 通过语义缓存将 LLM 调用减少 58%
Buildkite 在其内部的不稳定测试摘要器中实现了语义缓存,显著减少了 LLM 调用和成本。通过使用其网关 Bifröst,根据含义而非精确文本缓存摘要,他们实现了 anthropic/claude-haiku 和 openai/gpt-4o-mini 等提供商调用次数减少 58%。此优化还提高了延迟,并在一次长达 11 分钟的提供商中断期间提供了弹性,证明了缓存对成本和可靠性的双重好处。