httpx
PulseAugur coverage of httpx — every cluster mentioning httpx across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
DevOps 工程师可以使用 Python 构建 AI 日志摘要器
本文详细介绍了如何为 DevOps 工程师构建一个由 AI 驱动的日志摘要器,以便快速识别海量日志数据中的问题。该工具使用 Python CLI 收集日志,通过去除噪声和去重重复条目来预处理日志,然后将清理后的数据发送到语言模型。LLM 被提示充当 DevOps 助手,提供结构化摘要,包括时间线、错误计数、根本原因假设和建议的后续步骤。
-
Wrapture Python 包提供高级 monkey patching 和可观察性功能
Graham Dumpleton 发布了 wrapture,一个用于 monkey patching 的新 Python 包,同时还提供测试和可观察性功能。该工具允许记录方法调用、分阶段行为和跟踪实时应用程序,可以通过 TOML 文件进行配置,而无需修改 Python 代码。Wrapture 支持广泛的 Python 框架和库,包括 Flask、Django 和 FastAPI,并可以将跟踪导出到 OpenTelemetry,使其成为…
-
MCP Python SDK 从 1.x 更新至 2.x,需要服务器迁移
MCP Python SDK 已从 1.x 版本(FastMCP)更新至 2.x 版本(MCPServer),现有 Python MCP 服务器需要进行迁移。此次更新包括将 FastMCP 重命名为 MCPServer,并对 API 进行更改,涉及传输机制和依赖项。开发者需要更新代码以使用新 SDK,或将项目固定到旧版本以保持兼容性。迁移过程涉及识别受这些更改影响的代码(如工具定义和传输协议),并调整依赖项(如将 httpx 更改为 …
-
Anthropic 发布 Python SDK v1.0.0,升级至 httpx2
Anthropic 已发布其 Python SDK 的 1.0.0 版本,标志着在经历了众多预发布版本后,达到了重要的稳定性里程碑。主要更新是将 HTTP 客户端库从 httpx 替换为 httpx2。建议用户在升级前查阅迁移指南,以确保兼容性。
-
FastMCP 4 迁移指南详细说明了包结构和依赖项中的重大变更
FastMCP 4 的发布引入了多项重大变更,开发人员在迁移过程中必须解决这些变更。一个关键问题源于包结构的变化,其中 `pip install -U fastmcp` 可能无法正确安装所有必需的组件,从而导致导入错误。建议用户执行干净的卸载和重新安装或重新创建其虚拟环境。此外,FastMCP 4 现在使用 `httpx2` 而不是 `httpx`,这意味着现有的 `httpx.ConnectError` 异常处理程序将不再起作用,必…
-
模型上下文协议 (Model Context Protocol) 转为无状态架构,引入新的安全风险
模型上下文协议 (Model Context Protocol, MCP) 已进行重大修订,从有状态架构转变为无状态架构。此变更将于 2026 年 7 月 28 日生效,消除了对会话 ID 和初始化握手的需求,从而使 MCP 服务器能够更轻松地在标准负载均衡器后进行扩展。然而,这一转变引入了新的安全漏洞,会话句柄现在作为字符串携带在模型的上下文窗口中,可以被读取、复制,并可能通过提示注入被利用,从而有效地将植入的提示变成被盗的凭证。
-
开发者通过语义缓存和速率限制削减 LLM Token 成本
开发者正在实施缓存策略,以在免费套餐的大型语言模型 (LLM) 端点上降低成本并提高效率。一种方法是 SimHash,它使用哈希算法来识别语义上相似的提示,即使措辞略有不同也能实现缓存命中。另一种方法涉及令牌桶系统,用于管理请求速率并防止超出 API 限制,从而确保更顺畅的运行并避免错误。第三种策略是语义缓存,它将提示转换为嵌入,并比较它们的距离以找到相似的含义,从而重用已存储的响应并节省昂贵的 LLM 调用。
-
本地 LLM 面临托管端点的“预热税”
本地运行大型语言模型可能会产生“预热税”,即由于模型加载时间,初始请求会明显变慢。此税仅与短时会话相关,因为长时间会话可以分摊加载成本。文章提出了一种可衡量的途径,用于将本地模型性能与托管端点进行比较,并考虑会话长度、模型大小和量化等因素,以确定最佳部署策略。
-
LLM API 返回空字符串,尽管状态码为 200 OK,暴露出 token 限制 bug
一位开发者遇到了一个问题,即 LLM API 持续返回空字符串作为摘要,尽管所有请求都显示成功,具有 HTTP 200 状态码且 JSON 解析正常。根本原因追溯到一次代码合并,该合并无意中将 `max_tokens` 设置为 0,导致模型不返回任何内容,而应用程序随后将其保存为有效的、尽管为空的摘要。此 bug 持续存在,因为应用程序的成功逻辑未考虑零长度内容。
-
在代码中强制执行免费LLM Token预算,而非纪律
开发者应将免费LLM Token额度视为严格预算,并在代码中强制执行,而不是依赖纪律。一个常见的陷阱是后台作业在未通知的情况下消耗Token,尤其是在重试期间。作者提出了一种代理,在Token使用前进行预留,类似于库存管理,以防止超支。这种方法确保应用程序可以在免费套餐的最严格限制内运行,防止即使在付费套餐中也会持续存在的问题。
-
开发者通过管理 HTTP 客户端的 keep-alive 来修复 LLM 连接错误
一位开发者在使用免费 LLM 端点时遇到了间歇性的连接错误,请求会挂起整整三十秒然后失败。通过详细的日志记录,他们发现问题源于他们的 HTTP 客户端重用了网关因不活动而关闭的 keep-alive 连接。通过在网关的空闲超时时间内进行后续请求,可以重现此问题。解决方案是配置 HTTP 客户端在网关之前主动回收连接,从而防止使用过时的连接。
-
Anthropic Python SDK 1.0 弃用 httpx,破坏模拟
Anthropic 的 Python SDK 已发布 1.0.0 版本,引入了重大更改,包括从 httpx 库迁移到 httpx2。此次更新将最低 Python 版本提高到 3.10,并删除了多项功能,例如旧的 Text Completions API 和 messages API 的某些参数。由此产生的关键问题是,为配合旧版 httpx 而设计的 HTTP 模拟和跟踪库(如 respx 和 pytest-httpx)可能无法匹配新 …
-
免费LLM服务器在16个并行请求的并发负载下崩溃
一项性能测试显示,一个名为MonkeyCode的免费模型服务器在16个并行请求的并发负载下崩溃了。该测试使用Python的asyncio和httpx进行,测量了从1到32的并发级别下的成功率、延迟和吞吐量等各种指标。实验旨在揭示单请求测试可能忽略的争用问题,服务器在超过16个并发调用后性能显著下降。
-
使用 Python 和 MonkeyCode 构建持久化的 LLM 决策日志
本教程演示了如何使用 Python、FastAPI 和 MonkeyCode 的免费模型访问来构建一个决策日志系统。该系统旨在记录模型的原始响应以及基于这些响应所采取的操作,确保即使在服务器重启后数据也能持久化。它包括用于做出决策、检索过往决策和检查系统运行状况的端点,记录存储在 JSON Lines 文件中,以实现可审计性和避免昂贵的模型重放。
-
开发者将LLM API空响应错误隔离到陈旧的TCP连接
一位开发者遇到了LLM API持续返回空响应的问题,最初怀疑是模型本身的问题。经过广泛的故障排除,根本原因被确定为陈旧的TCP连接、终止空闲连接的VPN代理以及掩盖错误的过于宽泛的异常处理程序的组合。通过为每个请求实现新的HTTP连接并改进异常处理以专门捕获和报告与连接相关的失败来解决此问题。
-
LLM服务器方差探测揭示单次运行测试的不可靠性 · 跟踪2个来源
两篇文章探讨了免费LLM服务器性能的方差,认为单次运行会提供误导性结果。第一篇文章介绍了一个Python脚本,该脚本每小时发送20个请求,在24小时内测量延迟和错误率,并强调了不一致的性能如何可能破坏管道。第二篇文章提出运行50个顺序请求,每次暂停一秒,以分析延迟、输出和错误率的方差,并强调一致的测量对于理解端点可靠性至关重要。
-
开发者在免费服务器上审计 LLM 可重复性,以区分模型与服务器问题
一位开发者创建了一个 Python 脚本,用于审计来自免费服务器的 LLM 输出的可重复性,以应对区分模型性能与服务器可变性这一挑战。该审计通过固定提示和温度运行 50 次,测量六个信号,包括精确匹配率、与模型输出的相似度、首个 token 的时间、总延迟、错误率和截断率。这种方法对于输出一致性至关重要的应用至关重要,例如自动化测试或文档生成,因为免费服务器通常缺乏付费端点的服务水平协议。
-
Simon Willison 更新 `llm` 工具,新增功能并修复依赖项
Simon Willison 发布了其 `llm` 工具的更新,0.33 版本引入了新功能,而 0.32.1 版本解决了依赖项问题。最新版本允许组合多个提示模板,并增强了嵌入模型 API 密钥的处理。它还为模拟 OpenAI Responses API 的模型添加了 `reasoning_summary` 选项。之前的 0.32.1 版本是为了解决 OpenAI Python 库对 `httpx` 的依赖性更改而导致的安装问题而进行的快速修复。
-
部署LLM网关:Python和Node.js教程强调分阶段验证
两个教程详细介绍了将模型网关部署到公共端点的过程,强调了分阶段的方法,并在每个步骤进行验证,以避免常见的部署陷阱。第一个教程使用Python、FastAPI和uvicorn,第二个教程使用Node.js和Docker。这两个指南都利用MonkeyCode的免费资源来获取模型端点和服务器,并强调在编写代码之前定义清晰的请求和响应契约的重要性。它们强调本地测试是不够的,真实主机才能揭示冷启动和网络复杂性等问题。
-
开发者用Python脚本测试免费LLM服务器的极限
一位开发者创建了一个Python脚本来测试免费大语言模型(LLM)服务器的性能极限。该脚本采用“阶梯测试”方法,逐渐增加并发量,以识别服务器何时开始减速、返回错误或产生损坏的输出。这种方法旨在揭示这些免费接口隐藏的性能上限,这些上限通常未被记录,并可能导致批量处理期间出现意外故障。