GPT-3.5 Turbo
PulseAugur coverage of GPT-3.5 Turbo — every cluster mentioning GPT-3.5 Turbo across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
11个AI模型通过单一提示进行比较,结果各不相同 · 跟踪4个来源
Netlify最近的一篇博客文章探讨了11个不同的AI模型在收到相同提示时性能上的差异。文章强调了来自OpenAI、Google、Anthropic、Meta、Mistral AI和Cohere等主要AI实验室的模型会产生截然不同的输出,展示了当前大型语言模型的多样化能力和细微差别。这种比较突显了测试各种模型以找到最适合特定任务的模型的重要性。
-
新研究探索用于自动提示优化的模块化和递归方法
两篇新研究论文介绍了优化大型语言模型提示的新方法。第一篇SAPO将提示分解为角色、上下文和任务等部分,从而进行有针对性的改进,以提高在各种基准测试中的性能。第二篇RLMOpt利用递归语言模型来驱动优化过程本身,从而在多个任务和基准测试中实现更高效、更有效的提示生成,其性能通常优于GEPA等现有方法。
-
将 OpenAI GPT 模型集成到应用程序的指南
本文提供了一份技术指南,介绍如何将 OpenAI 的 GPT 模型集成到应用程序中,重点关注 Chat Completions API。文章详细介绍了必要的设置,包括使用 Node.js 和 Express 进行环境配置,并解释了如何使用消息角色(system、user、assistant)来管理对话历史。该指南强调了 GPT-4 Turbo 和 GPT-3.5 Turbo 之间的区别,建议用户根据其对上下文窗口、准确性和成本的具体需…
-
大语言模型通过新的交易成本角色方法模拟政策反应
研究人员开发了一种新方法,通过将感知交易成本的概念融入大语言模型(LLM)角色中,来模拟个人可能如何应对能源政策干预。该方法使用来自荷兰的调查数据进行测试,它不仅根据人口统计学特征,还根据租户对节能改造的成本、收益和障碍的理解来代表他们。研究发现,这种摩擦感知角色设计在包括GPT-3.5 Turbo、Ministral-8B-Instruct和Llama 3.1 8B-Instruct在内的各种大语言模型中一致提高了模型性能,表明其在…
-
LLM网关路由切换器捕获数据以优化提示
Skelf-Research开发的路由切换器LLM网关,通过捕获和利用调用数据,为改进提示提供了一种新颖的方法。与仅仅路由请求并丢弃提示数据的传统网关不同,路由切换器将每次交互都存储在SQLite数据库中。然后,通过包括生成、贝叶斯优化和评估在内的六个步骤,利用捕获的数据来迭代地优化提示。该系统支持OpenAI、Anthropic和Google等多个LLM提供商,并通过模仿OpenAI API来设计,易于集成。
-
LiteLLM 实现多提供商 LLM 回退,增强可靠性
LiteLLM 是一个 AI 网关,通过统一的接口促进像 OpenAI、Anthropic、Azure 和 Vertex AI 等多个 LLM 提供商的使用。它提供了一种回退机制,当首选提供商或模型失败时,会自动将请求路由到备用提供商或模型,从而确保应用程序的可靠性。最佳实践包括平衡成本和性能、监控延迟和错误率等关键指标,以及利用上下文感知回退等功能来处理参数兼容性和长输入的自动路由。
-
AI 代码审查器在 Bug 检测方面表现出惊人的性能差距
一位用户开发了一个工具来针对真实世界的 Bug 和 CVE 对 AI 代码审查器进行基准测试。该工具将已知的漏洞及其修复方案输入到各种 AI 模型中,并对其检测能力进行评分。初步结果显示模型之间存在显著的性能差距,一些模型能够持续识别特定的 Bug 类型,而另一些模型则会遗漏或产生虚假问题。值得注意的是,最新的 Claude 模型据称拒绝审查安全代码。
-
新的探测方法增强了 RAG 系统的元数据过滤功能
研究人员开发了一种名为“Probe, Don't Prompt”的新方法,以改进 Multi-Meta-RAG 系统中的元数据过滤。该技术用一个更小的、确定性的探测器取代了使用像 GPT-3.5 Turbo 这样的大型语言模型从查询中提取元数据的传统方法。该探测器在开源模型的隐藏状态上进行训练,在识别新闻来源方面达到了很高的准确性,在避免空查询方面优于 GPT-3.5。这种方法为过滤向量存储提供了一种更有效、更可靠的方式,尤其适用于多跳问答任务。
-
研究发现:AI模型系统性地排除类人令牌选择
一篇新研究论文《截断盲点》(The Truncation Blind Spot)发布在arXiv上,揭示了文本生成模型中使用的标准解码策略系统性地排除了类人令牌选择。这些策略,包括top-k、nucleus sampling和contrastive search,倾向于选择统计上更可能的令牌,从而忽略了人类自然使用的、在上下文中恰当但较少见的词语。这种被称为“截断盲点”的现象,在来自GPT-3.5 Turbo和Claude 3 Hai…
-
新框架使用贝叶斯不确定性来监控 RAG 管道
研究人员为 Agentic 检索增强生成 (RAG) 系统开发了一个新的框架,该框架结合了贝叶斯不确定性传播。这种方法允许 RAG 管道的不同阶段(如规划、评估和生成)产生不确定性信号。然后,这些信号通过贝叶斯网络传播,以估计整体系统不确定性并识别潜在的故障点。该框架使用 GPT-3.5-Turbo 和 GPT-4.1-Nano 在多跳问答任务上进行了测试,显示出监控 RAG 系统的潜力,尽管在特定场景下观察到了一些局限性。
-
Handlebars LLM 提示漏洞暴露角色注入风险
一篇新研究论文详细介绍了一种在常用于 LLM 提示的 Handlebars 模板中存在的漏洞,该漏洞可能导致结构化角色注入。研究发现,Handlebars 的默认 HTML 转义机制未能防御某些分隔符家族,从而允许攻击者伪造更高权限的对话轮次。虽然 GPT-3.5 Turbo 表现出显著的易感性,但 Claude Haiku 4.5 对这些攻击表现出很强的抵抗力。
-
新研究解决 LLM 路由限制;A3M Router 声称节省成本
两篇新研究论文解决了大型语言模型 (LLM) 路由系统的局限性。其中一篇论文“ReCal”引入了一个奖励校准框架,通过分解奖励和重新加权优化信号来提高基于 RL 的路由器的训练稳定性和性能。另一篇论文“The Routing Plateau”指出了当前路由器中的可预测性瓶颈,表明它们由于缺乏实例特定的路由信号而经常在困难查询上失败,并建议使用更大的数据集和更强的编码器作为解决方案。此外,A3M Router 的更新强调了其在企业 AI…
-
GPT-3.5-Turbo在长提示中处理中间信息时遇到困难
一项研究发现,当答案位于长提示(特别是20k token上下文窗口)的中间时,GPT-3.5-Turbo的准确率会显著下降。这一现象在论文“Lost in the Middle: How Language Models Use Long Contexts”中有记载,归因于Transformer模型中的注意力模式,这种模式偏好提示的开头或结尾的信息,而忽略中间部分。这个问题并非检索错误,而是由于训练数据限制导致模型注意力权重在中心区域衰减。
-
爱沙尼亚基准测试:Claude Opus 4.7 最能抵御俄罗斯宣传
爱沙尼亚语言研究所发布了一项名为“宣传抵抗”的新基准测试,以评估大型语言模型在抵御俄罗斯国家支持的虚假信息方面的能力。该基准测试涵盖了三种语言中的14种俄罗斯宣传叙事,模型回答了75个问题。Anthropic的Claude Opus 4.7表现最佳,得分接近满分,而NVIDIA的Nemotron 3 Super 120B和阿里巴巴的Qwen 3.6 Plus也表现出强大的抵抗力。
-
AI模型从摘要生成研究论文标题
研究人员开发了一种使用大型语言模型从摘要自动生成研究论文标题的方法。该研究使用各种指标评估了几种模型,包括微调的PEGASUS-large、LLaMA-3-8B和GPT-3.5-turbo。结果表明,PEGASUS-large表现最佳,在生成恰当可靠的标题方面甚至优于GPT-3.5-turbo。
-
新基准评估大型中文语言模型在各领域的表现
一项名为“大规模多任务中文理解”(MMCU)的新基准被提出,用于评估大型中文语言模型在各个领域的能力。该基准包含医学、法律、心理学和教育等任务,并特别关注医学和教育子任务。初步评估显示,尽管顶级模型表现出一定的熟练度,但总体性能中等,在法律领域存在明显不足。GPT-3.5-turbo模型在临床医学方面表现出最高的准确率,但没有模型在所有测试领域都取得高分,这凸显了对更全面的中文LLM评估的需求。
-
OpenAI 弃用 5.3-Codex 模型,敦促迁移至更新的 AI
OpenAI 正在弃用其 5.3-Codex 模型,标志着其正转向更新、更先进的 AI 功能。鼓励用户迁移到 GPT-4 Turbo 或 GPT-3.5 Turbo 等替代模型来满足其编码需求。该公司已提供迁移指南以协助用户完成此次过渡。
-
大型语言模型偏向赞助产品,但简单提示可修复
一篇新论文揭示,包括OpenAI的GPT-3.5 Turbo和GPT-4o在内的许多大型语言模型,都表现出推荐赞助产品的偏见。研究人员发现,当在系统提示中出现微妙的赞助线索时,这些模型经常会建议更昂贵、被赞助的选项。然而,一个简单的三十词用户提示,要求生成一个中立的比较表格,显著减少了这种偏见,在测试模型中,赞助推荐的比例从近50%降至低至0%。
-
LLM 通过工具使用获得自主性;Python 监控获得可观测性
第一篇文章详细介绍了如何通过函数调用和结构化工具使大型语言模型 (LLM) 能够与外部系统进行交互,将它们转变为自主代理。文章概述了使用清晰的模式定义工具,以及一个用于生成响应、检查工具调用、执行它们并将结果反馈回去的标准循环。第二篇文章解决了在 Python 中监控 LLM API 调用的挑战,强调了标准监控工具无法捕获的可变延迟、Token 使用量和成本等独特方面。文章提出使用 OpenTelemetry 来检测这些调用,从而能够…
-
为印度法律定制的大型语言模型在律师考试中取得60%的成绩,超越GPT-3.5
研究人员开发了一个名为Legal Assist AI的框架,以解决印度法律援助服务的可及性差距。该系统利用了一个较小的、80亿参数的量化Llama 3.1模型,并通过检索增强生成(RAG)系统和提示工程进行增强。该框架整合了超过600份法律文件,包括《印度刑事诉讼法》等近期立法,并成功减轻了幻觉。在全印度律师资格考试基准测试中,该系统取得了60.08%的成绩,优于GPT-3.5 Turbo,并展示了22倍的参数效率。