GPT-5.1
PulseAugur coverage of GPT-5.1 — every cluster mentioning GPT-5.1 across labs, papers, and developer communities, ranked by signal.
- used by DagsHub 70%
- used by Gotit.pub 70%
- competes with Claude Sonnet 4.5 70%
- used by alphaXiv 70%
- used by ScienceCast 70%
- used by CatalyzeX 70%
- instance of alphaXiv 70%
- instance of ScienceCast 70%
- competes with Gotit.pub 60%
- competes with CatalyzeX 60%
- competes with alphaXiv 60%
- competes with DagsHub 50%
7 天有情绪数据
-
直播聊天端侧翻译潜力巨大,可与GPT-5.1媲美
研究人员对移动设备上实时直播聊天端侧翻译的可行性进行了实证研究。他们开发了一个名为LiveChatBench的基准,包含1000个韩英句子对,并在五种移动设备上测试了各种端侧模型。研究强调了在受限环境中模型选择和资源消耗的挑战,但表明精心选择的端侧方法可以在特定任务上实现与GPT-5.1等商用模型相当的性能。
-
AI编码代理在2026年达到新的可靠性,推动了雄心勃勃的项目
2026年,AI编码代理取得了重大进展,在Claude Opus 4.5和GPT-5.1等模型于2025年末发布后,它们已变得可靠,可供日常使用。这些改进促使开发人员承担更具雄心的项目,拓展了AI能力的边界。尽管充满兴奋,但在沙盒化和代理安全等领域仍存在挑战,一些关于安全灾难的预测尚未完全实现。
-
新框架揭示大型语言模型无法准确模拟人类信念转变
一个名为审议式民意调查诊断框架(Deliberative Polling Diagnostic Framework)的新框架被引入,用于评估大型语言模型(LLMs)在接收新信息后如何更新其信念,这项能力对于它们模拟公众舆论至关重要。与以往的静态评估不同,该框架通过在相同的干预信息后比较人类和大型语言模型的信念转变来评估动态保真度。对五种前沿模型——GPT-5.1、Gemini 2.0 Flash、Claude Sonnet 4.5、L…
-
新框架Circuit-MLLM增强AI对电路原理图的理解能力
研究人员开发了Circuit-MLLM,一个新颖的多模态推理框架,旨在提高大型语言模型对电路原理图的理解能力。该框架通过将分析重新构建为设备定位、路径跟踪和潜在空间推理,解决了电路图特有的挑战,如密集布局和复杂的拓扑逻辑。Circuit-MLLM包含一个知识挖掘机制,将潜在表示与结构特征对齐,并采用一种拓扑引导的排序策略,允许沿着电路逻辑进行逐步推理,其性能显著优于GPT-5.1等现有模型。
-
Amazon 发布 Nova 2 模型家族,包含 Lite、Pro 和 Omni 版本
Amazon 推出了其 Nova 2 系列基础模型,为开发者在 Amazon Bedrock 上提供了三种针对不同工作负载优化的选择。Nova 2 Lite 专为客户支持和摘要等高吞吐量、低成本任务而设计,拥有改进的多语言能力和可调的推理深度。Nova 2 Pro 针对复杂的推理和多模态任务,拥有 100 万个 token 的上下文窗口,适用于分析大型文档或代码库。Nova 2 Omni 被定位为一款用于更广泛工作流程的 Any-to…
-
ESTS在WMT26上使用GPT-OSS-20B和GPT-5.1进行模型压缩的细节
ESTS的研究人员详细介绍了他们提交给WMT26模型压缩共享任务的工作,重点关注英译简中和英译埃及阿拉伯语的翻译。他们的方法包括根据特定任务的路由质量和跨语言路由发散度从GPT-OSS-20B中剪枝专家,然后使用GPT-5.1生成的合成数据对剩余的专家进行微调。通过对保留的专家权重使用MXFP4量化实现进一步压缩,模型参数量在4.186B到7.770B之间。
-
新框架揭示LLM难以模拟不一致的人类行为
一个名为CoCoEval的新评估框架已被开发出来,用于评估大型语言模型(LLMs)在模拟人类社交互动方面的能力,特别关注不一致和不合作行为。研究人员发现,当前的LLMs,如GPT-4.1、GPT-5.1和Claude Opus 4,表现出此类行为的频率远低于人类,并且提示工程和微调并不能可靠地弥合这一差距。该研究对LLMs作为真实人类社交动态代理的准确性提出了担忧。
-
新方法通过基于主题的翻译改进了大型语言模型的图谱标注
研究人员开发了一种名为 Structurally Speaking 的新方法,以改进像 GPT-5.1 这样的语言模型在图谱标注方面的表现。该协议指导显式图连接与简洁的主题级描述之间的翻译,解决了直接提示生成的图谱标注冗长且不一致的问题。实验表明,这种结构化提示方法生成的图谱标注更短、更符合主题,同时保持了相当的图谱恢复能力,这表明它可以在无需模型微调的情况下提高 LLM 生成的图谱标注的可解释性。
-
研究发现大型语言模型在乌尔都语故事生成方面存在困难
一项新的研究论文评估了多语言大型语言模型(LLMs)在低资源语言乌尔都语的内容生成能力。研究发现,GPT-5.1、Qwen-3-Max 和 DeepSeek-3.1 等模型在乌尔都语故事生成方面存在困难,在语法、语义、连贯性和文化相关性方面都出现了错误。尽管尝试了少样本提示,但这些局限性依然存在,表明当前的大型语言模型在这些语言的内容创作或信息检索方面尚不可靠。
-
人类预测者在FutureEval中险胜AI机器人,但差距正在缩小
在最新的FutureEval春季赛果中,人类预测者险胜AI机器人,但差异在统计学上不显著。AI机器人团队在过去一年中表现出显著进步,显著缩小了与人类预测者的差距。虽然大多数个人类预测者仍优于个人机器人,但像OpenAI的GPT-5.1及更高版本这样的AI模型的表现表明AI预测能力在持续进步。
-
LangChain 更新 `langchain-openai` 集成,新增功能并修复问题
LangChain 已发布对其 `langchain-openai` 集成的更新,1.6.2 版本解决了特定问题并整合了“GPT-6 Astra 推理工作”。先前版本 1.6.1 包含多项修复和功能,例如支持 Azure AD 身份验证和异步工具,以及为标识为 `gpt-5.6-sol` 的模型进行路由。
-
新AI框架HLS-Seek优化硬件设计生成
研究人员开发了HLS-Seek,一个用于从C/C++代码生成硬件设计的新颖框架,该框架优先考虑结果质量(QoR),如延迟和资源利用率。该系统利用带有比较代理奖励模型的强化学习,避免了在循环中进行完全综合的需要,并在预测帕累托最优设计方面取得了高精度。HLS-Seek还包含一个感知不确定性的蒙特卡洛Dropout切换机制,以使用真实的综合数据来改进其代理模型,与现有方法相比,从而提高了性能并加快了训练速度。
-
新研究揭示多模态大语言模型可能因文本覆盖而忽略视觉证据
一篇新的arXiv论文研究了大型语言模型中一种称为“多模态上下文谄媚”的现象,即外部文本会覆盖冲突的视觉证据。研究人员开发了一个包含998个案例的诊断工具来测试这一点,改变了视觉信息、常识先验和外部文本。研究发现,Gemini和GPT-5.1等模型表现出这种谄媚现象,在使用“System-2 Visual Arbitration”方法保护视觉证据不受文本影响时,性能显著提高。
-
新的基准测试揭示了大型语言模型智能体在多语言任务和协作中的局限性
新研究探讨了大型语言模型(LLM)智能体在复杂、多语言和协作环境中的能力。WorldBench 是一个新基准,在七种语言和八种文化中测试了 LLM 智能体执行的 1,600 项任务,揭示了其在状态保持和环境正确性方面存在显著局限性,前沿模型仅达到 49.2% 的约束任务成功率。另一项研究引入了 LLAMIA-Bench,用于评估 LLM 与非语言智能体的协作,证明通过学习的状态标记(潜在状态内化)直接整合连续表示优于传统的言语化方法,…
-
LLM智能体就地震断层分割AI架构进行辩论和设计
研究人员开发了一种新颖的地震断层分割神经架构搜索(NAS)方法,利用大型语言模型(LLM)的多智能体系统来辩论和设计最优网络架构。该系统由Claude、GPT-5.1和Gemini 2.5 Pro组成,通过让LLM在严格的参数和计算限制下协作设计、实现和审查候选架构的PyTorch代码来运行。搜索过程在一个消费级GPU上进行,仅涉及八个候选模型,成功识别出一个新的架构,该架构在F1分数和IoU方面优于现有模型,同时体积显著减小。
-
新的 SocialRL 方法训练小型 LLM 匹配 GPT-4/5 的谈判技能
一篇新的研究论文介绍了一种名为 SocialRL 的方法,旨在增强小型语言模型(40亿参数)的社交推理能力。SocialRL 框架训练模型充当战略谈判者而非被动代理,从而提高了它们在包括交易达成和面试在内的六个不同领域的表现。研究表明,这些经过训练的模型在模拟谈判场景中可以媲美甚至超越 GPT-4.1、GPT-5.1 和 GPT-5.2 等大型模型的性能。
-
人工智能聊天机器人:新研究探讨信任、偏见和伦理关切
研究论文正在探讨会话式人工智能的复杂伦理和实际影响。一项研究考察了“假朋友困境”,用户可能会在其中对人工智能产生关系信任,从而容易受到操纵和剥削。另一篇论文调查了包括 Claude Sonnet-5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5 在内的人工智能聊天机器人在检索医学研究方面的表现,发现表现因模型和用户角色而异,并且倾向于较大的样本量。此外,研究强调,在利益冲突情景下,许多大型语言模型优先考虑公司激励措…
-
心理健康AI安全性:专用系统在真实世界审计中表现优于前沿模型
一项发表在arXiv上的新研究通过使用模拟基准和真实对话,评估了六个前沿通用模型与一个专用系统在心理健康AI安全性方面的表现。与OpenAI的GPT-5系列、DeepSeek-V3、Google Gemini 3 Flash和Moonshot Kimi K2等模型相比,该专用AI在有害内容方面,尤其是在自杀、自残、饮食失调和药物滥用方面,表现出显著更低的发生率。对20,000次部署对话的审计证实了该专用系统在提供危机资源方面的有效性,…
-
FLARE框架优化大语言模型指令,性能超越GEPA
研究人员推出了一种名为FLARE的新框架,旨在优化大语言模型的指令。FLARE利用先进的反射机制和有限的少样本参考示例集来提高在各种基准测试中的性能。在使用GPT-5系列模型进行评估时,FLARE在检索增强推理和情感分类等任务上持续优于GEPA优化方法,展现出显著的准确性提升,同时还表现出卓越的数据效率和稳定性。
-
新框架StructPO将学术写作工作流内化用于论文引言生成
研究人员开发了StructPO,一个新颖的框架,它将生成学术论文引言的复杂过程内化为单一策略。该方法使用显式的阶段标记来管理背景、研究空白识别、方法和贡献,旨在提高连贯性并降低多阶段提示或代理工作流的成本。实验表明,StructPO增强了语义对齐和结构合理性,并且当与Qwen3-32B模型结合使用时,在人类评估中表现与GPT-5.1相当。