GPT-5.5-xhigh
PulseAugur coverage of GPT-5.5-xhigh — every cluster mentioning GPT-5.5-xhigh across labs, papers, and developer communities, ranked by signal.
-
shot-scraper video 工具使用 YAML 分镜记录代理工作
Simon Willison 在 shot-scraper 1.10 版本中推出了一项新功能,名为 `shot-scraper video`。该工具允许用户通过定义 YAML 格式的分镜脚本来创建 Web 应用程序例程的视频演示。该工具利用 Playwright 执行这些例程并记录过程,然后可用于展示代理工作或新应用程序功能。Willison 通过为 Datasette 的批量插入和新表创建功能生成视频演示了其能力,这些演示的分镜脚本…
-
大型语言模型通过新的无训练框架实现专家级扑克水平
研究人员开发了PokerSkill,这是一个新颖的框架,使大型语言模型(LLMs)无需进行游戏特定训练或复杂的求解器即可玩专家级扑克。该方法将大型语言模型与人类设计的扑克技能结构化库相结合,使模型能够将它们的行动建立在专家知识的基础上。在与GTOWizard基准进行测试时,使用PokerSkill的大型语言模型与基线模型相比,显著减少了损失,展示了与成熟的扑克机器人相媲美的性能。
-
LLM应对CUDA调试和抽象推理,带来新基准和方法
两篇新研究论文探讨了大型语言模型(LLM)的高级调试和推理技术。第一篇论文介绍了CUDABeaver,这是一个旨在评估基于LLM的CUDA代码调试的基准,强调了修复过程中性能保持的挑战。第二篇论文提出了基于诱导的程序化改进(ABPR),这是一种结合LLM和Prolog进行算法调试的神经符号方法,在ARC-AGI-2等抽象推理任务上展示了显著的改进。
-
Simon Willison 在 Codex 应用中使用 GPT-5.5 绕过 CSP
Simon Willison 开发了一种绕过 Web 应用程序中内容安全策略 (CSP) 限制的实验方法。该技术涉及在沙盒 iframe 中运行应用程序,并使用自定义的 fetch 函数来拦截 CSP 错误。然后,父窗口可以提示用户将有问题域添加到允许列表中,从而使应用程序能够刷新并正常运行。Willison 使用 Codex 桌面应用程序中的 GPT-5.5 xhigh 构建了此演示。
-
AI 模型排行榜列出编码、视频等领域的顶级表现者
Bindu Reddy 编译了一份截至 5 月份的各个领域表现最佳的 AI 模型列表。该列表包括了编码、事实搜索、视频生成、图像创建、语音合成和低成本应用等领域的领先模型。提到的知名模型有 GPT 5.5 xHigh、Grok 4.3、SeeDance 2.0 和 Gemini Live。
-
Simon Willison 发布用于 LLM 限制和 IP 阻止的 Datasette 插件
Simon Willison 发布了其 Datasette 数据探索工具的几个新插件。datasette-llm-limits 允许用户为 LLM 使用设置支出上限,而 datasette-ip-rate-limit 则提供基于 IP 的爬虫阻止功能。此外,datasette-llm 已更新至 0.1a7 版本,能够更灵活地为特定 LLM 模型配置默认选项。