Wandry Kurniawan Saputra
PulseAugur coverage of Wandry Kurniawan Saputra — every cluster mentioning Wandry Kurniawan Saputra across labs, papers, and developer communities, ranked by signal.
- 2026-07-14 product_launch Perplexity has open-sourced WANDR, an internal benchmark for evaluating AI agent research capabilities. 来源
-
Perplexity AI:GPT-6 Astra 在 WANDR 基准测试中领先,超越 Fable 5.1 和 Opus 5
Perplexity AI 评估了 GPT-6 Astra,报告其在 WANDR 基准测试中的得分为 0.682,每项任务成本为 11.98 美元。这一性能代表了对其他测试模型的显著改进,比 Fable 5.1 的性能高出 13.5%,同时成本降低了 6.1%,并且比 Opus 5 的性能高出 27.0%,成本略高 3.3%。
-
Together AI 发布 GLM-5.3 Flash,一款高性价比的多模态大模型
Together AI 发布了 GLM-5.3 Flash,这是一款原生多模态模型,拥有 3200 亿参数和 100 万 token 的上下文窗口。该模型是 GLM-5.3 的蒸馏版本,在保持 DeepSWE 等基准测试竞争力的同时,显著降低了成本并加快了推理速度。Perplexity 已将 GLM 5.3 集成到其 Perplexity Computer 服务中,突显了其在长上下文、多模态代理工作负载方面的能力。
-
新的 WANDR 基准测试用于测试 AI 代理在深度数据收集任务中的能力
引入了一个名为 WANDR 的新基准测试,用于评估研究代理在宽泛且深入的数据收集任务中的能力。WANDR 包含 500 个现实场景,要求代理发现广泛的实体集,为每个实体进行深入的网络搜索,并汇编带有支持证据的可验证记录。该基准测试使用动态的、特定任务的裁判,它们会重新抓取网页以确保准确性,并允许评估当前信息,超越了静态答案集。对六个生产研究系统的初步评估显示,即使是最强的系统,软 F1 分数也仅为 0.363,表明在处理增加的数据量和…
-
Perplexity 为 Perplexity Computer 推出 GPT 5.6 Terra 和 Luna 模型
Perplexity 已在其 Perplexity Computer 平台中集成了两个新模型 GPT 5.6 Terra 和 Luna。Terra 专为复杂、以目标为导向的任务而设计,并作为子代理的默认模型,在 WANDR 基准测试中表现优于 'Sonnet',同时显著降低了成本。Luna 则针对计划自动化任务的速度和成本效益进行了优化。该公司指出,目前的主要挑战在于开发动态路由逻辑来管理这两个模型之间的交互。
-
Perplexity 推出 WANDR 基准测试 AI 研究代理
Perplexity 推出了 WANDR,一个旨在评估研究代理的新开放基准。该基准包含 500 个任务,要求代理查找和引用证据来支持其发现。在初步测试中,Perplexity Search as Code 以 0.363 的软 F1 分数获得最高分。
-
Bonsai 27B 模型可在手机上运行;Google 的 Gemma 4 针对 Pixel 10 进行了优化
PrismML 发布了 Bonsai 27B,一个拥有 270 亿参数的模型,通过利用 1 位和三元权重,其大小可减小到 6GB 以下,从而可以在智能手机上运行。该模型支持多步推理和工具使用等复杂任务。另外,Google 宣布了 Gemma 4 E2B,该模型针对 Pixel 10 的 TPU 进行了优化,实现了离线深度对话和图像识别等设备端 AI 功能。AI 工程领域也正在走向成熟,编码代理和强大的评估框架等趋势正成为主流。
-
Perplexity AI 开源 WANDR 基准测试以评估研究能力
Perplexity AI 正在开源 WANDR,这是一个旨在衡量计算机科学研究能力的内部基准测试。该基准测试旨在帮助评估深度和广度研究工作的成本和性能。Perplexity AI 的首席执行官 Aravind Srinivas 强调了 WANDR 在公司研究实力发展中的作用。
-
Perplexity 开源 WANDR 基准,用于 AI 代理研究能力
Perplexity 已开源 WANDR,这是一个内部基准,旨在评估 AI 代理的深度和广度研究能力。WANDR 包含 500 项研究任务,需要跨三个难度级别超过 170,000 条来源支持的记录。WANDR 不依赖于黄金解决方案,而是重新抓取引用的页面,以根据底层证据验证声明,从而实现时变事实并提供密集、可解释的评估信号。
-
Perplexity AI 为代理推出“Search as Code”
Perplexity AI 推出了“Search as Code”,这是一种专为 AI 代理设计的新型搜索架构。该新系统通过允许模型直接组合搜索原语,实现了异步查询执行、去重和结果排序,从而绕过了传统的高延迟工具调用方法。Perplexity 声称 Search as Code 在包括其自身的 WANDR 基准在内的各种深度和广度研究基准上,性能优于现有系统,同时还提供了卓越的成本效益比。