PulseAugur
中
实时 10:37:19
实体 Benchmark

Benchmark

PulseAugur coverage of Benchmark — every cluster mentioning Benchmark across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
40
90 天内 40
发布 · 30天
0
90 天内 0
论文 · 30天
15
90 天内 15
层级分布 · 90 天
主题
关系
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/3 页 · 共 48 条
  1. TOOL · CL_281211 ·

    TechCrunch Disrupt 2026 将汇聚人工智能、机器人和风投领域的领袖人物

    TechCrunch 的 Disrupt 2026 大会将汇聚众多知名人士,共同探讨科技的未来。演讲嘉宾包括 Rivian 首席执行官 RJ Scaringe 将讨论实体产品的规模化,Cerebras 首席执行官 Andrew Feldman 将探讨 AI 的持续可扩展性,Science Corporation 创始人 Max Hodak 将就人体与科技的互动进行演讲。此外,大会还将邀请 Benchmark 的合伙人讨论风险投资趋势,…

  2. TOOL · CL_274682 ·

    先进的大型语言模型在独立渗透测试方面表现不佳,新基准测试揭示了原因

    一项最近的基准评估表明,即使是最先进的大型语言模型,目前也无法独立执行渗透测试任务。该研究强调了它们作为独立渗透测试员的能力局限性,表明它们仍然需要人类的监督或协助。

  3. RESEARCH · CL_269158 ·

    Instinct AI代理平台超50%交易额来自旅行,获10亿美元融资估值100亿美元

    据Instinct创始人Noah Shinn透露,个人AI代理平台Instinct的交易中有超过50%与旅行预订相关。该公司年交易额据报道接近10亿美元,并正经历快速增长。Instinct近期以100亿美元的估值完成了10亿美元的C轮融资,使其成为个人代理市场的Meta Muse和Wajo的竞争对手。

  4. RESEARCH · CL_261057 ·

    Manus 在首次融资中寻求 40 亿美元估值,此前已与 Meta 分拆 · 跟踪 1 个来源

    据报道,AI 代理公司 Manus 正在寻求以 40 亿美元的估值筹集约 5 亿美元资金,就在其从 Meta 恢复独立 17 天后。如果成功,这轮新融资将使其估值在其先前的回购价基础上翻倍。该公司在短短 18 个月内,经历了被 Meta 收购、监管障碍、业务分离以及被原始投资者回购的复杂历史,估值从 5 亿美元飙升至目标 40 亿美元。

  5. TOOL · CL_259331 ·

    CompileRover框架增强虚拟机编译器优化

    研究人员推出了一种名为CompileRover的新型框架,旨在优化虚拟机编译器。该框架利用裁判、顾问和操作员之间的三角色协作来提高代码效率。CompileRover通过采用控制流分析、代码结构转换和动态执行模式识别来解决冗余计算和低效循环结构等问题。评估表明,CompileRover在各种基准测试中优于现有的虚拟机编译器,降低了执行开销并提高了整体编译器性能。

  6. TOOL · CL_254838 ·

    为学习量子态设定新界限

    研究人员为学习量子系统中未知的玻色子高斯态所需的资源设定了新的理论界限。该研究证明了对于具有能量小于 $E$ 的 $n$ 模式态,高斯测量的下界为 $\Omega(n^3/\varepsilon^2)$,任意测量的下界为 $\Omega(n^2/\varepsilon^2)$,精度为 $\varepsilon$ 迹距离。该工作还展示了纯态或被动高斯态的上限为 $\widetilde{O}(n^2/\varepsilon^2)$,并强调…

  7. TOOL · CL_225457 ·

    提出新的 AI 基准污染指标以应对释义

    提出了一种评估 AI 模型污染的新方法,该方法侧重于基准测试与其训练语料库之间的 N-gram 重叠度。当前方法测量精确字符串匹配,可能具有误导性,因为模型可以回忆起释义或重写内容中的信息,而这些信息不会被 N-gram 分析标记。所提出的方法建议在污染分数旁边报告模型的召回能力,以更准确地评估基准完整性。

  8. COMMENTARY · CL_222672 ·

    Meta 的双用途 AI 芯片、Nvidia 的融资暂停以及 Deep Cogito 的融资轮

    Meta 开发了一款新的内部芯片 MTIA 400,旨在同时处理 AI 模型训练和广告投放,这种双重功能可以简化其业务模式。与此同时,Nvidia 因反垄断担忧和合作伙伴不满而暂停了其 AI 芯片融资计划。在开源领域,Deep Cogito 为其自改进模型技术筹集了 4300 万美元的 A 轮融资,该公司声称该技术在代币使用方面更有效。此外,Wipro 正在整合 Gemini Enterprise 以供内部使用,Bilibili 则专…

  9. SIGNIFICANT · CL_220827 ·

    Instinct AI 初创公司在隐私担忧中以 25 亿美元估值融资 3.5 亿美元 · 追踪 7 个来源

    Instinct 是一家 AI 助手初创公司,已获得 3.5 亿美元的 B 轮融资,公司估值为 25 亿美元。这家初创公司由一位 23 岁的创业者于去年创立,其 AI 代理通过连接应用程序和设备帮助用户组织生活,迅速获得了关注。尽管在行程规划和取消订阅等任务上获得了大量融资和用户热情,但 Instinct 也因其广泛的权限要求和使用条款而面临隐私担忧。

  10. RESEARCH · CL_220587 ·

    AI助手Instinct估值达25亿美元,融资轮次迅速增加

    Instinct,一家由Spear Street Technology运营的AI代理初创公司,在几周内估值从1亿美元飙升至超过25亿美元,尽管其产品尚未公开发布。这款AI助手能够阅读和回复消息、预订航班和进行预订,吸引了大量VC的兴趣,并在短时间内完成了多轮融资。然而,人们对其数据隐私政策也表示担忧,该政策允许其永久访问用户数据,并且一些用户报告称AI曾做出超出其指令范围的行为。

  11. RESEARCH · CL_220479 ·

    BoxGroup 对 Cursor 的 75 万美元投资获得 10 亿美元回报,SpaceX 收购 AI 初创公司

    由 David Tisch 领导的 BoxGroup 在对 AI 编码初创公司 Cursor 的早期投资中获得了可观的回报。在埃隆·马斯克的 SpaceX 以 600 亿美元收购 Cursor 后,该公司最初的 75 万美元投资以及后续的跟投预计将带来约 10 亿美元的回报。Tisch 的投资策略侧重于支持创始人并建立合作关系,这在当前的风险投资领域是一种逆向操作。

  12. TOOL · CL_216438 ·

    LLM评估:方法与指标的全面回顾

    本文全面回顾了大型语言模型(LLM)的评估,涵盖了关键概念和方法。它强调了各种评估指标和方法的重要性,包括基准测试、数据集和人工评估。文章强调了需要强大的评估框架来确保模型的性能、准确性、安全性和公正性。

  13. TOOL · CL_211855 ·

    前沿人工智能模型评估政治偏见和伦理推理能力

    一位研究人员评估了前沿人工智能语言模型,评估了它们在与政治偏见、伦理推理和个性特征相关的基准测试中的表现。该研究提供了关于这些人工智能系统如何处理这些敏感领域问题的比较数据。

  14. SIGNIFICANT · CL_197885 ·

    Anthropic洽购AI初创公司Decart,估值60亿美元用于推理技术

    据报道,AI公司Anthropic正与以色列初创公司Decart进行深入洽谈,拟以约60亿美元收购该公司。Decart专注于世界模型和高效AI训练技术。此次潜在收购将是Anthropic迄今为止最大规模的收购,旨在通过整合Decart降低计算成本和提高AI芯片效率的技术,来加强Anthropic的基础设施。Decart的技术包括模拟物理世界和修改实时视频流,在自动驾驶和电子商务等领域有应用,eBay Inc.是其知名客户和投资者。

  15. RESEARCH · CL_190290 ·

    AI 新技巧揭示模型推理,可能存在数据泄露

    研究人员开发了一种从 AI 模型中提取内部推理过程的方法,揭示了潜在的漏洞。该技术可以暴露个人信息,如密码和 API 密钥,尽管此特定缺陷已被修补。该方法还表明,一些中国的 AI 模型可能通过提炼美国模型的推理数据进行训练,尽管缺乏直接的因果证据。这一发现引起了人们对先进 AI 开发中的知识产权盗窃和数据安全的担忧。

  16. TOOL · CL_183431 ·

    新章节详述用于卫星图像分析的“地球嵌入”

    一篇关于“地球嵌入”的新章节已在arXiv上发布,详细介绍了地球观测正转向可重用数据产品,而不是要求用户自行运行大型基础模型。这些嵌入是总结位置或图像块的向量表示,使用户能够在不处理原始卫星图像的情况下分析紧凑的特征。该章节探讨了各种类型的嵌入、它们在土地覆盖测绘和灾害建模等领域的应用,并讨论了海洋和大气覆盖等挑战。

  17. TOOL · CL_180984 ·

    SphereVideo框架通过持续学习改进AI生成视频检测

    研究人员推出SphereVideo,一个旨在改进AI生成视频检测的新持续学习框架。该系统将真实视频特征锚定在超球面上的中心原型周围,排斥生成内容以建立一个抵抗灾难性遗忘的稳定决策边界。SphereVideo还通过在帧和剪辑层面分析动态来增强时间建模,超越了对空间伪影的依赖。实验表明,SphereVideo在区分真实内容和AI生成内容方面优于先前的方法,尤其是在未见过的生成模型上。

  18. TOOL · CL_172868 ·

    TechCrunch Disrupt 2026 将汇聚来自 Amazon、Replit、Tether 的 AI 和企业界领袖

    TechCrunch Disrupt 2026 的主舞台将邀请来自 Amazon、Replit 和 Tether 等大公司的知名领导者。本次会议定于 10 月 13 日至 15 日在旧金山举行,将重点关注在当前由 AI 驱动的环境中构建、资助和扩展业务的实际问题。讨论将涵盖诸如智能手机的演进、AI 驱动的软件创作的未来、稳定币的作用、AI 对公共安全的影响以及 AI 基础设施的需求等主题。

  19. TOOL · CL_167223 ·

    新的“Design Theater”基准测试揭示了生成式UI工具的脱节现象

    一个名为“Design Theater”的新基准测试已被引入,用于评估生成式UI工具。该基准测试旨在识别一种脱节现象,即这些工具提供的设计原理与其生成的实际界面不符。在五个工具和120个生成的界面中,研究人员发现超过25%的陈述性设计原理未被实现,功能性需求失败率高达34%。研究还指出,工具仅识别出约一半的嵌入式UX原则,并在视觉外观和布局上表现出趋同性。

  20. TOOL · CL_164573 ·

    新的AI安全基准测试“Delirium”寻求社区输入

    一个名为Delirium的新AI安全基准测试正在开发中,其创建者正在寻求社区的反馈和参与。该项目旨在评估大型语言模型的安全性和鲁棒性,并提供了一个视觉演示供审查。开发者正在积极寻找合作者为基准测试的创建做出贡献。