PulseAugur
中
实时 01:50:41
实体 Chartography

Chartography

PulseAugur coverage of Chartography — every cluster mentioning Chartography across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. SIGNIFICANT · CL_285144 ·

    Anthropic 发布 Sonnet 5.5,Opus 5.5 在复杂任务上仍领先

    Anthropic 发布了 Sonnet 5.5,这是一个更快、更具成本效益的模型,旨在作为其 Opus 5.5 模型的补充。虽然 Sonnet 5.5 比其前代 Sonnet 5 有显著改进,但 Anthropic 自家基准测试表明,在需要持续判断的复杂、开放式任务上,Opus 5.5 仍然更胜一筹。关于 Sonnet 5.5 在 FrontierCode 基准测试上的表现出现了一个有趣的细节,即更高的努力程度导致分数降低,因为模型…

  2. SIGNIFICANT · CL_230221 ·

    DeepSeek V4 多模态模型权重已发布供检查

    DeepSeek 发布了其 V4 多模态模型的权重和参考代码,允许研究人员检查其视觉处理能力。与简单的图像到文本的附加功能不同,V4 将视觉 token 直接集成到其现有架构中,使其能够参与注意力机制、专家混合(MoE)路由和代理推理。该模型采用 Vision Transformer (ViT) 进行初始编码,然后使用 Aligner 将视觉特征压缩并映射到语言模型的空间中。V4 内的专用机制处理视觉 token,包括修改后的注意力规…

  3. TOOL · CL_196208 ·

    新的Chartography基准测试揭示AI在专业图表理解方面存在困难

    一项名为Chartography的新基准测试已被开发出来,用于评估AI在医学、工程、金融和科学等各个领域的专业图表理解能力。与现有基准测试不同,Chartography包含100项任务,图表采用专业格式,问题由领域专家设计,并经过独立验证。目前最先进的模型在此基准测试上面临挑战,准确率最高仅为45.0%,表明在视觉感知、读取细微特征和解释领域特定约定方面存在重大困难。