PulseAugur
实时 22:39:31
实体 Vision-Large-Language Models

Vision-Large-Language Models

PulseAugur coverage of Vision-Large-Language Models — every cluster mentioning Vision-Large-Language Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_171272 ·

    Vision LLM 以视觉驱动的方法彻底改变 Web 自动化

    Web 自动化正经历着从脆弱、硬编码的定位器(如 XPath 和 CSS 选择器)到更具弹性的视觉驱动方法的重大转变。这种新范例利用多模态 Vision 大型语言模型(LLM),并与 Playwright 和 Puppeteer 等无头浏览器引擎集成。通过使 AI 能够直观地感知和理解网页,这些系统可以动态定位元素并适应底层 HTML 的变化,从而有效地创建自愈测试套件和自动化管道。

  2. RESEARCH · CL_90999 ·

    新框架赋能 VLLMs 自监督概念发现

    研究人员开发了 S$^2$COPE,一个用于视觉-大语言模型 (VLLMs) 自监督概念发现的新框架。这种无标签的方法使用 VLLMs 作为偏好优化循环中的活跃参与者,在没有人工标注的情况下自主生成和强化视觉概念。实验表明,S$^2$COPE 可以在标准 VLLMs 难以处理的领域特定概念提取方面取得成功,从而显著提高下游分类准确性。

  3. RESEARCH · CL_53932 ·

    新的METATR基准评估多语言ATR系统

    研究人员推出了METATR(v1.0),一个旨在评估自动文本识别(ATR)系统,特别是视觉-大语言模型(vLLMs)的新型多语言基准。与专注于现代印刷英语文本的现有基准不同,METATR纳入了29种语言的各种文档,包含多种字体和版式。该基准包括一个标准化的提示和规范化方法,以及一个动态评估框架,以确保可重复性和可扩展性。初步评估显示,虽然专有模型通常表现更一致,但在不同字体和版式之间存在显著的性能差异。

  4. TOOL · CL_29293 ·

    新基准测试VLLM对汉字历史演变的能力

    研究人员推出Chronicles-OCR,一个旨在测试视觉大语言模型(VLLMs)对汉字跨时间感知能力的新基准。该基准涵盖了从古代甲骨文到现代书法,中国文字的完整演变轨迹,解决了缺乏捕捉数千年系统性视觉变化的数​​据集的问题。Chronicles-OCR包含2,800张平衡图像,并提出了一种新颖的标注范式来处理剧烈的形态变化,提供了四项任务来评估VLLMs在历史文本感知方面的局限性。