PulseAugur
实时 09:54:06
实体 Donut

Donut

PulseAugur coverage of Donut — every cluster mentioning Donut across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 5
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 7 条
  1. TOOL · CL_187122 ·

    据报道 OpenAI 正与 Jony Ive 合作开发 AI 甜甜圈音箱

    据报道,OpenAI 正在开发其首款硬件产品,一款代号为“Donut”的甜甜圈形状的 AI 语音助手设备。该设备与 Jony Ive 合作设计,旨在跟随用户在家中移动。预计将于 2027 年发布,售价在 300 美元至 400 美元之间。

  2. TOOL · CL_165945 ·

    受DONUT启发,小型模型可从白色背景中提取文本

    Reddit的r/MachineLearning板块的一位用户开发了一个能够从白色背景图像中提取文本的小型模型。该项目受DONUT模型启发,最初旨在从收据中提取信息,但被简化为专注于从白色背景中提取文本。开发者分享了该项目的GitHub存储库,并寻求社区的反馈。

  3. TOOL · CL_158618 ·

    新的合成数据集提升波斯语OCR能力

    研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。

  4. RESEARCH · CL_121448 ·

    新框架将轨迹预测与基准指标解耦

    研究人员提出了一个用于自动驾驶轨迹预测的新框架,该框架将训练目标与特定基准指标解耦。这种方法称为轨迹分布评估(TraDiE)策略,将指标优化视为应用于预测分布的下游任务。通过将DONUT模型改编为这个新目标,DONUT-NLL变体在Waymo运动预测基准测试中取得了最先进的结果。

  5. TOOL · CL_110050 ·

    新的“伪造答案”攻击目标是无OCR的DocVQA模型

    研究人员开发了一种名为“伪造答案”的新型对抗性攻击方法,该方法可以伪造文档内容来操纵无OCR的文档视觉问答(DocVQA)模型。通过创建视觉上不易察觉但语义上具有针对性的伪造文档,该攻击可以诱导特定的错误答案或导致系统性模型故障。该攻击的有效性已在Pix2Struct和Donut等最先进模型上得到验证,凸显了当前DocVQA系统存在的重大漏洞以及改进防御措施的必要性。

  6. RESEARCH · CL_65613 ·

    研究比较多模态模型用于文档分类

    一篇新研究论文分析了用于分类视觉丰富文档的多模态方法,比较了基于Transformer和LLM的架构。该研究在RVL-CDIP基准上评估了LayoutLMv3、Donut、Qwen3-VL-32B-Instruct和Qwen3-32B。结果表明,专门的多模态Transformer对于具有复杂布局的文档更优越,图像信息是分类最关键的因素。

  7. RESEARCH · CL_04932 ·

    FILTR框架使用Transformer从3D模型中提取拓扑特征

    研究人员开发了FILTR,一个旨在从预训练的3D模型中提取拓扑特征的新型框架。该方法将Transformer解码器应用于生成持久性图(persistence diagrams),这些图直接从冻结的编码器中总结形状的多尺度结构。尽管现有的3D编码器显示出有限的全局拓扑信号,FILTR有效地利用其输出来近似这些图,从而实现从原始点云进行数据驱动的提取。