Donut
PulseAugur coverage of Donut — every cluster mentioning Donut across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的合成数据集提升波斯语OCR能力
研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。
-
新的“伪造答案”攻击目标是无OCR的DocVQA模型
研究人员开发了一种名为“伪造答案”的新型对抗性攻击方法,该方法可以伪造文档内容来操纵无OCR的文档视觉问答(DocVQA)模型。通过创建视觉上不易察觉但语义上具有针对性的伪造文档,该攻击可以诱导特定的错误答案或导致系统性模型故障。该攻击的有效性已在Pix2Struct和Donut等最先进模型上得到验证,凸显了当前DocVQA系统存在的重大漏洞以及改进防御措施的必要性。
-
研究比较多模态模型用于文档分类
一篇新研究论文分析了用于分类视觉丰富文档的多模态方法,比较了基于Transformer和LLM的架构。该研究在RVL-CDIP基准上评估了LayoutLMv3、Donut、Qwen3-VL-32B-Instruct和Qwen3-32B。结果表明,专门的多模态Transformer对于具有复杂布局的文档更优越,图像信息是分类最关键的因素。
-
FILTR框架使用Transformer从3D模型中提取拓扑特征
研究人员开发了FILTR,一个旨在从预训练的3D模型中提取拓扑特征的新型框架。该方法将Transformer解码器应用于生成持久性图(persistence diagrams),这些图直接从冻结的编码器中总结形状的多尺度结构。尽管现有的3D编码器显示出有限的全局拓扑信号,FILTR有效地利用其输出来近似这些图,从而实现从原始点云进行数据驱动的提取。