Portable Network Graphics
PulseAugur coverage of Portable Network Graphics — every cluster mentioning Portable Network Graphics across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
Recraft API 图像生成流程详解
本文详细介绍了使用 Recraft API 的图像生成过程,并强调 API 对生成图像的确认并非最终产品。文章概述了一个五阶段的流程:生成、存储、转换、UI 显示和下载,并指出只有第一阶段由 Recraft 处理。作者强调了在用户端验证图像属性的重要性,因为后续由用户基础设施管理的阶段可能会更改图像格式或元数据。
-
新的SceneActBench基准评估VLM智能体在3D交互方面的能力
研究人员推出了SceneActBench,一个旨在评估视觉语言模型(VLM)智能体在与3D环境交互和操作方面能力的新基准。与之前侧重于文本描述或单对象操作的基准不同,SceneActBench在一个统一的智能体-环境循环中,评估了智能体在五个不同3D任务中的表现。该基准使用PNG图像或视频帧,以及3D资产,来测试智能体在复杂、多对象3D场景中执行操作的能力。对十一种不同VLM配置的初步评估显示,性能范围在38.6-50.2之间,表明当…
-
AI代码审查器被恶意图像欺骗;AI内容趋势按年龄分化
一种新的方法已被开发出来,可以将恶意指令隐藏在PNG图像中,然后用于拉取请求。这些隐藏的指令可以窃取存储库的秘密,因为AI代码审查器可能不会处理图像内容。另外,AI生成的内容,如会说话的猫和互相欺骗的水果,在年轻观众中很受欢迎,而老年人则在AI生成的陪伴中找到慰藉。
-
AI模型在图表连线路由方面遇到困难,提出JSON输出方案
一位开发者认为,尽管当前的AI模型能够为图表生成准确的节点标签,但在绘制准确且一致的连线方面却遇到困难。问题源于模型逐个token的生成过程,这阻碍了它们执行复杂图表路由所需的全局约束优化。提出的解决方案是让AI模型输出结构化数据,如JSON,然后由专门的布局引擎(例如ELK)进行处理以生成图表,从而确保一致性和可编辑性。
-
Ghostcommit 漏洞利用恶意 PNG 绕过 AI 代码审查
一种名为 Ghostcommit 的新型供应链攻击已被识别,它以具有多模态功能的 AI 编码工具为目标。该攻击利用恶意 PNG 文件绕过 AI 代码审查器。攻击涉及将恶意负载拆分到两个文件中,使得当前 AI 安全系统难以检测。
-
Glyphic 作为 AI 代理的开源图表基础设施发布
Glyphic 是一个新推出的开源图表引擎,旨在作为 AI 代理的基础设施,提供一种通过 JSON 输入生成图表的编程方式。与 Claude Artifacts 等专有解决方案不同,Glyphic 是模型无关的,允许任何 LLM 生成图表,并且它避免了对无头浏览器的需求,从而能够在各种环境中实现更快的渲染和部署。该引擎可以用作 npm 包,也可以作为 HTTP API 自行托管,使用户能够拥有和控制其图表生成过程。
-
Reddit 从 PNG 中移除 AI 工作流数据,影响 StableDiffusion 用户
Reddit 已开始移除嵌入在 PNG 图像文件中的工作流数据,这一变化影响了 StableDiffusion 及类似 AI 图像生成工具的用户。这些数据,通常被称为元数据或 EXIF 数据,可以包含有关用于创建图像的参数和设置的关键信息。移除这些数据引起了用户对如何有效分享其 AI 艺术工作流和复制特定结果的担忧。
-
AI视频生成丢失色彩精度;开发者找到Alpha通道解决方案
一位AI开发者在从AI模型生成视频时遇到了色彩精度问题,特别是在尝试移除动画图块的背景时。标准的色度键控等方法失败了,导致了不希望出现的瑕疵。开发者通过利用原始静态PNG图像中的Alpha通道来遮罩动画帧,找到了一种更有效的解决方案,为背景移除提供了一种精确且确定的方法。
-
新工具 pxpipe 将文本编码到图像中以降低 AI 提示成本
一款名为 pxpipe 的新开源工具已被开发出来,用于降低使用 Claude Code 等大型语言模型的成本。该工具将冗长的文本提示编码到 PNG 图像文件中,然后由 AI 进行处理。这种方法利用了某些 AI 服务的定价模型,其中图像处理基于像素尺寸而非文本长度,可能将成本降低高达 70%。然而,这种方法可能会导致准确性和速度下降。
-
AI模型使用无头Chrome截图将SVG转换为PNG
一个AI模型通过启动一个无头Chrome浏览器实例并捕获屏幕截图,成功地将SVG文件转换为PNG图像。这展示了AI通过自动化浏览器操作处理文件格式转换的实际应用。
-
vLLM 发布 0.23.1rc0 版本,修复 Dockerfile 依赖问题
vLLM 发布了 0.23.1rc0 版本,其中包含一项关于更新 Dockerfile 依赖图 PNG 的错误修复。此版本由 sfeng33 签发。
-
AI生成标志概念,但最终产品仍需设计师
GPT-Image-2和Nano Banana等AI模型可以根据文本描述快速生成大量标志概念和品牌视觉效果,但它们生成的是栅格图像(PNG),而非可缩放矢量图形(SVG)。虽然这些工具在头脑风暴和创建初稿方面很有效,但在标志上渲染清晰的文本方面存在困难,并且需要人类设计师进行最终确定、矢量化和整合到完整的品牌形象中。推荐的工作流程是使用AI进行概念生成,然后聘请设计师将输出完善为专业、可缩放的标志。
-
QuiverAI 发布 AI 图像矢量化工具;卡内基梅隆大学博士加入 OpenAI
QuiverAI 推出了新的 AI 驱动工具,可在几秒钟内将模糊的 PNG 图像转换为清晰、可缩放的 SVG 文件。该工具可重建图像图层,确保在任何尺寸下都清晰可见,对于处理图标和插图的设计师来说是一个宝贵的资产。另外,拥有卡内基梅隆大学机器人学博士学位的 Tairan He 已正式加入 OpenAI,这标志着这家 AI 研究实验室的一次重要人才引进。
-
量子守门员使用VQC进行安全图像隐写术,具有多因素上下文
研究人员开发了一种新颖的隐写术框架,名为量子守门员(Quantum Gatekeeper),它结合了密码学技术和量子电路将数据嵌入图像中。成功提取隐藏信息需要精确匹配密码、共享密钥、上下文字符串和图像签名。该系统利用变分量子电路(VQC)派生加密密钥,并在IBM的超导量子硬件上进行评估,以评估其在物理噪声下的性能。