DALL·E 2
PulseAugur coverage of DALL·E 2 — every cluster mentioning DALL·E 2 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
AI图像描绘巨大的乌龟使用H3 Minimax攀登山峰
一位Reddit用户分享了一张AI生成的巨大乌龟攀爬大山的图像,该图像使用H3 Minimax创建并使用NomosUni进行放大。用户指出,虽然放大效果不完美,但它显著改善了原始低分辨率视频。该过程包括使用FlowFrames将基础视频插值到更高的帧率,并使用DALL-E 2生成乌龟的初始图像。
-
Stable Diffusion 的开放发布被誉为 AI 历史上的转折点
一篇 Reddit 帖子认为,Stable Diffusion 于 2022 年 8 月的开源发布标志着 AI 历史上的一个关键时刻。作者认为,公开模型权重使得图像生成民主化,将其从企业控制的平台转移到拥有强大 GPU 的个人用户手中。帖子认为,这种民主化引发了关于 AI 艺术、版权和同意的重大文化和法律辩论,并催生了 ControlNet 和 LoRAs 等庞大的开源生态系统和基础设施,巩固了其作为基础技术的地位。
-
OpenAI 的 DALL-E 图像生成工具详解
OpenAI 开发了 DALL-E、DALL-E 2 和 DALL-E 3,这些是人工智能驱动的软件工具。这些程序旨在根据用户提供的文本描述生成图像。
-
OpenAI 的 GPT Image 2 简化图像编辑,取代复杂工具
OpenAI 的 GPT Image 2,也称为 ChatGPT Images 2.0,提供了一种简化的图像编辑方法,取代了对 Stable Diffusion 等复杂本地设置的需求。用户现在可以通过简单的 POST 请求进行单帧编辑,例如修复面部或更改对象。这项基于多模态 GPT-5 主干构建的新功能简化了以前需要复杂工作流程和多种工具的任务。
-
用户寻求AI模型推荐以扩充本地收藏
一位Reddit用户正在寻求推荐以扩充其本地AI模型收藏,并详细介绍了其当前设置和已安装的模型。他们正在寻找令人印象深刻或有趣的AI工具来添加,此前已尝试并评估了Gemma 4和Qwen等多个选项。该用户拥有一台配备16GB显存和64GB内存的高端PC,通过Llama.cpp服务器运行模型。
-
AI取代“Obscure Sorrows”宣传网站上的原创艺术品
一个名为Waxy的新网站已上线,用于推广书籍《Obscure Sorrows》。然而,该网站明显省略了Koenig和其他艺术家创作的原始拼贴插图。取而代之的是,Waxy为每个单词使用了DALL·E 2生成的AI图像,这些图像展示了该模型常见的错误和瑕疵。
-
AI驱动的网站抄袭《Dictionary of Obscure Sorrows》作者的作品
一个关于John Koenig的《The Dictionary of Obscure Sorrows》的新网站出现,其中包含AI生成的图像和一个供用户使用GPT-4创造自己词汇的工具。这个使用与原始项目不同域名的重启项目,引起了粉丝和作者本人的怀疑,因为它似乎是对Koenig十年心血的 wholesale 抄袭。原始项目以创造“sonder”等词汇而闻名,曾是《纽约时报》畅销书,而新网站的AI集成与其探索人类情感的既定使命似乎不符。
-
Andrej Karpathy:LLM赋能个人而非企业
与自上而下从机构扩散的传统技术不同,大型语言模型(LLM)正以独特的方式从个人向上扩散。虽然ChatGPT等消费者应用已迅速普及并极大地赋能了个人,但它们对企业和政府的影响目前更为有限。这归因于LLM的专业知识通用但浅显,组织面临的复杂性和限制,以及固有的企业惯性。
-
OpenAI 利用 CLIP 潜在表示和 DALL-E 推进文本到图像生成
OpenAI 详细介绍了一种使用 CLIP 潜在表示从文本生成图像的新方法,该方法采用先验模型和解码器的两阶段过程。这种方法在保持照片真实感和字幕相似性的同时,增强了图像的多样性,并允许进行语言引导的图像操作。此外,OpenAI 还推出了 DALL-E,这是一个拥有 120 亿参数的 GPT-3 变体,能够根据文本描述创建图像,展示了组合概念和渲染文本等能力。