Veo 3.1
PulseAugur coverage of Veo 3.1 — every cluster mentioning Veo 3.1 across labs, papers, and developer communities, ranked by signal.
- developed by SynthID 90%
- developed by Gemini Omni 90%
- developed SynthID 90%
- competes with Kling 80%
- competes with Kling 3.0 70%
- competes with Sora 2 70%
- used by Nano Banana Pro 70%
- affiliated with SynthID 70%
- used by Gemini Omni 70%
- competes with Seedance 2.0 60%
- competes with Runway Gen-4.5 60%
- competes with Nano Banana Pro 60%
8 天有情绪数据
-
新基准CaliBench测试视频世界模型的物理校准
研究人员推出了CaliBench,这是一个旨在评估视频世界模型物理校准的新基准。与评估生成结果的现有方法不同,CaliBench在离散的、物理上可解释的空间(如掷骰子或转轮盘)中对结果进行评分。这使得可以直接衡量模型准确表示特定现象不确定性的能力。该基准应用于九个场景和六个领先的视频模型,结果显示大多数模型在校准方面存在困难,通常将概率质量集中在少数几个结果上,或得分较低,尤其是在处理模糊结果时。
-
LTX-2.5 开放世界模型支持在 NVIDIA GPU 上进行本地 AI 视频制作
一款新的开放权重世界模型 LTX-2.5 已发布,它使创作者能够在本地 NVIDIA RTX GPU 上执行视频生成和其他 AI 任务。该模型显著降低了 VRAM 要求,使得先进的视频制作在桌面硬件上即可实现。与现有的闭源替代品相比,LTX-2.5 提供了更高的稳定性和速度,能够快速迭代和批量生成内容,无需支付云服务费用。
-
Google Gemini 将视频生成切换至 Omni Flash,影响消费者体验
Google 已在其消费者 Gemini 应用中悄悄地将 Veo 3.1 替换为 Gemini Omni Flash 进行视频生成,这一变化发生在 2026 年 5 月 19 日左右。虽然 Veo 3.1 仍可通过 API 获得更高质量的 4K 输出,但面向消费者的模型现在具有不那么透明的使用限制,并且在多轮编辑中的一致性有所降低。建议用户调整其针对 Omni Flash 的提示策略,专注于场景含义和风格,而不是技术摄像机细节,并由于…
-
虚假的Veo 3.1 AI工具传播恶意软件,冒充Google的服务
诈骗者正在创建虚假的网站和APK,冒充Google的Veo 3.1 AI视频生成工具,承诺无限使用和高级功能。这些恶意网站通常通过搜索引擎结果找到,旨在诱骗用户下载可能窃取密码和加密钱包数据等敏感信息的恶意软件。虽然Google官方通过Gemini API和Google AI Studio等平台提供Veo的访问权限,但没有独立的下载应用程序。这种趋势与之前使用虚假AI工具传播恶意软件的攻击类似,凸显了AI领域冒充风险的日益增长。
-
海鸥AI视频更便宜但对俄罗斯用户来说代价高昂,质量也落后
AI视频生成服务海鸥(Hailuo)虽然比Kling等竞争对手便宜,但对俄罗斯用户来说存在重大挑战。从俄罗斯可以直接访问海鸥,但支付需要通过第三方中介,这会增加可观的费用并带来潜在的账户风险。独立评测表明,海鸥的视频质量,尤其是在风景场景和原生4K输出方面,落后于Kling、Runway Gen-4.5和Luma Ray3等竞争对手。此外,海鸥的音频同步和视频长度限制需要额外的处理,这与一些竞争模型不同。
-
Poe AI 削减免费套餐,高端模型成本引发用户担忧
Poe AI 调整了其计算点数系统,在未公开宣布的情况下,将每日免费套餐额度从 3000 点大幅削减至 300 点。该平台提供各种订阅套餐,费用根据所使用的 AI 模型而定,而不仅仅是购买的总点数。虽然 Poe 旨在成为一个模型无关的平台,但像 Claude-Opus-4.5 这样的高级模型重度用户发现,即使是最高级别的订阅套餐,每日使用量也有限,这可能比直接订阅单个模型更昂贵。
-
Topview MCP 将 ChatGPT 和 Claude 连接到媒体生成工具
Topview 开发了一种模型上下文协议 (MCP),允许 ChatGPT 和 Claude 等 AI 聊天机器人与外部媒体生成和营销工具集成。该协议使聊天机器人能够充当接口,将视频创建、图像编辑或市场研究等任务的请求发送给专用工具,而不会中断用户的流程。MCP 服务器将支持的 AI 助手连接到 Topview 的平台,然后该平台利用 Seedance 2.5 和 Kling 3.0 等各种模型来处理请求,并将结果直接返回到聊天机器人对话中。
-
Kling AI视频模型评分虽高,排名却居第11位
Kling AI的最新模型Kling 3.0 Pro在独立的图生视频排行榜上排名第十一,落后于Veo 3.1和Gemini Omni Flash等竞争对手。尽管排名如此,Curious Refuge的一份独立评测给予Kling 3.0高分,称其可预测性强。文章详细介绍了Kling生成视频内容的成本,定价基于分辨率、声音和时长。起步套餐为6.99美元包含660积分,约可生成十一个带声音的五秒短片,但由于可能出现的生成失败,实际可用短片数量可能更少。
-
智象未来发布vivago R1,号称全球首个无限时长视频生成智能体
智象未来(HiDream.ai)发布了其最新的多模态智能体vivago R1,该产品号称全球首个支持无限时长视频生成与编辑。vivago R1旨在解决当前AI视频生成在时长、逻辑连贯性和稳定性方面的痛点,通过长任务思考和AgentOS的全流程调度,提升商业化交付的效率和质量。该产品采用混合架构,整合了自研模型与第三方视频模型,并通过上层的Agent编排实现其核心价值,而非完全依赖单一自研模型。
-
AI 视频模型排名因侧重演示而非客户效用而受到批评
Reddit 上的一项讨论强调,目前对 AI 视频模型的排名通常基于病毒式传播的演示片段,而不是实际的客户工作效用。该帖子认为,对于个人创作者或小型机构而言,实现特定结果的能力比模型在基准测试中的总体表现或其基于简短、令人印象深刻的演示而获得的受欢迎程度更重要。Kling、Veo 3.1、Sora 2、Hailuo 和 Seedance 等模型在这些不断变化的排名背景下被提及。
-
新的越狱框架利用文本到视频模型中的时间一致性
研究人员开发了一个名为BSB的新框架,利用文本到视频(T2V)模型中的时间一致性进行越狱。该方法将有害意图编码为安全边界状态之间的转换,然后对这些状态进行插值以生成不安全的中介帧。BSB在文本代理空间中使用蒙特卡洛树搜索,并通过稀疏视频评估进行校准,以在黑盒场景中有效地发现漏洞。在Veo 3.1和Sora 2等模型上的实验表明,BSB在攻击成功率方面比现有越狱方法平均提高了18.6%,表现更优。
-
Veo 3.1 提示词实现电影级质量
本文探讨了为 Veo 3.1 模型设计的五个提示词,旨在生成电影化和视觉描述性强的输出。作者分享了这些提示词,并建议它们可以唤起强烈的氛围感和细节感,类似于电影场景。
-
Google Photos 为订阅用户新增 AI 视频混剪工具
Google 正在为其 Google Photos 应用推出一项名为视频混剪(Video Remix)的全新 AI 驱动功能。该工具由 Gemini Omni 模型提供支持,允许订阅用户通过简单的文本提示来转换和编辑现有视频。用户可以应用电影级补光、背景更换和艺术滤镜等效果,从而无需专业软件即可更轻松地进行视频编辑。
-
AI视频生成器Veo、Kling、Sora、LTX和Grok在相同提示下的比较
使用相同的提示和设置,在七个不同的场景中对五个领先的AI视频生成模型——Veo 3.1、Kling v3 Omni、Sora 2 Pro、LTX-2.3 Pro和Grok Imagine Video 1.5——进行了比较。评估旨在评估2026年中期AI视频生成的现状,并将其与过去几年中常见的伪影(如扭曲的面孔和多余的手指)进行对比。测试场景包括从中世纪骑士到杂耍表演,再到一只惊慌的猫,以及特定的流行文化参考。
-
AI视频工具Seedance、Kling、Sora领跑六方对比
近期对六款主流AI视频生成工具的比较显示,该领域取得了显著进展,Seedance 2.0、Kling 3.0和Sora 2.0等模型展示了令人印象深刻的能力。Seedance 2.0在多模态输入和叙事一致性方面表现出色,但面临计算能力和内容限制的挑战。Kling 3.0在中文叙事和角色互动方面表现突出,而Sora 2.0在物理真实感和长视频连贯性方面保持高标准,尽管生成时间较长且控制精度较低。评测还涵盖了用于企业用途的Tongyi W…
-
谷歌的 Nano Banana Pro 因逼真的 AI 图像生成而受到赞誉
Nano Banana Pro 是谷歌 Gemini 生态系统内集成的一款 AI 图像生成工具,因其逼真的图像输出和角色一致性而受到赞誉。该工具允许用户生成静态和动画图像,使用自然语言提示对现有照片进行混搭,甚至使用 Veo 3.1 将图像转换为视频。它与 Pixel 和 Chromebook 等谷歌产品的无缝集成提供了便捷的用户体验。
-
新的防御机制VPA-Guard解决了AI视频生成中的视觉提示攻击问题
一篇新研究论文介绍VPA-Guard,这是一个旨在保护图像到视频生成模型免受恶意视觉提示攻击的防御框架。这些攻击利用箭头或表情符号等视觉线索来操纵模型生成有害内容。该论文还提出了VVA-Bench,这是第一个专门用于评估这些以视觉为中心的提示攻击的基准测试。实验表明,当前最先进的模型极易受到攻击,但VPA-Guard在保持模型效用的同时,能有效降低攻击成功率和有害性得分。
-
用于视频和图像生成的AI模型及其API访问方式详解
两篇近期文章详细介绍了用于生成视频和图像的AI模型,重点关注实际应用和API访问。在视频生成方面,Veo 3.1、Seedance 2.0和Kling v3针对不同用例提供了不同的选择:Veo 3.1适用于高质量带声音的视觉内容,Seedance 2.0适用于成本效益高的内容生成,Kling v3适用于可控运动。在图像生成方面,Nano Banana Pro和GPT Image 2分别因其照片级真实感和文本渲染能力而受到关注,同时提供…
-
Claude Fable 5 和 Higgsfield MCP 在 90 秒内构建价值 1 万美元的网站
一位开发者展示了一个工作流程,使用 Anthropic 的 Claude Fable 5 和 Higgsfield MCP 在 90 秒内创建高端 3D 滚动网站。该流程利用了 Claude Fable 5 的编码和网站克隆能力,并结合了 Higgsfield 对各种图像和视频模型的集成。最终的网站,API 支出成本低于 10 美元,可以以 8,000 至 12,000 美元的价格推销给客户。
-
Avatar V 框架生成行为可识别的虚拟形象视频
研究人员推出了 Avatar V,一个用于生成高度逼真且行为可识别的虚拟形象视频的新框架。与依赖静态图像的先前方法不同,Avatar V 以完整的视频参考为条件,以捕捉说话节奏和手势等动态特征。该系统利用稀疏注意力机制和专用的运动流来实现高保真结果,性能优于 Seedance 2.0 和 Kling O3 Pro 等现有模型。