Google Veo 3.1:原生音频与 1080p、4K 输出,官方页列出四项能力领先
Google 的 Veo 是 DeepMind 旗下的视频生成模型,官方把 Veo 3.1 的定位浓缩成一句话:视频,遇见音频。它面向电影人与叙事者,主打原生音频、更强的创意控制与一致性,并通过 Gemini 应用、Google Flow、Google Vids、Google AI Studio 与 Gemini API 等多条路径交付到用户手上。
原生音频:声音和画面一起生成
能力清单里被反复强调的一项,是模型原生生成音频。官方的说法是,音效、环境声甚至对白都来自同一次生成,而不是后期贴上去的音轨。官方给出的示例提示词很能说明问题:画面描述之后紧接着是声音描述,城市的嘈杂、远处的交谈、低沉的说唱节拍,以及角色念出的台词,全都在一条提示词里交代清楚。Veo 3 这一代把「重新设计以求更强真实感」列为更新点,理由正是真实世界物理与音频被放在一起建模。

输出规格与镜头控制
分辨率上,官方写明可生成 1080p 与 4K:1080p 提供更锐利干净的画质,适合剪辑环节;4K 保留更丰富的质感与细节,面向高端制作。
围绕「控制」,官方列出的能力相当具体。运镜控制可以精确指定镜头画面与运动方式,页面给出的示例包括后退、拉近、上移与右移四类;画外扩展为画面之外补出匹配且观感真实的新内容,让成片适配不同屏幕尺寸与形状;在视频里加入对象时,模型会考虑比例、交互与阴影,移除对象时则保留场景原有的构图、交互与阴影。这几项合在一起,解决的是「生成完之后还要不要再返工」的问题。

角色一致性、场景延伸与首尾帧
跨镜头的连贯性靠三组能力支撑。角色一致性通过提供角色参考图实现,官方给出的示例是同一个角色走向镜头、在水下游泳、走进糖果世界,外观在不同场景里保持一致。场景延伸用第一段镜头的最后一秒接着讲故事,把片段延长成更长、更有动态的视频,同时保持视觉与音频一致,页面上有一段舞蹈示例,用四段提示词把同一场景连续延长。首尾帧则是在给定的第一帧与最后一帧之间生成平滑过渡,官方把它形容为「平滑、有巧思、有史诗感的转场」。

用身体、面部与声音驱动角色
更进阶的一组能力是把「人」放进生成流程。角色控制允许用身体动作、面部表情与声音来驱动生成角色,动作控制则先选定视频中的对象,再定义它的运动路径。这两项把提示词从「描述画面」推到了「表演画面」,对需要固定角色出镜的内容尤其有用。

官方给出的评测口径
官方把 Veo 3.1 的强项放在四类任务上:文生视频、图生视频、文本转音视频,以及真实物理。基准部分的说明是,评测者观看了 MovieGenBench(Meta 发布的基准数据集)的 1,003 条提示词与对应视频,Veo 3.1 在整体偏好、文本对齐与视觉质量三项上取得领先;图生视频部分使用 VBench I2V 的 355 组图文对;带音频的文本转视频部分使用 527 条提示词,评测者认为它的音画同步更好;物理子集上,评测者认为它的物理表现更真实。页面还单独写明,Ingredients to Video、Scene Extension、First and Last Frame 与 Object Insertion 四项能力在内部基准的人评对照中取得领先结果。这些结论在页面上统一标注为 2025 年 10 月。
Google Flow:模型、工具与点数计费
Veo 3.1 在 Google Flow 里是主力视频模型。Google 把 Flow 定义为「基于先进生成模型打造的 AI 创意工作室」,除 Veo 3.1 之外还接入 Gemini Omni(融合文本、图片与视频的生成与对话式编辑)与 Nano Banana(图片生成与编辑)。智能体是 Flow 的一个特色:它依托 Gemini 的能力理解项目上下文,陪创作者迭代创意。
工具层是可以自己动手扩展的一层。官方列出了文字叠加、视频画面调整、图片编辑器、分镜脚本工作室、着色器特效、视觉稿、Ribbit、Converge、Character X-ray、pixelBento、Grid Architect 与 Scout360 等工具,并允许用户用自然语言构建专属工具、分享与改造;此外还有面向艺术家的 Flow 创作营计划。
免费额度与订阅档位
按官方价格页,免费方案每天提供 50 个 Google Flow 点数,模型侧包含 Gemini Omni Flash、Nano Banana Pro 与 Veo 3.1,可以用现成工具完成文生视频、图帧生视频、素材生视频、视频延长、视频转视频编辑、场景创建、2K 图片高清重塑与虚拟形象等操作。往上还有三档付费方案:Google AI Plus 为每月 4.99 美元,在每天 50 点之外每月再加 200 点,解锁 1080p 视频高清重塑与自制专属工具;Google AI Pro 为每月 19.99 美元,每月 1,000 点并支持单独购买点数;Google AI Ultra 为每月 99.99 美元,每月 10,000 点,含 4K 图片与视频高清重塑。官方同时说明价格会因市场而异,功能也会随订阅层级、平台与地区不同,并且需年满 18 周岁。
安全、水印与仍在改进的地方
官方写明,用 Veo 生成的视频会带上 SynthID 水印,这项技术用于标记与检测 AI 生成内容;输出还会经过安全评估与记忆内容检查,并对有害请求与结果做拦截。同一页也列出仍在改进的方向:生成自然且一致的语音,尤其是较短的语音片段,团队在继续改进音画同步与语音连贯性。
已经有人在用
官方列出的生产案例包括:Promise Studios 在 MUSE 平台里用它做故事板与预可视化;Volley 把 Veo 3.1 用在 AI RPG《Wit's End》里,生成静态过场与随玩家进度变化的资产;OpusClip 的 Agent Opus 借助它做动效图形与面向中小商家的推广视频。更早的一条线索是与导演 Darren Aronofsky 创立的 Primordial Soup 的合作,双方一起探索把实拍素材与 Veo 生成画面结合的做法,该合作已产出三部由新锐导演拍摄的短片。
几点边界
其一,分辨率、音频与控制类能力的支持范围会随订阅方案与入口不同,采购前应回到当期页面核对。其二,基准数字来自官方页面引用的人评与内部基准,采样时间标注为 2025 年 10 月,任务定义与对比模型都可能变化。其三,Flow 点数与实际可生成的视频条数并非一对一,成本要按自己的用量估算。其四,商用与分发需遵守 Google 的服务条款与生成式 AI 使用政策,涉及真人与版权素材时尤其要确认授权。
一句话概括:Veo 3.1 这一轮的重点是把声音纳入同一次生成,再用 1080p 与 4K 输出、场景延伸、首尾帧、运镜、画外扩展与对象增删把控制权交回创作者;Google Flow 则负责把模型、工具与点数计费收进同一个工作台。