PixVerse:V6 支持 15 秒 1080p 与原生音频,官方页显示榜单 ELO 为 1,343
PixVerse 是以自研视频基础模型为核心的 AI 视频生成平台,官网首屏把模型分成三条线:V6 负责片段生成,C1 面向电影级制作,R1 指向实时交互世界。三条线的定位写得很直白——V6 对应「精准控制与原生艺术表现」,C1 对应「电影级控制与物理模拟」,R1 对应「高保真人像与动态美学」与「商业协同与多感官同步」。
V6 的规格:15 秒、1080p、原生音频
V6 的官方模型页把能力拆成四条,第一条就是「15 秒 1080p 生成」:更长且更稳定的连续片段,意味着更少的零散素材与手动拼接。第二条是「原生多镜头」,广角、中景、特写和转场逻辑可以在一次生成里给出更完整的叙事结构;第三条是「原生音频」,对白、音效和环境音一起生成;第四条是「画幅比例控制」,在生成前就规划 16:9、9:16 及其他分发画幅。
把这四条放在一起看,V6 想解决的是「一次生成能不能直接拿去发」:时长够长、镜头有结构、声音自带、画幅先定好。模型页也提示输出设置要与渠道对齐,而不是等成片出来再裁。

文生与图生的分工
常见问题里写得很清楚:V6 既支持按文字提示生成视频,也可以让图片产生动态。文生视频适合全新概念,图生视频适合手上已有产品图、角色设计、照片或视觉参考的场景。图生视频的效果很吃输入质量,官方建议用主体清晰、边缘易辨、构图有力的图片,并在提示词里说明镜头是推进、平移、俯仰、跟拍还是环绕;保持角色一致性则可以靠在每个镜头里重复相同的身份锚点,比如固定的发色、服装或配饰。
榜单与 API 价格口径
官网的模型对比区引用了 Artificial Analysis 的图生视频排行榜数据,页面标注截至 2026 年 4 月 2 日。图表里 PixVerse V6 的 ELO 为 1,343,API 价格为每分钟 4.80 美元;同页列出的对照项包括 Grok Imagine 720p(1,333 分、4.20 美元)、Kling 3.0 Omni(1,298 分、13.44 美元)、VEO 3.1 Fast(1,291 分、9.00 美元)与 Sora 2 Pro(1,195.5 分、18.00 美元)。需要说明的是,这是官方页面展示的第三方榜单口径,指标定义、采样时间与竞品报价都会变化,做预算时建议回到当期页面核对。

C1 与工具矩阵
三条模型线里的 C1 定位是面向电影制作的全栈创作引擎。围绕模型,PixVerse 提供五类产品入口:网页版负责常规视频创作;智能体通过对话把创作意图转成工作流,可以一次生成多个镜头;营销中心面向广告与电商,用引导式流程直接产出可投放的营销视频;Canvas 用可编辑图谱把参考、提示词、动作与成片连起来;CLI 则把提示词、参考素材、输出比例与批量任务放进终端。
工具层另有一批轻量入口,包括模板、口型同步、快应用,以及 Ad Master、Director Shots、Promo Mix、音效生成器、图片局部编辑器、Fashion Beat、魔力扩图、视频扩展、Vibe MV 与产品视频二创等。这套结构说明 PixVerse 想做的不是对话框式的生成器,而是把从素材准备到成片输出的环节都放进同一平台。
R1 与 R2:把生成变成可交互的世界
R 系列是更远的一条线。官方公告写明 R1 于 2026 年 1 月上线,官方把它称为实时世界模型,把视频生成从「一次性输出」变成「持续响应输入的流」;三个月后又为 R1 更新了共享世界与个性化化身,让多位用户能实时进入并塑造同一个生成世界。
2026 年 8 月的研究博文解释了 R2 的做法。常规的长视频与实时生成框架通常要经过五段训练流程,反复的能力迁移会损耗生成质量与长时稳定性;R2 把流程合并为两段:先把 Omni Causal AR 作为统一世界模型持续预训练,再把同一因果基座直接蒸馏为实时模型,其加速原则是「加速而不重新学习」。为了让长时间运行的世界不丢失身份与场景,R2 用三条记忆通道分工——Sink Memory 保留角色身份、环境、风格与世界规则这类持久锚点,Rolling History 记录近期运动、姿态、镜头行为与环境变化,Object KV Cache 复用物体级的历史表示。
另有一个叫 Error Bank 的设计值得单独提:它保存代表性的失败状态,在训练中与正常历史一起回放,让模型在偏离已经进入世界状态之后仍能恢复。官方给出的内部阶段评测数据是,长时亮度漂移指标从 0.201 降到 0.129、降幅 35.8%,29 条长序列中有 20 条出现改善;同一博文还提到 R2 在内部评测中把注意力稀疏度做到 90% 以上。这些数字属于官方内部评测口径,不是第三方复现结果。

企业能力与 API
面向企业与开发者,PixVerse 通过开放平台提供 API。官方文档写明视频输出支持到 1080P 分辨率,并说明依托高速生成模型,视频平均约 10 秒完成渲染、最快可达 5 秒;文档还写明其能力基础是完全自研的视频基础模型,平台已被超过 1 亿创作者与企业使用、覆盖 175 个国家。接口能力覆盖文生视频、图生视频、特效、口型同步、转场、延长、运镜、音效、融合、换装与运动控制等。
除了自家模型,PixVerse 也把第三方模型放进同一个工作区,首页模型列表里可以看到 GPT Image 2.5、Seedance 2.5、Seedance 2、MiniMax H3 与 Flux 3。以 Seedance 2.5 为例,官方说明它提供 Video、Transition 与 Reference 三种模式,生成时长支持 4 到 30 秒,参考模式下最多可接受 50 个参考素材,其中图片上限 30 张、视频与音频各 10 条。这类多模型并置,实际是把「选哪家模型」也变成了平台内的一次比较。

游戏与互动娱乐
官方公告还把 R1 延伸到了游戏与互动娱乐。PixVerse Game Engine 的思路是把抽象的游戏机制与视觉表达分开:玩家用自然语言交互,世界在视觉与机制上实时响应,不受预先设计好的固定选项限制。官方同时宣布推出实时互动直播,由 AI 生成角色实时回应观众输入。
几点边界
其一,15 秒与 1080p 是 V6 单次生成的口径,更长的成片仍要靠多段组合或延长能力补齐。其二,榜单与每分钟价格来自官方页面引用的第三方数据,采样时间标注为 2026 年 4 月 2 日,报价可能调整,采购前请以当期页面为准。其三,R2 的亮度漂移降幅与注意力稀疏度均为官方内部阶段评测结果,不代表第三方基准成绩。其四,商用使用权取决于订阅方案,官方模型页明确提示团队在发布付费或面向客户的内容前应先确认自己的方案;同时生成内容需遵守平台社区准则与相关法律法规。
一句话概括:PixVerse 这一轮的看点是把模型分成三条互不重叠的线——V6 用 15 秒 1080p、原生多镜头与原生音频解决「一次生成即成品」,C1 面向电影级控制,R1 与 R2 把生成推进到可持续交互的实时视听世界,再配上覆盖十余类能力的 API 与一个能横向比较第三方模型的工作区。