数字人总在换脸?HeyGen Avatar V 让同一个你在 175 种语言里保持一致

要做一条出镜视频,真正吃掉时间的往往不是内容本身,而是那几件重复的事:架灯、补妆、换三套衣服,再把同一段话对着镜头重说一遍。数字人想省掉的正是这一环,但它过去几年总卡在同一个位置——单看一帧还行,连成一段就露馅:换个背景脸会飘,说长一点口型开始错位,语种一多更是直接崩。

HeyGen 是这条赛道里迭代较快的平台之一。它当前主推的 Avatar V 模型在官方页面上给出的说法很直接:录一段 15 秒的摄像头短片,就能得到一个跨场景保持一致的数字分身,并且能讲 175 种以上语言与方言。数字人从「像」到「是」,中间隔的其实就是这句话里的两个词——一致,和跨语言。

数字人好不好用,看的从来不是单帧

Avatar V 官方页把「角色一致性」放在整页的第一条能力上,措辞也不绕:一致性是区分「能用的数字分身」和「噱头」的那条线。页面对它的定义是,同一个人脸、同一套微表情、同一种气质,在一段 30 秒短片和一段 10 分钟课程模块里都成立,不漂移、不带伪影、不掉进恐怖谷。

同一位数字人在不同背景与造型下的三组画面

这句话背后是一个技术路线的切换。Avatar V 之前的做法基本是「从一张照片出发去驱动一张脸」,参考图只有一帧,模型能拿到的身份信息就那么多;Avatar V 改成在整段参考视频的上下文窗口上工作,让模型自己去挑录制素材里信息量更大的那些时刻。

把身份从外观里拆出来

官方页对新一代模型的解释是:它把「你是谁」和「你长什么样」拆成两件事。模型学的是你移动、做手势、表达情绪的具体方式,学到之后这段动作可以被套用到任意一个版本的你身上。落到使用上就是——录制一次,穿什么、在哪录都不重要,之后可以让数字分身出现在任意背景、任意服装、任意造型里。

面部身份特征被逐帧提取与标注的画面

具体做法是选择性注意力:模型从多帧里提取嘴部几何、面部轮廓结构与表情过渡模式这类身份信号,同时主动压掉那些姿态、光照或遮挡不佳的帧。这样聚合出来的身份表示是跨帧、带时间信息的。官方把它针对的问题叫「身份漂移」——单帧条件模型里参考身份和生成结果会逐渐分叉,而这套做法声称不需要额外微调或补充参考输入就能在场景、机位和长视频时长上维持稳定。

官方给出的量化口径是长视频一致性可稳定超过 30 分钟,生成时对视频时长与画质不设上限;训练则拆成三步:先在同一个场景内学会忠实复制面部外观,再跨场景微调去补上背景、光照与姿态分布的差异,最后用带人类偏好奖励信号的强化学习去拉高身份相似度。

另一位数字人在同一录制素材下生成的三个镜头

Video Agent:一句话出成片,而且渲染后还能改

数字分身解决的是「你出镜」这件事,HeyGen 另一个并行的产品线解决的是「片子从哪来」。Video Agent 的用法是一段提示词直接生成成片,官方强调它不只产出一颗说话的人头,而是把动态图形、视觉叠加、说明性动画和 B-roll 素材一起组织进叙事里——脚本、配音、画面、转场这几步都在同一次生成里完成。

数字人视频生成完成后进入发布环节的画面

更有意思的是可编辑性。官方写明每一个动态元素在渲染完成之后仍然是可编辑的:文字、位置、颜色、时间轴、布局,都能在 AI Studio 里直接改,不需要为了改一行字把整条视频重新渲染一遍。另外它也提供发布前的预览,可以按场景拆解创意、用自然语言继续调整。这两点合起来才是它和「一次生成、不满意只能重来」的分野。

视频翻译换掉的不只是声音

多语言是数字人最自然的延伸场景,也是 HeyGen 起家时最有辨识度的一块。官方视频翻译页的流程是:上传本地视频或者粘贴一条 YouTube 链接,选好引擎与目标语种,之后由平台完成翻译、配音与口型对齐,不需要重拍,也不需要人工对口型。翻译过程中会保留原说话人的音色、口型与表情。

把英文视频翻译成意大利语并同步口型的界面示意

操作层面有一个细节值得记:单次可以选择最多 10 种语言同时翻译,也就是说一条母版可以并行铺开多个语种,而不是一门一门地排队。品牌侧的控制也做了专门设计,升级后的术语表支持强制翻译、受保护术语与发音校正,可以建术语集合、改译文,用一段视频生成多个语言版本;视频集合还能配一个多语言播放器,方便直接嵌到页面或 LMS 里。

身份验证不是补丁,而是前置条件

数字人这个品类绕不开信任问题。HeyGen 的做法是把身份验证放在创建环节最前面:每一个自定义数字分身都要求被拍摄者本人完成镜头前的身份验证,没有验证就没有分身,被拍摄者提出的删除请求始终会被执行。内容侧则是机器学习扫描加人工复核两道,官方明确划出的红线包括暴力、政治竞选与伤害未成年人。

价格结构上,免费计划每月可以生成 3 条视频、单条上限 1 分钟,适合先验证效果;Creator 每月 29 美元起,把单条时长放开到 30 分钟、支持 1080p 导出与声音克隆,语言覆盖也升到 175 种以上;Pro 每月 49 美元起,主要差别在 4K 导出与更快的处理速度;Business 每月 149 美元起,增加自定义数字分身数量、席位管理与协作能力。团队规模越大,这套按席位加积分的设计越需要提前估算用量。

从产品结构看,HeyGen 把「生成分身」「生成成片」「翻译本地化」这三件原本分散在不同工具里的事放进了同一条流水线,这是它相对完整的部分;需要留意的是额度与并发按档位限制,重资产团队在选档前应该先按实际出片频率算一遍积分消耗。

数字人真正的门槛从来不是单帧像不像,而是跨场景、跨时长、跨语言之后还像不像。Avatar V 把身份从外观里拆出来处理,解决的正是一致性;Video Agent 与视频翻译则把从脚本到多语种成片的路一起补齐。到官网可以按自己的出片量先试免费档,再决定要不要升级。

HeyGen下载地址
支持的操作系统: Web