Avatar V
让同一位真人持续出镜
- 输入
- 真人参考视频与脚本或音频
- 结果
- 保留人物身份、动作和说话特点的数字分身视频
| 主题、受众、用途、时长与素材 |
| 包含脚本、出镜人、配音、画面和字幕的成片 |
| 把现有视频翻译成其他语言 | Video Translation | 源视频与目标语言 | 完成翻译、配音和口型同步的视频 |
| 让替换后的声音重新对上口型 | Precision Lipsync | 已有视频和新音频 | 嘴部动作与新声音匹配的视频 |
| 为旁白和数字人生成语音 | Starfish Voices | 文本、声音与表达设置 | 可用于旁白或数字人视频的语音 |
Avatar V
Avatar IV
Video Agent
Video Translation
Precision Lipsync
Starfish Voices
下面根据 HeyGen 官方资料介绍 Avatar V、Avatar IV、Video Agent、Video Translation、Precision Lipsync 和 Starfish Voices。
Avatar V
Avatar V 根据一段真人参考视频学习人物外貌、表情、手势和说话方式,再使用新脚本或音频生成数字分身视频。HeyGen 官方介绍显示,它可在不同场景、服装和镜头角度中保持人物身份,适合课程讲师、创始人、销售代表和企业发言人持续出镜。
适合 固定人物长期出镜、课程和企业内容
Avatar IV
Avatar IV 接收一张人物图片和一段脚本,生成带口型、表情和动作的说话视频。真人照片、插画、动漫形象和宠物角色都可以作为输入,适合虚拟主持人、照片数字人和用户头像视频,无需先训练完整的真人数字分身。
适合 照片数字人、虚拟主持人与用户头像
Video Agent
Video Agent 根据主题、受众、用途、时长和语气组织脚本与场景,并安排数字人、配音、视觉素材、字幕、节奏和转场。生成结果可继续修改脚本、声音、画面和场景顺序,适合产品介绍、员工欢迎、活动预告和社交短片。
适合 产品介绍、欢迎视频、活动预告与社交内容
Video Translation
Video Translation 接收已有视频和目标语言,完成翻译、配音和口型同步。HeyGen 官方页面写明该产品覆盖 175 种以上语言和方言,并尽量保留原说话者的声音、语气和表情,适合课程、营销、客户培训和企业视频本地化。
适合 课程本地化、国际营销和跨地区沟通
Precision Lipsync
Precision Lipsync 根据已有视频和替换音轨重新调整人物嘴部动作,让新声音与原画面中的说话节奏匹配。它可以单独处理配音视频,也能与 Video Translation 和声音克隆配合使用。
Starfish Voices
Starfish Voices 把文字转换成语音,可单独生成旁白,也可用于 Avatar 视频、Video Agent 和模板视频。语速、情绪与停顿设置会影响数字人的口型、动作时间和成片节奏。
HeyGen 在 Avatar V 技术报告中公布了人物视频评测结果。评审使用 5 分制,对身份一致性、口型同步、动作自然度、动作连贯性、瑕疵控制和视觉质量进行评分。
| 模型 | 身份一致性 | 口型同步 | 动作自然度 | 动作连贯性 | 瑕疵控制 | 视觉质量 |
|---|---|---|---|---|---|---|
| Avatar V | 4.98 | 4.69 | 4.48 | 4.57 | 4.75 | 4.78 |
| Seedance 2.0 | 4.84 | 4.64 | 4.13 | 4.44 | 4.61 | 4.17 |
| Veo 3.1 | 4.34 | 4.62 | 3.88 | 4.05 | 4.66 | 4.76 |
| Kling O3 Pro | 4.18 | 4.40 | 4.21 | 4.12 | 4.19 | 4.45 |
| OmniHuman 1.5 | 4.70 | 4.04 | 3.59 | 3.87 | 3.89 | 3.81 |
左右滑动查看全部评测指标
每条视频至少由两名不了解模型名称的评审独立打分。下表整理自报告中的 MOS 平均意见分数,属于 HeyGen 发布的评测结果,不代表 HiAPI 的独立测试结论。
查看 Avatar V 技术报告
先确定数字分身、照片数字人、完整成片或视频翻译,再写清受众、用途、时长、语言和发布渠道。
根据所选产品准备经过授权的真人视频、人物照片、已有视频、脚本、产品截图和品牌素材。
选择出镜人和声音,确认脚本结构、视觉素材、字幕、画幅与场景顺序。Video Agent 可以自动完成其中多项设置。
生成第一版视频后,修改脚本、发音、人物、画面或字幕,再检查事实、品牌内容和目标语言表达后发布。
根据所选产品准备人物素材、脚本、源视频和品牌文件。涉及真人照片、视频或声音时,需要先取得本人授权。
01
真人数字分身可选择 Avatar V,照片数字人可选择 Avatar IV,从需求生成完整视频可选择 Video Agent,翻译已有视频可选择 Video Translation。
02
使用真人素材前要取得本人同意,并按平台要求完成授权或身份验证。参考视频、照片和音频应清晰,授权记录也要妥善保留。
03
准备脚本、产品截图、屏幕录制、Logo、字体、颜色和参考文件。批量制作时,可将固定版式与会变化的名称、数字和章节分开。
04
提前列出人名、数字、缩写和行业术语的正确发音与字幕写法。制作多语言视频时,还要确认目标语言表达是否自然准确。
05
完成生成后检查人物形象、口型、发音、字幕、事实和品牌素材。面向客户或公开发布的视频应保留人工审核。
Avatar V 同时参考人物身份、面部表情、手势和说话方式,在更换脚本、场景、服装或镜头后继续使用同一位数字分身。系列课程、产品视频和管理层沟通可以由固定人物持续出镜。
Video Agent 可从主题和制作要求开始,也可接收已有脚本。它会组织视频计划、场景、数字人、配音、视觉素材、字幕和转场,生成一条可以继续编辑的完整视频。
Video Translation 会处理文本翻译、目标语言配音和人物口型,并尽量保留原说话者的声音、语气和表情。HeyGen 官方页面写明支持 175 种以上语言和方言,可将课程、广告、访谈和企业视频扩展到更多地区。
HeyGen 开发者平台提供 API,并公开批量请求和 Webhook 等开发方式。内容系统、课程平台和客户工具可以提交视频任务,在任务完成后接收结果,用于批量更新产品讲解、课程章节和客户视频。
Video Agent 生成的项目可在 AI Studio 中继续调整脚本、人物、声音、画面、字幕、时间和布局。团队可以先生成初稿,再校对事实、替换素材并统一品牌样式。
HeyGen 开发者入口包含 API、CLI、MCP 和类型定义。开发者可以把数字人生成、视频翻译和语音能力接入内容发布、客户沟通、数据报告或知识库更新流程。
将制度更新、操作步骤和课程内容制作成由固定讲师出镜的视频。脚本或产品界面变化时,可修改对应章节和素材,并从同一份课程生成多语言版本。
把产品文档、更新说明和帮助文章整理成脚本,由数字人讲解,并加入屏幕录制、产品截图和图形素材。产品界面更新后,可以替换相关镜头和台词。
将已有课程、广告、访谈或企业视频翻译成目标语言,同时生成配音并同步人物口型。不同语言版本可以保留原讲师、发言人和主体画面。
根据客户行业、产品使用情况和关注问题准备脚本,由固定销售代表的数字分身制作演示、跟进和客户成功视频。批量制作前仍需确保每条脚本使用准确的客户信息。
将文章、播客提纲、活动信息或产品观点交给 Video Agent,生成包含数字人、脚本、视觉素材和字幕的短视频,并根据不同主题调整开头、人物和画面。
使用管理者或企业发言人的数字分身制作业务更新、季度回顾和跨地区通知。数字、措辞或目标语言变化后可更新脚本,公开发布前需要人工核对内容。
Create a 30-second product explainer for a project management app. The audience is startup founders. Use a friendly presenter, show the weekly planning workflow, and end with a clear invitation to start a free workspace.提示词写明了目标受众、产品类型、演示重点和结尾动作,Video Agent 可以据此安排脚本、人物与产品画面。
Make a 45-second welcome video for new employees joining a remote software company. Keep the tone warm and direct. Introduce the first-week checklist, where to ask questions, and the Friday team demo.提示词写明了视频时长、语气和新员工第一周需要了解的内容,生成结果会更接近真实的入职安排。
Create a lesson introduction for Chapter 3 of a customer support course. A professional instructor should explain how to identify the real issue behind an angry message and preview the two practice exercises.提示词包含章节位置、学习目标、讲师类型和练习内容,可帮助 Video Agent 组织课程开场与讲解顺序。
Produce a 20-second vertical video for LinkedIn and Instagram. A concise presenter explains three mistakes teams make when localizing product videos. Use on-screen keywords and finish with one practical recommendation.提示词指定了发布渠道、竖屏画幅、时长、信息数量和结尾内容,可直接约束成片节奏与字幕安排。
HeyGen Avatar V 已可通过 HiAPI 调用,支持台词配音或音频驱动。其他 HeyGen 产品仍在逐步接入。
进入 HiAPI 控制台,在同一账户中查看余额、API Key、调用日志、视频任务和模型广场。新用户可按当前活动领取体验积分。
在 API 密钥页面创建密钥,并保存在服务端环境变量或密钥管理工具中。不要把 API Key 写进公开仓库或浏览器前端代码。
进入 heygen-avatar-v 模型页,选择预置数字人,并使用台词配音或驱动音频生成视频。
文档列出 heygen-avatar-v 的完整参数、497 个数字人形象、102 个声音以及视频和 SRT 返回方式。
按文档提交 heygen-avatar-v 任务,通过回调或任务详情获取视频;启用字幕时同时读取 SRT 产物。
Avatar V 与其他视频、图像、语音和文本模型共用 HiAPI 账户、API Key、异步任务、日志和产物存储流程。
在同一个 HiAPI 账户中管理余额、API Key、调用日志和生成任务,无需为每个模型重新建立一套账户。
模型广场提供不同输入方式、画面风格和声音能力的视频模型,可以用同一条真实需求比较结果。
使用同一套任务创建、状态查询、回调、日志和产物接口调用 Avatar V。
Avatar V 模型页展示按生成视频实际秒数计费的规则,API 文档提供完整参数。
页面只把已验证的 Avatar V 参数和返回结果列为可调用能力;其他 HeyGen 产品仍单独标注接入状态。
账户、API Key、任务状态、生成失败或用量问题都可以通过 HiAPI 联系入口反馈,并附上任务信息帮助排查。
HeyGen 包含数字人、完整视频生成、视频翻译、口型同步和语音产品。Avatar V 与 Avatar IV 负责数字人视频,Video Agent 负责从需求生成完整视频,Video Translation、Precision Lipsync 和 Starfish Voices 分别处理翻译、口型与语音。
Avatar V 从真人参考视频中学习人物身份、表情、手势和说话方式,适合长期使用同一位真人出镜。Avatar IV 从一张照片和脚本生成说话视频,也支持插画、动漫和宠物角色。
Video Agent 根据主题、受众、用途、时长和语气组织脚本与场景,安排数字人、配音、视觉素材、字幕、节奏和转场。生成后的脚本、声音、画面和场景顺序仍可继续编辑。
HeyGen 主要处理数字人讲解、培训课程、产品介绍、企业沟通和多语言视频。Seedance、Grok Imagine 等通用视频模型更适合生成电影感镜头、复杂动作和没有固定出镜人的视觉短片。
可以。Avatar IV 可根据人物照片创建照片数字人,Avatar V 可根据真人参考视频创建数字分身。使用真人照片、视频或声音前,需要取得本人授权,并完成平台要求的同意与身份验证。
HeyGen 官方页面写明 Video Translation 覆盖 175 种以上语言和方言。它会处理翻译、配音和口型同步,并尽量保留原说话者的声音、语气和表情。
建议写明目标受众、视频目的、时长、语气、画幅、发布渠道和必须出现的信息。产品文档、品牌素材、截图或参考视频也可以作为制作依据。
适合需要反复更新同类视频的团队。课程系统、内容平台、客户工具或自动化流程可以准备脚本和素材,提交视频任务,并在生成完成后接收结果,再交由人工审核。
可以调用 heygen-avatar-v 生成数字人视频。Avatar IV、Video Agent、Video Translation 等其他 HeyGen 产品仍在逐步接入。
在 heygen-avatar-v 模型页查看使用入口和按实际视频秒数计费的价格,在 API 文档查看完整参数、请求值和返回结果。
先确认人物授权,再检查人物形象、口型、事实、数字、专有名词发音、字幕、品牌素材和目标语言表达。面向客户或公开发布的内容应保留人工审核。
Seedance 2.0 支持多镜头与参考素材视频,Grok Imagine Video 适合创意短片,HappyHorse 1.0 支持原生声音视频,ElevenLabs Dialogue 适合多人对话与旁白。可以点击相关模型卡片查看详情。