DIGITAL HUMAN · COMPLETE GUIDE

从真人素材到数字分身,
一篇掌握完整工作流

覆盖网页端与智启AI小程序,系统讲清形象克隆、声音克隆、视频合成、智能剪辑与成片下载。

10 个模块PC + 小程序约 15 分钟阅读
智启AI数字人创作界面
01形象克隆建立专属数字分身
02声音克隆还原自然表达
03视频生成文本 / 音频双驱动

什么是数字人?

数字人是我们在网络世界中的数字分身。通过形象克隆、声音克隆和多语言配音等 AI 技术,只需准备一段真人视频,系统就能生成高度还原的数字形象。

一次采集

完成真人形象与声音素材准备,建立可重复使用的数字资产。

持续创作

输入文案或上传音频,即可持续生成口播视频,减少反复出镜。

多场景复用

适用于短视频、个人 IP、品牌宣传、课程制作与知识科普。

数字分身效果预览真人素材经过克隆后,可在不同内容中持续复用。

数字人可以做什么?

数字人的价值不止是“替代真人出镜”,更重要的是将稳定的形象、声音和内容生产流程沉淀为企业资产。

CONTENT

短视频与个人 IP

批量制作知识分享、产品讲解和品牌栏目,保持稳定更新频率。

BRAND

企业品牌传播

统一代言形象与表达口径,让宣传内容跨渠道保持一致。

EDUCATION

课程与培训

将讲义快速转换为视频课程,内容更新时无需讲师重新录制。

GLOBAL

多语言内容

复用同一数字形象制作多语言视频,降低跨境内容生产门槛。

开通套餐与制作前准备

进入智启AI数字人平台后,先确认账户可用额度,再开始形象和声音克隆。

1

购买数字人套餐

进入平台套餐或服务购买入口,按实际使用频率选择套餐。套餐权益、生成时长与消耗规则以系统页面实时展示为准。

2

兑换码兑换

如已获得兑换码,在账户或兑换中心输入并确认。兑换成功后先检查对应权益是否到账,再继续制作。

3

准备基础素材

准备形象克隆视频、声音克隆音频和首条口播文案。建议先制作短样片,确认形象与声音效果后再批量生产。

高效做法

第一次使用时,按“套餐 → 形象 → 声音 → 短样片 → 正式视频”的顺序操作,返工成本最低。

克隆数字人形象

形象素材决定数字人的稳定度。先把拍摄环节做好,再进入系统上传与确认。

拍摄准备

  • 选择光线均匀、背景干净且环境安静的场地。
  • 人物正对镜头,画面稳定,避免大幅转身、遮挡脸部或频繁移动。
  • 保持自然表情和正常语速,嘴部动作清晰,避免长时间闭嘴。
  • 尽量使用原始清晰视频,不要反复压缩、加滤镜或叠加字幕。
数字人形象克隆示意

上传与确认

01进入形象克隆

在创作平台选择数字人形象或形象克隆入口。

02上传真人视频

按页面提示上传符合要求的视频,并填写形象名称。

03检查授权与画面

确认素材授权、人物主体和画面方向无误后提交。

04等待克隆完成

任务完成后先生成短样片,检查口型、表情与边缘稳定度。

形象定制失败的常见原因

常见原因包括:脸部被头发或手部遮挡、画面过暗或过曝、镜头晃动、多人入镜、人物过小、嘴部动作不清晰、素材经过严重压缩,以及视频规格不符合页面提示。

处理建议:回到原始素材重新剪取一段稳定、正脸、清晰的视频;若仍失败,先用更短素材测试并联系技术支持核查任务状态。

克隆数字人声音

声音克隆分为常规方式与专业版能力。两者都需要干净、连续、无背景音乐的人声音频;专业版更适合对音色相似度和表现力要求较高的内容。

AI声音克隆与音色生成

音频素材规范

  • 使用单人普通话或目标语言录音,不混入他人声音。
  • 关闭背景音乐、混响与明显环境噪声,避免忽远忽近。
  • 保持自然语气、音量稳定和连续表达,不刻意模仿播音腔。
  • 上传前完整试听,去除爆音、断句异常和空白过长片段。
STANDARD

常规声音克隆

操作简单、生成快速,适合日常口播、课程和标准化内容。

PRO

专业版 AI 声音克隆

更注重音色细节与表达还原,适合品牌 IP 和高品质长期内容。

声音克隆失败的常见原因

常见问题包括背景噪声或音乐过强、多人说话、录音音量过低、回声严重、断句过多、有效人声不足,以及上传格式不符合系统提示。

建议使用安静环境重新录制,保留连续自然人声;克隆完成后先用短文案试听,确认音色、语速与停顿是否符合预期。

文本驱动生成视频

文本驱动适合从一段文案快速生成数字人口播视频,是最常用的创作方式。

数字人文案生成与文本驱动
从文案到成片选择形象、声音与驱动方式后即可提交合成。
1

准备或生成文案

可直接粘贴现有文案,也可使用 AI 文案功能生成初稿。正式合成前检查人名、数字、英文缩写和停顿。

2

选择数字人和声音

选择已克隆的专属形象或公共模特,并匹配克隆声音或平台音色。

3

选择驱动模式

根据页面提供的两种驱动方式二选一。不同模式适合的画面与消耗可能不同,可先用短文本比较效果。

4

确认时长消耗并合成

提交前查看预计视频时长与额度消耗,确认无误后创建任务。实际规则以系统提交页为准。

文案优化提示

长文案建议拆成短句,适当加入逗号、句号控制停顿;专业名词可用同音字、拼音或分隔方式测试发音,再确定最终版本。

音频驱动与公共模特

AUDIO DRIVEN

音频驱动视频

已有录音、配音或课程音频时,可直接上传音频驱动数字人。上传前需剪除多余空白,确认音频内容与目标画面匹配。

  1. 选择目标数字人形象
  2. 上传清晰的单轨人声音频
  3. 预览时长与消耗后提交
  4. 完成后检查口型与音画同步
PUBLIC MODEL

使用公共模特

暂时没有专属形象时,可直接使用平台公共模特快速出片,适合测试文案、验证流程与制作临时内容。

  1. 按场景筛选模特风格
  2. 选择声音或上传音频
  3. 先生成短样片确认适配度
  4. 正式内容注意统一人物形象

智启AI小程序快速上手

小程序适合移动端快速拍摄、上传、制作和下载。网页端与小程序端数据可按账户体系使用,具体同步状态以实际页面为准。

智启AI小程序作品管理与操作入口示意
01

扫码进入“智启AI”

完成登录并确认当前账户及套餐权益。

02

克隆数字人形象

按拍摄指引录制或从相册上传素材,确认后提交克隆。

03

进行 AI 声音克隆

录制或上传清晰音频,等待声音模型生成并试听。

04

制作数字人视频

选择形象、声音与文案,确认消耗后创建任务。

05

下载成片

在作品或任务列表打开已完成视频并保存。

使用智能剪辑完成包装

数字人口播生成后,可继续使用智能剪辑完成字幕、画面、音乐和节奏包装,让视频更适合发布。

智能剪辑预览统一字幕、素材与音乐,快速完成发布级包装。
字幕

检查自动识别结果,重点核对专有名词、数字和品牌名称。

素材

补充产品图、场景画面或重点标识,避免长时间单一口播画面。

音乐

背景音乐音量不应盖过人声,商业发布前确认素材版权。

节奏

删除无效停顿,重点信息适当留白,保持观看节奏自然。

下载视频与发布前检查

任务状态变为完成后,在作品或任务列表打开视频并下载。若仍处于生成中,请等待任务完成,不要重复提交相同任务。

下载前完成 6 项检查

READY TO CREATE

你的数字分身,已经准备就绪

先完成一条短样片,再逐步建立稳定的数字人内容生产流程。

进入智启AI工作台