口播数字人视频 (Spotlight Video) 制作教程

生成 AI 数字人脚本、渲染配音以及合并短视频片段的完整逐步指南。

返回功能指南

第一阶段:项目创建与配置(表单视图)

Sgen AI 口播数字人项目面板与归档面板

点击列表页面右上角的“+ Create Spotlight Project”,打开创建表单:

1. 基础卖点参数
  • 项目标题:填写该项目的内部管理标题。
  • 从 Asset HUB 导入:点击“Import from Asset Hub”按钮,从 Asset HUB 中选择项目。这将自动填充产品名称和独特卖点 (USP)。
  • 目标受众:定义目标人群(例如:25-35岁的马来西亚护肤品买家)。
  • 演讲者语调:概述 AI 数字人的特征(例如:热情的邻居、临床配方科学家)。
口播数字人项目基础参数配置表单
2. 语音口音选择
  • 目标语言:选择数字人的语言(英语、中文、马来语等)。
  • 口音与方言:Sgen AI 动态显示本地化原生口音:
    • - 英语:标准英音/美音、Manglish(马来西亚英语腔调)或企业专业语调。
    • - 中文:华语、马来西亚华人腔调或粤语。
    • - 马来语:Baku(标准)或 KL Slang(吉隆坡俚语)。
  • 核心痛点与角度:输入特定的营销核心点(例如:“在3秒内用脱发痛点吸引用户,然后概述无硅油的好处”)。
目标口音语音与语调表单选项
3. 数字人面部与视觉风格
  • 配音性别:选择女性或男性声音。
  • 参考人像面孔:上传一张人像图片作为面孔布局模板。勾选“Preserve Presenter Look”以在生成的视频中保持面部视觉的一致性。
  • 自定义背景:上传背景图或演播室模板作为虚拟背景。
  • 产品图片插入:批量上传最多5张商品图片,作为展示期间的覆盖图形。
  • 镜头类型与视觉氛围:选择镜头取景(特写、广角、远景)和风格(写实、精致、生活化、专业商务)。
数字人肖像参考面孔与视觉风格表单选项
4. 画面比例与时长限制
  • 时长设置:选择目标秒数(例如:30s,60s)。
  • 片段数量:选择分段数量。剪辑数越多意味着剪辑节奏越快。
  • 画面比例:选择 9:16(竖屏手机格式 - 推荐)或 16:9(横屏格式)。
  • AI 核心引擎:选择用于处理剧本布局的模型。
画面比例视频时长与模型设置表单选项 操作:点击“Generate Script”以运行。

第二阶段:分镜脚本与本地片段渲染

填写完配置页面后,您将被重定向至脚本工作区 (Script Workspace):

1. 画面脚本卡片布局 每张卡片代表一个特定的片段,详细说明如下: • 脚本内容:自动生成的文案内容(可完全编辑)。
• 镜头指令:用于过渡的电影感提示。
• 场景素材:自定义叠加层或背景图的放置。
数字人画面脚本卡片工作区列表布局
2. 生成静态场景画面 点击卡片下方的“Generate Frame”。AI 会根据人物和背景设置渲染出静态的场景主图。您可以重新渲染画面并在版本1、版本2等之间切换。
3. 生成数字人片段 点击“Generate Video”。Sgen AI 将脚本文本转化为本地化配音 (TTS),匹配面部表情的唇形同步路径,并渲染特定的场景视频片段。支持渲染多个版本。 数字人语音 TTS 与视频生成控制面板

第三阶段:视频组装与合并

在渲染完所有单独的片段后,点击右上角的“Export & Merge”以合成最终视频:

1. 输出分辨率 在 1080p 高清或 720p 标准画质之间进行选择。
2. 字幕与样式 勾选“Show Captions”,并从数十种 Google 字体设置(Inter, Poppins, Bebas Neue)、颜色、对齐方式以及入场动画(Pop, Fade, Slide Up)中进行选择。
3. 背景音乐 (BGM) 从免费 BGM 库(Cinematic Epic, Chill Lofi, Upbeat Pop)中选择音频片段,或上传本地 MP3 文件。可手动调整人声和背景音乐的音量平衡。
4. 导出与下载 点击“Merge & Render”。系统会合并所有片段,覆盖字幕,混合背景音频,并输出最终的 MP4。点击“Download Video”将其保存到您的本地文件。 最终视频合成字幕与背景音乐选择设置弹窗