数字人最容易出现的问题,是把“看起来像一个人在说话”误判为“可以正式代表这个人说话”。正式内容必须把技术结果、本人感受和品牌风险放在一起判断。
1. 先确认肖像与声音授权
只使用本人或获得明确授权的人物照片、视频和声音。授权应说明使用主体、平台、用途、期限、可否复用和撤回方式。儿童、员工、专家、客户和公众人物需要更谨慎。
2. 声音自然度单独验收
用耳机和手机外放分别听:金属感、齿音、气声、重音、情绪、语速、停顿、句尾和整体像不像本人。通用合成音可以用于内部样片,但不应未经确认直接代表品牌对外发布。
3. 口型检查到音素与停顿
重点观察起音、爆破音、长元音、数字、英文、专有名词和句尾闭口。后配旁白与原始嘴部运动不是同一驱动源时,即使总时长接近,也可能明显不同步。
不要用字幕掩盖口型问题
如果更换正式旁白,应重新驱动口型;否则需要完整切换到B-roll、图表或不露嘴的画面,而不是在明显说话的脸上继续覆盖新声音。
4. 检查面部稳定和表演
观察眼神、眨眼、牙齿、嘴角、下巴、耳朵、发际线、眼镜、皮肤和肩颈。还要判断表情、动作和场景是否匹配文案,而不是只有技术上的“能动”。
5. 10—15秒预览是强制门槛
先使用最终文案的一部分和最终声音制作短预览。人物、声音、口型、面部和场景任何一项不通过,都不进入长片生成。预览能显著减少付费返工。
6. 正式交付还要检查品牌与技术
- 字幕准确、位置在平台安全区内;
- Logo、片尾、封面和联系方式使用正式品牌资产;
- 无平台水印或未经许可的第三方标记;
- 视频分辨率、帧率、音频采样率、响度和完整解码通过;
- 生成式内容按法规与平台要求完成声明和标识。