企业素材:消息素材与音色克隆
AI 对话里能发的图片/文件/语音怎么管理,专属克隆音色怎么从真实录音里提炼出来。
后台「企业素材」页分两个 Tab:消息素材(AI 对话里能发送的图片/视频/文件/语音)和音色素材(从企业自己的通话录音里克隆出的专属音色)。两者除了都挂在这一个入口下,功能上互不相关,分开说。
消息素材
数字员工在微信对话里除了发文字,还能发图片、视频、文件、语音、表情——这些统一叫"消息素材",需要先在这里上传好,AI 才有得选。
点 上传素材,选类型(图片 ≤10MB、视频 ≤50MB、文件 ≤20MB、语音 ≤20MB、表情 ≤2MB),填:
- 名称:素材本身的标识
- 描述:给 AI 看的,帮它判断什么时候该发这个素材,比如"客户问产品功能时发;展示主要卖点"
- 标签:可选,多个用逗号分隔
上传完成后,数字员工可以在两种地方引用这条素材:通过工具调用(AI 判断对话到了合适的时机主动发送),或者挂在某个环节的"欢迎语"里,作为固定开场素材发出去。
素材列表每行支持禁用/启用、复制素材 ID、复制素材 URL、删除。删除前系统会检查有没有数字员工正在引用这条素材,引用中的素材不能直接删。
音色素材(音色克隆)
从企业录音里提炼专属音色的完整流程是:上传录音或选一次人工回拨通话 → 系统自动分离说话人、挑克隆样本 → 确认克隆 → 一键生成真人语料,克隆完成的音色可以在任意数字员工的音色配置里选用。
1. 新建一个音色
点右上角 新建音色,给这个音色起个名字(比如"销售-王芳"),可以选择关联一个坐席。创建会一次性扣费,费用在弹窗里明确标出,创建后进入这个音色的详情页。
2. 往里面加素材:采集录音
详情页点 新增,三种录音来源:
- 从项目通话记录选:挑一条已有的人工接管通话(时长需达到最短要求)
- 本地上传:直接传一段音频文件
- 共享录音库:复用企业内已经转写过的录音(比如训练中心已经处理过的通话)
提交后系统自动做说话人分离和语音识别,处理完成的录音会显示可选的候选片段。
也可以打开 设置,开启"自动采集"——按坐席过滤(不绑定具体项目,这个人在哪个项目下人工接管都会被采集),设置最短通话时长(短于这个时长的通话不采集)和采集时间范围(只采集最近 N 天,0 表示不限制):
3. 挑选克隆样本、微调音频
每条录音处理完成后会标"已同步"或"待同步",并显示识别到的说话人和候选片段数。如果分错了说话人,可以点 换成 N 手动纠正;对识别结果不满意可以 重新分析。
点某条录音的 编辑 进入音频编辑器——基于波形选取/调整候选片段(不同颜色区分未保存、已选中、未选中、待拼接、AI 合成的片段),可以在播放位置新增候选片段,也可以直接对录音本身做裁剪、插入、替换:
音色克隆完成之后,插入/替换功能会用已克隆出的这个人的音色合成新的语音片段——也就是说,这时候可以直接在编辑器里"生成"这个人从没说过的一句话,用来补齐语料。
4. 生成音色 → 同步至语料
选够克隆参考样本后,点 生成音色 提交克隆任务。克隆完成、状态变成"已可用"之后,按钮变成 同步至语料——把选中的真人录音片段和 AI 补全的部分一起注入到一套预置文本的语料库里,让这个克隆音色覆盖足够多的常用话术,供任意数字员工的音色配置直接选用。