企业素材:消息素材与音色克隆

AI 对话里能发的图片/文件/语音怎么管理,专属克隆音色怎么从真实录音里提炼出来。

后台「企业素材」页分两个 Tab:消息素材(AI 对话里能发送的图片/视频/文件/语音)和音色素材(从企业自己的通话录音里克隆出的专属音色)。两者除了都挂在这一个入口下,功能上互不相关,分开说。

消息素材

数字员工在微信对话里除了发文字,还能发图片、视频、文件、语音、表情——这些统一叫"消息素材",需要先在这里上传好,AI 才有得选。

上传素材,选类型(图片 ≤10MB、视频 ≤50MB、文件 ≤20MB、语音 ≤20MB、表情 ≤2MB),填:

  • 名称:素材本身的标识
  • 描述:给 AI 看的,帮它判断什么时候该发这个素材,比如"客户问产品功能时发;展示主要卖点"
  • 标签:可选,多个用逗号分隔

上传完成后,数字员工可以在两种地方引用这条素材:通过工具调用(AI 判断对话到了合适的时机主动发送),或者挂在某个环节的"欢迎语"里,作为固定开场素材发出去。

素材列表每行支持禁用/启用、复制素材 ID、复制素材 URL、删除。删除前系统会检查有没有数字员工正在引用这条素材,引用中的素材不能直接删。

音色素材(音色克隆)

从企业录音里提炼专属音色的完整流程是:上传录音或选一次人工回拨通话 → 系统自动分离说话人、挑克隆样本 → 确认克隆 → 一键生成真人语料,克隆完成的音色可以在任意数字员工的音色配置里选用。

1. 新建一个音色

点右上角 新建音色,给这个音色起个名字(比如"销售-王芳"),可以选择关联一个坐席。创建会一次性扣费,费用在弹窗里明确标出,创建后进入这个音色的详情页。

2. 往里面加素材:采集录音

详情页点 新增,三种录音来源:

  • 从项目通话记录选:挑一条已有的人工接管通话(时长需达到最短要求)
  • 本地上传:直接传一段音频文件
  • 共享录音库:复用企业内已经转写过的录音(比如训练中心已经处理过的通话)

提交后系统自动做说话人分离和语音识别,处理完成的录音会显示可选的候选片段。

也可以打开 设置,开启"自动采集"——按坐席过滤(不绑定具体项目,这个人在哪个项目下人工接管都会被采集),设置最短通话时长(短于这个时长的通话不采集)和采集时间范围(只采集最近 N 天,0 表示不限制):

3. 挑选克隆样本、微调音频

每条录音处理完成后会标"已同步"或"待同步",并显示识别到的说话人和候选片段数。如果分错了说话人,可以点 换成 N 手动纠正;对识别结果不满意可以 重新分析

点某条录音的 编辑 进入音频编辑器——基于波形选取/调整候选片段(不同颜色区分未保存、已选中、未选中、待拼接、AI 合成的片段),可以在播放位置新增候选片段,也可以直接对录音本身做裁剪、插入、替换:

音色克隆完成之后,插入/替换功能会用已克隆出的这个人的音色合成新的语音片段——也就是说,这时候可以直接在编辑器里"生成"这个人从没说过的一句话,用来补齐语料。

4. 生成音色 → 同步至语料

选够克隆参考样本后,点 生成音色 提交克隆任务。克隆完成、状态变成"已可用"之后,按钮变成 同步至语料——把选中的真人录音片段和 AI 补全的部分一起注入到一套预置文本的语料库里,让这个克隆音色覆盖足够多的常用话术,供任意数字员工的音色配置直接选用。

接下来是什么?

以下是建议的下一步操作:

概览
企业、项目、数字员工与话术、线路、线索、任务与通话记录之间到底是什么关系。
阅读指南
创建项目
项目是一份触达工作流的配置蓝图:如何创建、如何添加环节、如何配置流转规则,以及创建后的工作台如何使用。
阅读指南
配置数字员工与话术
数字员工是"人设 + 运行时配置",话术是它的大脑:编辑器里每个 Tab 分别配置什么,附实际界面截图。
阅读指南