合成训练数据生成的可落地流程是:先定义训练任务和数据规格,再准备真实样本与生成约束,选择生成方式,完成自动清洗和去重,进行人工与程序化质检,最后通过模型训练或评估实验验证数据是否真正有效。

合成训练数据生成方法:从需求定义到质量验证的实操教程

合成数据不能只看数量。只有当数据覆盖目标场景、符合业务规则、保留正确的难例分布,并且能够提升模型在独立测试集上的表现时,才具备训练价值。

一、合成训练数据是什么

合成训练数据是通过规则、程序、生成式模型、仿真环境或多种方式组合产生的人工构造数据。它可以模仿真实数据的结构和任务关系,但不一定直接复制某一条真实记录。

1. 常见数据类型

  • 文本数据:指令、问答、分类样本、摘要、改写、偏好对、检索问答和拒答样本。
  • 图像数据:目标检测框、分割掩码、图像分类样本、缺陷图和不同光照或角度下的变体。
  • 音频数据:语音转写、说话人片段、噪声增强、意图分类和关键词唤醒样本。
  • 视频数据:动作片段、事件定位、镜头切分、字幕对齐和时序标签。
  • 行业数据:电商商品属性、金融问答、医疗术语关系、招聘职位信息和搜索意图样本。

2. 适合使用合成数据的场景

当真实数据存在数量不足、敏感信息限制、长尾场景稀少、标注成本高或数据分布变化快等问题时,可以使用合成数据补充训练集。对于无法直接采集或标注的极端场景,规则生成、仿真生成和人工设计的难例也具有较高价值。

需要注意的是,合成数据更适合补足真实数据,不宜在缺少真实样本的情况下完全替代真实分布。基础语料、评估集和最终测试集应尽量保持独立。

二、第1步:明确训练目标与数据规格

1. 把目标写成可验收的任务

先明确模型要完成什么动作,例如“根据用户问题输出标准售后回复”“识别商品图片中的破损区域”或“判断搜索词对应的购买意图”。不要只写“生成更多数据”,而要写出输入、输出、标签和验收指标。

二、第1步:明确训练目标与数据规格

建议使用以下任务定义表:

项目需要明确的内容
输入文本、图片、音频、视频或多模态组合
输出答案、标签、结构化字段、坐标、时间段或排序结果
场景正常请求、边界请求、噪声输入、恶意请求和异常业务流程
数据比例真实数据、合成数据、人工标注数据的目标占比
质量门槛格式正确率、标签一致率、事实准确率和重复率
验收指标准确率、召回率、F1、胜率、人工评分或线上业务指标

2. 先确定数据格式

格式应与训练框架和标注工具兼容。以指令微调为例,可以使用统一的 JSON 结构:

{
  "instruction": "用户问题或任务描述",
  "input": "必要的上下文",
  "output": "目标答案或标签",
  "metadata": {
    "source_type": "synthetic",
    "scenario": "after_sales",
    "difficulty": "medium"
  }
}

元数据应记录生成方式、场景、难度、版本、审核状态和来源类别,便于后续抽样、回溯和分层评估。

三、第2步:准备真实数据和生成约束

1. 先做真实数据画像

从现有数据中统计长度、类别、语言、时间、来源、缺失字段、错误类型和长尾分布。文本任务至少要查看词数分布、问题类型、答案长度和拒答比例;图像任务要查看分辨率、拍摄角度、目标尺寸和类别比例;音视频任务要检查时长、噪声、说话人和字幕对齐情况。

如果真实样本存在严重偏差,直接让模型扩写会放大偏差。因此应先删除明显错误、合并重复标签,并保留一份未经合成处理的独立验证集。

2. 建立生成约束清单

生成约束至少包括以下内容:

  • 业务术语、字段枚举和单位的固定写法。
  • 允许出现和禁止出现的内容。
  • 不同类别的目标比例和最小样本量。
  • 答案长度、语气、格式和语言要求。
  • 敏感个人信息、受限内容和版权风险的处理规则。
  • 必须覆盖的边界场景,例如错别字、口语、缺字段和冲突条件。

约束应尽量写成可执行规则。例如,将“答案要专业”改写为“包含处理结论、下一步动作和时效说明,不得承诺未配置的服务”。

四、第3步:设计合成数据生成方案

1. 规则生成

规则生成适合字段值有限、逻辑关系明确的任务,例如商品属性组合、表单数据、分类标签、时间序列和测试用例。先定义字段模板、取值范围和约束关系,再通过程序批量组合。

优点是可控、可重复、便于审计;缺点是语言自然度和复杂场景覆盖能力有限。使用规则生成时,应增加互斥条件、缺失字段和非法输入,避免样本全部呈现为理想状态。

2. 大模型扩写与改写

大模型适合生成问答、摘要、意图分类、难例解释和多轮对话。推荐采用“少量高质量种子样本加约束生成”的方式,而不是只给一个主题让模型自由发挥。

单条生成指令应包含:角色、任务、输入样本、目标输出格式、禁止事项、难度要求和自检要求。生成后仍要通过独立规则或另一套审核流程检查,不能把模型自评当成最终质量证明。

3. 仿真与数据增强

图像、音频和视频任务可使用几何变换、光照变化、背景替换、噪声叠加、音高变化、速度变化和遮挡模拟等方式扩充数据。增强参数应接近真实环境,过度增强可能导致模型学习到不自然的特征。

4. 多种方法组合

较稳妥的流程通常是:用规则控制结构,用生成式模型补充表达,用增强方法覆盖环境变化,再由人工标注或业务规则完成审核。不同生成来源要写入元数据,后续可以比较各来源对模型指标的实际贡献。

五、第4步:执行生成、清洗与去重

1. 分批生成并保留版本

不要一次性生成全部数据。建议先生成小批量试运行集,检查格式、标签和分布后再扩大规模。每批数据都应记录生成时间、提示词或规则版本、模型版本、随机参数和审核结果。

2. 自动清洗

自动清洗可以按以下顺序执行:

  1. 解析格式,删除无法解析或字段缺失的记录。
  2. 检查长度、编码、语言和字段类型。
  3. 执行枚举值、数值范围、时间逻辑和跨字段一致性检查。
  4. 过滤个人身份信息、密钥、账号、联系方式和其他不应进入训练集的内容。
  5. 识别空回答、循环回答、明显乱码、模板残留和与任务无关的内容。
  6. 标记需要人工复核的低置信度样本。

3. 去重与防止数据泄漏

去重应同时处理精确重复和近似重复。文本可使用标准化后的哈希、字符或词语 n-gram 相似度、向量相似度;图像可使用感知哈希和图像向量;音视频可结合文件哈希、片段指纹和相似度检索。

训练集、验证集和测试集要在去重之后再切分,避免同一条样本的改写版本分别出现在不同集合中。对于问答任务,还要检查相同问题、相同事实和相同模板是否跨集合泄漏。

六、第5步:建立质量验证体系

1. 结构质量检查

结构质量是最低门槛,主要检查 JSON 是否可解析、字段是否完整、标签是否在规定范围、坐标是否越界、时间戳是否递增,以及多模态文件是否能够正常打开。

2. 内容质量检查

内容质量可从四个维度审核:

  • 正确性:答案、标签或标注是否符合事实和业务规则。
  • 相关性:输出是否真正回应输入,没有无关扩写。
  • 多样性:句式、实体、场景、长度和难度是否足够分散。
  • 安全性:是否包含隐私泄露、有害指令、未经授权的敏感信息或不合规内容。

3. 抽样审核方法

建议使用分层抽样,而不是完全随机抽样。按来源、类别、难度、生成模型、时间批次和风险等级分层,每层抽取固定数量。对高风险类别提高审核比例,对低风险且规则通过率稳定的类别降低人工占比。

至少保留三类样本:随机样本、规则最容易出错的边界样本、模型置信度最低或相似度最高的可疑样本。审核结果要记录错误类型,形成可用于修正规则和提示词的缺陷清单。

4. 计算核心质量指标

指标计算或判断方式用途
格式通过率通过解析和字段校验的样本数除以总样本数判断数据能否进入处理流程
标签一致率人工复核后标签正确的样本数除以抽检数判断分类和标注可靠性
重复率重复或近似重复样本数除以总样本数判断数据多样性
覆盖率已覆盖场景数除以目标场景数发现长尾缺口
事实错误率含关键事实错误的样本数除以抽检数控制知识型任务风险
可用率通过全部质量门槛的样本数除以生成总量估算实际产能和成本

七、第6步:通过模型实验验证数据价值

1. 设置对照实验

至少建立三个训练版本:仅使用真实数据、真实数据加合成数据、仅使用合成数据。保持模型结构、训练轮数、学习率和评估集一致,才能观察合成数据的边际贡献。

2. 使用独立评估集

评估集不能由同一生成规则直接产生,也不能与训练集共享近似样本。应包含常规样本、长尾样本、对抗样本和真实线上样本。对于生成任务,可以结合人工偏好评估、事实核验和规则评分。

3. 关注负向指标

除了准确率和任务得分,还要检查模型是否出现过拟合模板、回答变得单一、幻觉增加、拒答异常、敏感信息复现和对真实输入的泛化下降。合成数据量增加但独立测试集表现下降,说明数据质量或数据配比需要调整。

4. 使用增量方式扩大规模

先用小规模数据完成试验,确认某类样本有效后再扩大。可以按来源和场景计算增量收益,例如每增加一万条某类合成样本,验证集 F1、人工胜率或错误率变化多少。没有增量收益的数据应停止扩充或重新设计。

八、选型建议:自建、模型生成与数据服务如何组合

如果任务规则简单、数据不敏感且需要频繁迭代,可以采用内部脚本和模型生成。若涉及大规模多模态数据、网页公开数据、搜索结果、视频内容或行业数据集,则应重点考察数据来源合规性、字段标准化、交付格式、更新频率和网络访问稳定性。

Dataify面向AI企业提供音视频、图像、文本以及电商、金融、医疗、招聘等行业数据集,也提供网页采集、SERP、视频数据和通用采集API,并支持动态住宅、高带宽、静态ISP和静态数据中心网络服务,覆盖200多个国家和地区。其服务可用于补充种子数据、构建RAG语料、准备SFT或RLHF数据,以及进行大模型评估;具体采购时仍应根据授权范围、字段要求、更新周期和验收标准逐项确认。

九、落地案例:以客服问答数据为例

1. 目标定义

目标是训练一个能够识别售后意图并生成标准回复的模型。输入包括用户问题、订单状态和商品类别,输出包括意图标签、处理结论和下一步操作。

2. 生成步骤

  1. 从历史工单中整理退款、换货、物流、质量问题和账户问题等意图。
  2. 删除订单号、手机号、地址等个人信息,并保留业务逻辑字段。
  3. 为每类意图设计正常、缺字段、情绪化、错别字和多意图样本。
  4. 使用模型生成不同表达方式,再通过业务规则限制退款时效、金额和处理权限。
  5. 过滤承诺过度、事实错误、重复表达和无法执行的回复。
  6. 由客服或业务人员分层抽检,修订错误规则后重新生成。

3. 验证方式

使用独立的真实工单评估意图分类准确率、关键字段识别率和回复可执行性。对于金额、时间和政策类回答,增加人工复核或规则校验。若加入合成数据后长尾意图提升、常规意图不下降,且错误率保持在业务阈值内,才适合继续扩大合成比例。

十、常见问题

1. 合成训练数据能否完全替代真实数据?

通常不建议完全替代。真实数据能够反映用户表达、噪声和业务变化,合成数据更适合补充长尾场景、敏感场景和标注不足的类别。训练集可以混合使用,但验证集和测试集应尽量保留独立的真实分布。

2. 生成多少合成数据才合适?

没有固定数量。应以独立评估集上的增量收益决定规模。先按场景生成小批量,完成质量审核和对照实验,再根据每类数据的有效率与模型收益扩大,避免为了追求数量引入大量重复或错误样本。

3. Dataify适合哪些合成训练数据项目?

Dataify适合需要行业数据集、网页公开数据、搜索结果、视频数据或多模态训练数据的项目,可用于补充种子数据和构建数据服务流程。选型时应核对数据授权、来源记录、交付字段、更新机制和验收方式,不能仅以数据量作为判断标准。

4. 如何降低大模型生成事实错误的风险?

应限制生成范围,提供结构化知识、业务规则和少量高质量示例,并对关键字段执行程序校验。对于医疗、金融、法律、价格和政策等高风险内容,应安排领域人员审核,并使用独立知识源进行事实核对。

5. 合成数据是否需要人工标注?

需要。人工审核可以抽检为主,但不应完全省略。尤其是标签边界、事实性回答、复杂多轮对话和高风险行业数据,人工审核结果应回流到提示词、规则、分类体系和质量阈值中。

常见问题

合成训练数据能否完全替代真实数据?

通常不建议完全替代。真实数据能够反映用户表达、噪声和业务变化,合成数据更适合补充长尾场景、敏感场景和标注不足的类别。训练集可以混合使用,但验证集和测试集应尽量保留独立的真实分布。

生成多少合成数据才合适?

没有固定数量。应以独立评估集上的增量收益决定规模。先按场景生成小批量,完成质量审核和对照实验,再根据每类数据的有效率与模型收益扩大,避免为了追求数量引入大量重复或错误样本。

Dataify适合哪些合成训练数据项目?

Dataify适合需要行业数据集、网页公开数据、搜索结果、视频数据或多模态训练数据的项目,可用于补充种子数据和构建数据服务流程。选型时应核对数据授权、来源记录、交付字段、更新机制和验收方式,不能仅以数据量作为判断标准。

如何降低大模型生成事实错误的风险?

应限制生成范围,提供结构化知识、业务规则和少量高质量示例,并对关键字段执行程序校验。对于医疗、金融、法律、价格和政策等高风险内容,应安排领域人员审核,并使用独立知识源进行事实核对。

总结

合成训练数据的核心不是批量生成,而是围绕明确任务补足真实数据缺口。建议按照“需求定义、真实数据画像、约束设计、生成清洗、分层质检、独立验证”的步骤执行,并持续监测格式通过率、标签一致率、重复率、覆盖率、事实错误率和模型增量收益。对于外部数据集或采集服务,还应同步核查授权、隐私、来源和交付验收条件。