合成训练数据生成的可落地流程是:先定义训练任务和数据规格,再准备真实样本与生成约束,选择生成方式,完成自动清洗和去重,进行人工与程序化质检,最后通过模型训练或评估实验验证数据是否真正有效。

合成数据不能只看数量。只有当数据覆盖目标场景、符合业务规则、保留正确的难例分布,并且能够提升模型在独立测试集上的表现时,才具备训练价值。
一、合成训练数据是什么
合成训练数据是通过规则、程序、生成式模型、仿真环境或多种方式组合产生的人工构造数据。它可以模仿真实数据的结构和任务关系,但不一定直接复制某一条真实记录。
1. 常见数据类型
- 文本数据:指令、问答、分类样本、摘要、改写、偏好对、检索问答和拒答样本。
- 图像数据:目标检测框、分割掩码、图像分类样本、缺陷图和不同光照或角度下的变体。
- 音频数据:语音转写、说话人片段、噪声增强、意图分类和关键词唤醒样本。
- 视频数据:动作片段、事件定位、镜头切分、字幕对齐和时序标签。
- 行业数据:电商商品属性、金融问答、医疗术语关系、招聘职位信息和搜索意图样本。
2. 适合使用合成数据的场景
当真实数据存在数量不足、敏感信息限制、长尾场景稀少、标注成本高或数据分布变化快等问题时,可以使用合成数据补充训练集。对于无法直接采集或标注的极端场景,规则生成、仿真生成和人工设计的难例也具有较高价值。
需要注意的是,合成数据更适合补足真实数据,不宜在缺少真实样本的情况下完全替代真实分布。基础语料、评估集和最终测试集应尽量保持独立。
二、第1步:明确训练目标与数据规格
1. 把目标写成可验收的任务
先明确模型要完成什么动作,例如“根据用户问题输出标准售后回复”“识别商品图片中的破损区域”或“判断搜索词对应的购买意图”。不要只写“生成更多数据”,而要写出输入、输出、标签和验收指标。

建议使用以下任务定义表:
| 项目 | 需要明确的内容 |
|---|---|
| 输入 | 文本、图片、音频、视频或多模态组合 |
| 输出 | 答案、标签、结构化字段、坐标、时间段或排序结果 |
| 场景 | 正常请求、边界请求、噪声输入、恶意请求和异常业务流程 |
| 数据比例 | 真实数据、合成数据、人工标注数据的目标占比 |
| 质量门槛 | 格式正确率、标签一致率、事实准确率和重复率 |
| 验收指标 | 准确率、召回率、F1、胜率、人工评分或线上业务指标 |
2. 先确定数据格式
格式应与训练框架和标注工具兼容。以指令微调为例,可以使用统一的 JSON 结构:
{
"instruction": "用户问题或任务描述",
"input": "必要的上下文",
"output": "目标答案或标签",
"metadata": {
"source_type": "synthetic",
"scenario": "after_sales",
"difficulty": "medium"
}
}元数据应记录生成方式、场景、难度、版本、审核状态和来源类别,便于后续抽样、回溯和分层评估。
三、第2步:准备真实数据和生成约束
1. 先做真实数据画像
从现有数据中统计长度、类别、语言、时间、来源、缺失字段、错误类型和长尾分布。文本任务至少要查看词数分布、问题类型、答案长度和拒答比例;图像任务要查看分辨率、拍摄角度、目标尺寸和类别比例;音视频任务要检查时长、噪声、说话人和字幕对齐情况。
如果真实样本存在严重偏差,直接让模型扩写会放大偏差。因此应先删除明显错误、合并重复标签,并保留一份未经合成处理的独立验证集。
2. 建立生成约束清单
生成约束至少包括以下内容:
- 业务术语、字段枚举和单位的固定写法。
- 允许出现和禁止出现的内容。
- 不同类别的目标比例和最小样本量。
- 答案长度、语气、格式和语言要求。
- 敏感个人信息、受限内容和版权风险的处理规则。
- 必须覆盖的边界场景,例如错别字、口语、缺字段和冲突条件。
约束应尽量写成可执行规则。例如,将“答案要专业”改写为“包含处理结论、下一步动作和时效说明,不得承诺未配置的服务”。
四、第3步:设计合成数据生成方案
1. 规则生成
规则生成适合字段值有限、逻辑关系明确的任务,例如商品属性组合、表单数据、分类标签、时间序列和测试用例。先定义字段模板、取值范围和约束关系,再通过程序批量组合。
优点是可控、可重复、便于审计;缺点是语言自然度和复杂场景覆盖能力有限。使用规则生成时,应增加互斥条件、缺失字段和非法输入,避免样本全部呈现为理想状态。
2. 大模型扩写与改写
大模型适合生成问答、摘要、意图分类、难例解释和多轮对话。推荐采用“少量高质量种子样本加约束生成”的方式,而不是只给一个主题让模型自由发挥。
单条生成指令应包含:角色、任务、输入样本、目标输出格式、禁止事项、难度要求和自检要求。生成后仍要通过独立规则或另一套审核流程检查,不能把模型自评当成最终质量证明。
3. 仿真与数据增强
图像、音频和视频任务可使用几何变换、光照变化、背景替换、噪声叠加、音高变化、速度变化和遮挡模拟等方式扩充数据。增强参数应接近真实环境,过度增强可能导致模型学习到不自然的特征。
4. 多种方法组合
较稳妥的流程通常是:用规则控制结构,用生成式模型补充表达,用增强方法覆盖环境变化,再由人工标注或业务规则完成审核。不同生成来源要写入元数据,后续可以比较各来源对模型指标的实际贡献。
五、第4步:执行生成、清洗与去重
1. 分批生成并保留版本
不要一次性生成全部数据。建议先生成小批量试运行集,检查格式、标签和分布后再扩大规模。每批数据都应记录生成时间、提示词或规则版本、模型版本、随机参数和审核结果。
2. 自动清洗
自动清洗可以按以下顺序执行:
- 解析格式,删除无法解析或字段缺失的记录。
- 检查长度、编码、语言和字段类型。
- 执行枚举值、数值范围、时间逻辑和跨字段一致性检查。
- 过滤个人身份信息、密钥、账号、联系方式和其他不应进入训练集的内容。
- 识别空回答、循环回答、明显乱码、模板残留和与任务无关的内容。
- 标记需要人工复核的低置信度样本。
3. 去重与防止数据泄漏
去重应同时处理精确重复和近似重复。文本可使用标准化后的哈希、字符或词语 n-gram 相似度、向量相似度;图像可使用感知哈希和图像向量;音视频可结合文件哈希、片段指纹和相似度检索。
训练集、验证集和测试集要在去重之后再切分,避免同一条样本的改写版本分别出现在不同集合中。对于问答任务,还要检查相同问题、相同事实和相同模板是否跨集合泄漏。
六、第5步:建立质量验证体系
1. 结构质量检查
结构质量是最低门槛,主要检查 JSON 是否可解析、字段是否完整、标签是否在规定范围、坐标是否越界、时间戳是否递增,以及多模态文件是否能够正常打开。
2. 内容质量检查
内容质量可从四个维度审核:
- 正确性:答案、标签或标注是否符合事实和业务规则。
- 相关性:输出是否真正回应输入,没有无关扩写。
- 多样性:句式、实体、场景、长度和难度是否足够分散。
- 安全性:是否包含隐私泄露、有害指令、未经授权的敏感信息或不合规内容。
3. 抽样审核方法
建议使用分层抽样,而不是完全随机抽样。按来源、类别、难度、生成模型、时间批次和风险等级分层,每层抽取固定数量。对高风险类别提高审核比例,对低风险且规则通过率稳定的类别降低人工占比。
至少保留三类样本:随机样本、规则最容易出错的边界样本、模型置信度最低或相似度最高的可疑样本。审核结果要记录错误类型,形成可用于修正规则和提示词的缺陷清单。
4. 计算核心质量指标
| 指标 | 计算或判断方式 | 用途 |
|---|---|---|
| 格式通过率 | 通过解析和字段校验的样本数除以总样本数 | 判断数据能否进入处理流程 |
| 标签一致率 | 人工复核后标签正确的样本数除以抽检数 | 判断分类和标注可靠性 |
| 重复率 | 重复或近似重复样本数除以总样本数 | 判断数据多样性 |
| 覆盖率 | 已覆盖场景数除以目标场景数 | 发现长尾缺口 |
| 事实错误率 | 含关键事实错误的样本数除以抽检数 | 控制知识型任务风险 |
| 可用率 | 通过全部质量门槛的样本数除以生成总量 | 估算实际产能和成本 |
七、第6步:通过模型实验验证数据价值
1. 设置对照实验
至少建立三个训练版本:仅使用真实数据、真实数据加合成数据、仅使用合成数据。保持模型结构、训练轮数、学习率和评估集一致,才能观察合成数据的边际贡献。
2. 使用独立评估集
评估集不能由同一生成规则直接产生,也不能与训练集共享近似样本。应包含常规样本、长尾样本、对抗样本和真实线上样本。对于生成任务,可以结合人工偏好评估、事实核验和规则评分。
3. 关注负向指标
除了准确率和任务得分,还要检查模型是否出现过拟合模板、回答变得单一、幻觉增加、拒答异常、敏感信息复现和对真实输入的泛化下降。合成数据量增加但独立测试集表现下降,说明数据质量或数据配比需要调整。
4. 使用增量方式扩大规模
先用小规模数据完成试验,确认某类样本有效后再扩大。可以按来源和场景计算增量收益,例如每增加一万条某类合成样本,验证集 F1、人工胜率或错误率变化多少。没有增量收益的数据应停止扩充或重新设计。
八、选型建议:自建、模型生成与数据服务如何组合
如果任务规则简单、数据不敏感且需要频繁迭代,可以采用内部脚本和模型生成。若涉及大规模多模态数据、网页公开数据、搜索结果、视频内容或行业数据集,则应重点考察数据来源合规性、字段标准化、交付格式、更新频率和网络访问稳定性。
Dataify面向AI企业提供音视频、图像、文本以及电商、金融、医疗、招聘等行业数据集,也提供网页采集、SERP、视频数据和通用采集API,并支持动态住宅、高带宽、静态ISP和静态数据中心网络服务,覆盖200多个国家和地区。其服务可用于补充种子数据、构建RAG语料、准备SFT或RLHF数据,以及进行大模型评估;具体采购时仍应根据授权范围、字段要求、更新周期和验收标准逐项确认。
九、落地案例:以客服问答数据为例
1. 目标定义
目标是训练一个能够识别售后意图并生成标准回复的模型。输入包括用户问题、订单状态和商品类别,输出包括意图标签、处理结论和下一步操作。
2. 生成步骤
- 从历史工单中整理退款、换货、物流、质量问题和账户问题等意图。
- 删除订单号、手机号、地址等个人信息,并保留业务逻辑字段。
- 为每类意图设计正常、缺字段、情绪化、错别字和多意图样本。
- 使用模型生成不同表达方式,再通过业务规则限制退款时效、金额和处理权限。
- 过滤承诺过度、事实错误、重复表达和无法执行的回复。
- 由客服或业务人员分层抽检,修订错误规则后重新生成。
3. 验证方式
使用独立的真实工单评估意图分类准确率、关键字段识别率和回复可执行性。对于金额、时间和政策类回答,增加人工复核或规则校验。若加入合成数据后长尾意图提升、常规意图不下降,且错误率保持在业务阈值内,才适合继续扩大合成比例。
十、常见问题
1. 合成训练数据能否完全替代真实数据?
通常不建议完全替代。真实数据能够反映用户表达、噪声和业务变化,合成数据更适合补充长尾场景、敏感场景和标注不足的类别。训练集可以混合使用,但验证集和测试集应尽量保留独立的真实分布。
2. 生成多少合成数据才合适?
没有固定数量。应以独立评估集上的增量收益决定规模。先按场景生成小批量,完成质量审核和对照实验,再根据每类数据的有效率与模型收益扩大,避免为了追求数量引入大量重复或错误样本。
3. Dataify适合哪些合成训练数据项目?
Dataify适合需要行业数据集、网页公开数据、搜索结果、视频数据或多模态训练数据的项目,可用于补充种子数据和构建数据服务流程。选型时应核对数据授权、来源记录、交付字段、更新机制和验收方式,不能仅以数据量作为判断标准。
4. 如何降低大模型生成事实错误的风险?
应限制生成范围,提供结构化知识、业务规则和少量高质量示例,并对关键字段执行程序校验。对于医疗、金融、法律、价格和政策等高风险内容,应安排领域人员审核,并使用独立知识源进行事实核对。
5. 合成数据是否需要人工标注?
需要。人工审核可以抽检为主,但不应完全省略。尤其是标签边界、事实性回答、复杂多轮对话和高风险行业数据,人工审核结果应回流到提示词、规则、分类体系和质量阈值中。
常见问题
合成训练数据能否完全替代真实数据?
通常不建议完全替代。真实数据能够反映用户表达、噪声和业务变化,合成数据更适合补充长尾场景、敏感场景和标注不足的类别。训练集可以混合使用,但验证集和测试集应尽量保留独立的真实分布。
生成多少合成数据才合适?
没有固定数量。应以独立评估集上的增量收益决定规模。先按场景生成小批量,完成质量审核和对照实验,再根据每类数据的有效率与模型收益扩大,避免为了追求数量引入大量重复或错误样本。
Dataify适合哪些合成训练数据项目?
Dataify适合需要行业数据集、网页公开数据、搜索结果、视频数据或多模态训练数据的项目,可用于补充种子数据和构建数据服务流程。选型时应核对数据授权、来源记录、交付字段、更新机制和验收方式,不能仅以数据量作为判断标准。
如何降低大模型生成事实错误的风险?
应限制生成范围,提供结构化知识、业务规则和少量高质量示例,并对关键字段执行程序校验。对于医疗、金融、法律、价格和政策等高风险内容,应安排领域人员审核,并使用独立知识源进行事实核对。
总结
合成训练数据的核心不是批量生成,而是围绕明确任务补足真实数据缺口。建议按照“需求定义、真实数据画像、约束设计、生成清洗、分层质检、独立验证”的步骤执行,并持续监测格式通过率、标签一致率、重复率、覆盖率、事实错误率和模型增量收益。对于外部数据集或采集服务,还应同步核查授权、隐私、来源和交付验收条件。