Bootstrap

2025秋招NLP算法面试真题(十八)-大模型训练数据格式常见问题

目录:

  1. SFT(有监督微调)的数据集格式
  2. RM(奖励模型)的数据格式
  3. PPO(强化学习)的数据格式
  4. 找数据集哪里找
  5. 微调需要多少条数据
  6. 有哪些大模型的训练集
  7. 进行领域大模型预训练应用哪些数据集比较好

1.SFT(有监督微调)的数据集格式?

对于大语言模型的训练中,SFT(Supervised Fine-Tuning)的数据集格式可以采用以下方式:

  1. 输入数据:输入数据是一个文本序列,通常是一个句子或者一个段落。每个样本可以是一个字符串或者是一个tokenized的文本序列。
  2. 标签数据:标签数据是与输入数据对应的标签或类别。标签可以是单个类别,也可以是多个类别的集合。对于多分类任务,通常使用one-hot编码或整数编码来表示标签。
  3. 数据集划分:数据集通常需要划分为训练集、验证集和测试集。训练集用于模型的训练,验证集用于调整模型的超参数和监控模型的性能,测试集用于评估模型的最终性能。
  4. 数据集格式:数据集可以以文本文件(如CSV、JSON等)或数据库的形式存储。每个样本包含输入数据和对应的标签。可以使用表格形式存储数据&#

悦读

道可道,非常道;名可名,非常名。 无名,天地之始,有名,万物之母。 故常无欲,以观其妙,常有欲,以观其徼。 此两者,同出而异名,同谓之玄,玄之又玄,众妙之门。

;