Module 12
Data for LLMs & Foundation Models
Build data pipelines for pretraining, fine-tuning, evaluation, synthetic data generation, and human feedback loops for foundation models.
8 lessons · 15 videos · 6h 42m- 12.01
The LLM Data Lifecycle
Describe the data stages for pretraining, instruction tuning, preference tuning, evaluation, retrieval augmentation, and production feedback.
- 12.02
Data Curation for Foundation Models
Define a curation pipeline that filters documents by quality, language, source, license, safety, and domain relevance.
- 12.03
Deduplication and Contamination Control
Apply exact, fuzzy, and embedding-based deduplication techniques and check for evaluation set contamination.
- 12.04
Tokenization and Dataset Packing
Tokenize text, estimate token distributions, and pack examples into fixed-length sequences for efficient training.
- 12.05
Instruction Tuning Datasets
Design an instruction tuning dataset with prompts, responses, task categories, quality labels, and train-validation-test splits.
- 12.06
Synthetic Data Generation Pipelines
Build a synthetic data generation workflow with prompt templates, sampling controls, validation filters, and provenance tracking.
- 12.07
RLHF and Preference Data Pipelines
Model preference data with prompts, candidate responses, rankings, annotator metadata, quality controls, and reward-model training splits.
- 12.08
LLM Evaluation Data Management
Create an evaluation dataset registry with task definitions, versioned prompts, expected outputs, rubrics, and leakage controls.