ModelRefs / Data Augmentation — AI Glossary
Data Augmentation — AI Glossary
Techniques generating additional training examples by transforming or synthesizing from existing data to improve coverage and robustness.
Overview
For text: back-translation, paraphrasing, instruction rewriting via stronger models. For multimodal: image cropping, rotation, color jitter. For code: variable renaming, dead-code injection. Synthetic data generation (GPT-4 generating diverse instructions) is the dominant LLM augmentation strategy; quality control is critical to avoid noise.
Reference details
| Topic | training |
|---|---|
| Last reviewed | 2026-06-24 |
Related terms
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Data Augmentation — AI Glossary.
Frequently asked questions
What is Data Augmentation?
Techniques generating additional training examples by transforming or synthesizing from existing data to improve coverage and robustness.
What concepts are related to Data Augmentation?
Closely related concepts include instruction dataset, curriculum learning, model collapse.