ModelRefs / Data Augmentation — AI Glossary

Data Augmentation — AI Glossary

Techniques generating additional training examples by transforming or synthesizing from existing data to improve coverage and robustness.

Overview

For text: back-translation, paraphrasing, instruction rewriting via stronger models. For multimodal: image cropping, rotation, color jitter. For code: variable renaming, dead-code injection. Synthetic data generation (GPT-4 generating diverse instructions) is the dominant LLM augmentation strategy; quality control is critical to avoid noise.

Reference details

Topictraining
Last reviewed2026-06-24

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Data Augmentation — AI Glossary.

Frequently asked questions

What is Data Augmentation?

Techniques generating additional training examples by transforming or synthesizing from existing data to improve coverage and robustness.

What concepts are related to Data Augmentation?

Closely related concepts include instruction dataset, curriculum learning, model collapse.