ModelRefs / Data Poisoning — AI Glossary
Data Poisoning — AI Glossary
An attack injecting malicious examples into training data to implant backdoors or degrade model behavior at inference time.
Overview
Data poisoning targets the training pipeline: small fractions of poisoned examples can insert trigger-activated backdoors (producing harmful outputs when a specific phrase appears) or degrade specific capabilities. Defense: data provenance tracking, anomaly detection, and influence function analysis to identify outlier training examples.
Reference details
| Topic | safety |
|---|---|
| Last reviewed | 2026-06-24 |
Related terms
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Data Poisoning — AI Glossary.
Frequently asked questions
What is Data Poisoning?
An attack injecting malicious examples into training data to implant backdoors or degrade model behavior at inference time.
What concepts are related to Data Poisoning?
Closely related concepts include adversarial attack, alignment, llm security.