SMOTE (Synthetic Minority Over-sampling Technique) is a data augmentation method for imbalanced datasets that generates synthetic minority samples by interpolating between existing minority examples — creating new, diverse training examples along the line segments connecting minority class nearest neighbors.
How SMOTE Works
- Select: Choose a minority class sample $x_i$.
- Neighbors: Find its $k$ nearest minority class neighbors.
- Interpolate: $x_{new} = x_i + lambda (x_{nn} - x_i)$ where $lambda sim U(0,1)$ and $x_{nn}$ is a random neighbor.
- Repeat: Generate enough synthetic samples to reach the desired class balance.
Why It Matters
- Diversity: Unlike random duplication, SMOTE creates NEW examples — reduces overfitting risk.
- Feature Space: Interpolation in feature space produces plausible new examples.
- Foundational: SMOTE (Chawla et al., 2002) is the most cited imbalanced learning method — the standard baseline.
SMOTE is creating synthetic minorities — generating new minority examples by interpolating between existing ones for balanced, diverse training.
smotesmotemachine learning
Explore 500+ Semiconductor & AI Topics
From EUV lithography to CUDA optimization — search the full knowledge base or chat with our AI assistant.