re-sampling strategies
**Re-Sampling Strategies** are **data-level techniques for handling class imbalance by modifying the training data distribution** — either duplicating minority samples (over-sampling) or reducing majority samples (under-sampling) to create a more balanced training set.
**Re-Sampling Methods**
- **Random Over-Sampling**: Duplicate minority class samples randomly until balanced.
- **Random Under-Sampling**: Randomly remove majority class samples until balanced.
- **SMOTE**: Generate synthetic minority samples by interpolating between existing minority examples.
- **Hybrid**: Combine over-sampling of minority with under-sampling of majority.
**Why It Matters**
- **Simplicity**: Re-sampling is implemented at the data loader level — no model or loss modification needed.
- **Risk**: Over-sampling can cause overfitting on minority examples; under-sampling loses majority information.
- **Effective**: Despite simplicity, re-sampling remains one of the most effective strategies for imbalanced data.
**Re-Sampling** is **balancing the data itself** — modifying the training data distribution to give equal learning opportunity to all classes.