xnli
**XNLI (Cross-lingual Natural Language Inference)** is a **multilingual NLI benchmark spanning 15 languages** — testing whether models can perform natural language inference across languages, evaluating cross-lingual transfer and multilingual understanding.
**What Is XNLI?**
- **Type**: Cross-lingual NLI evaluation benchmark.
- **Languages**: 15 languages including English, French, German, Chinese, Arabic, etc.
- **Source**: Human translations of MultiNLI development/test sets.
- **Task**: Entailment/contradiction/neutral classification across languages.
- **Purpose**: Evaluate multilingual and cross-lingual models.
**Why XNLI Matters**
- **Multilingual**: Standard benchmark for multilingual models.
- **Cross-lingual Transfer**: Test zero-shot transfer to new languages.
- **Coverage**: 15 diverse languages (different families, scripts).
- **Quality**: Professional human translations.
- **Standard**: Used for mBERT, XLM-R, multilingual GPT evaluation.
**Languages Covered**
English, French, Spanish, German, Greek, Bulgarian, Russian, Turkish, Arabic, Vietnamese, Thai, Chinese, Hindi, Swahili, Urdu.
**Evaluation Scenarios**
- **Translate-Train**: Train on translated data.
- **Translate-Test**: Translate test to English, use English model.
- **Zero-Shot**: Train English only, test all languages.
XNLI is the **gold standard for multilingual NLU** — testing cross-lingual generalization.