Home Knowledge Base Training Data for LLMs

Training Data for LLMs

Pretraining Datasets Large language models are pretrained on massive text corpora—often trillions of tokens from diverse sources.

Common Pretraining Sources

SourceContentScale
Common CrawlWeb pagesPetabytes
The PileCurated diverse text825 GB
WikipediaEncyclopedia articles~20 GB
Books3Books~100 GB
GitHubSource code~150 GB
ArXivScientific papers~90 GB
Stack ExchangeQ&A~60 GB

Data Processing Pipeline 1. Crawling: Collect raw text from sources 2. Deduplication: Remove duplicate documents 3. Filtering: Remove low-quality, toxic, or harmful content 4. Language detection: Filter by language if needed 5. Tokenization: Convert to token sequences 6. Shuffling: Randomize for training

Fine-Tuning Datasets

By Task Type

TaskDatasetsSize
InstructionAlpaca, Dolly, OpenAssistant15K-200K
CodeCodeAlpaca, StarCoder data20K-1M
MathGSM8K, MATH8K-12K
DialogueShareGPT, UltraChat50K-1M
SafetyAnthropic HH-RLHF160K

Data Quality Principles

Quality > Quantity Research shows that smaller, high-quality datasets often outperform larger noisy ones:

Key Quality Factors

Legal Considerations

datasetcorpustraining data

Explore 500+ Semiconductor & AI Topics

From EUV lithography to CUDA optimization — search the full knowledge base or chat with our AI assistant.