Data contamination occurs when test data appears in training data, artificially inflating benchmark scores. The problem: Model memorizes test examples rather than learning generalizable skills. Scores dont reflect true capability. How it happens: Web scrapes include benchmark data, code repositories contain test cases, documentation quotes examples. Scale of web data makes avoidance difficult. Detection methods: N-gram overlap analysis, checking for exact or near-exact matches, timing analysis (correct answers faster if memorized), perplexity analysis on test examples. High-profile concerns: GPT-4 evaluation, HumanEval contamination in code models, MMLU leakage. Mitigation strategies: Training side: Filter training data for benchmark overlap. Evaluation side: Create new held-out benchmarks, use canary strings, post-hoc contamination analysis. Reporting: Disclose potential contamination, provide contamination analysis, test on truly held-out data. Industry standards: Growing expectation to report contamination analysis alongside benchmark results. Critical for trustworthy evaluation.
Explore 500+ Semiconductor & AI Topics
From EUV lithography to CUDA optimization — search the full knowledge base or chat with our AI assistant.