Training-data attribution as a discovery method for capability provenance in language models. COLM 2026.
research language-models interpretability machine-unlearning ai-research mechanistic-interpretability training-data-attribution capability-provenance
-
Updated
Aug 4, 2026 - JavaScript