Post-Training Is Where Models Learn Bad Habits
A post-training paper shows how interpretability tools can audit preference data, expose unwanted learning signals, and reshape rewards before models absorb bad habits. The method turns interpretability into a practical intervention in data curation and reward design.