Post-training & Alignment

SFT, RLHF, DPO, and reasoning training — how a base model becomes an assistant