AI.info
Training and optimization
Objectives, losses and the feedback loop that fits a model — and what a training curve does not tell you.
- Training and Optimization as Feedback Engineering
- From Product Goals to Trainable Objectives
- Loss Families and Output Contracts
- Reduction, Masking, Weighting, and Multi-Output Objectives
- Computational Graphs and the Gradient Signal
- Stochastic Gradient Descent: Direction Under Noise
- Mini-Batches, Gradient Variance, and Effective Batch Size
- Learning Rate: Stability, Speed, and Scale
- Warmup, Decay, Restarts, and Schedule Design
- Momentum and Nesterov Dynamics
- AdaGrad, RMSProp, Adam, and Adaptive Updates
- AdamW, Weight Decay, and Parameter Groups
- Curvature, Conditioning, and Preconditioning
- Initialization and Signal Propagation
- Normalization Layers and Training Behavior
- Residual Paths and Deep Network Optimization
- Gradient Clipping, Exploding Updates, and Trustworthy Norms
- Numerical Precision, Mixed Precision, and Loss Scaling
- Regularization as a Portfolio
- Data Augmentation and Learned Invariances
- Imbalance, Rare Cases, and Cost-Sensitive Training
- Sampling Policies, Curriculum, and Hard Examples
- Learning Curves and Capacity Diagnostics
- Validation, Early Stopping, and Checkpoint Choice
- Hyperparameter Search and Multi-Fidelity Experiments
- Randomness, Seeds, and Reproducible Comparisons
- Debugging a Model That Will Not Learn
- NaNs, Divergence, Saturation, and Silent Instability
- Transfer Learning and Fine-Tuning Schedules
- Multi-Task and Multi-Objective Optimization
- Distributed Data-Parallel Training
- Large-Batch Training, Gradient Accumulation, and Scaling Limits
- Memory, Throughput, and Compute-Efficient Training
- Weight Averaging, EMA, SWA, and Checkpoint Ensembling
- Sharpness-Aware Methods and Advanced Optimizer Choices
- Monitoring Training Runs and Making Stop/Continue Decisions
- Capstone: Design, Run, Diagnose, and Defend a Training Program