Probability studies uncertainty before observing data. The useful mental model is: random variables turn outcomes into quantities, distributions assign mass or density, expectations summarize long-run behavior, and conditioning updates beliefs when information arrives.
Core sequence:
- Random Variables - the basic objects. A random variable maps outcomes to numbers and carries a probability distribution.
- Key Probability Distributions - reusable models for uncertainty: Bernoulli, binomial, categorical, Gaussian, exponential, and related families.
- Expectation and Variance - summarize a distribution by its center and spread. These are the quantities most learning algorithms optimize or estimate.
- Bayes' Theorem - updates prior beliefs with evidence through likelihoods. This is the algebra of conditioning.
- Maximum Likelihood Estimation - chooses parameters that make observed data most probable under a model.
- Maximum A Posteriori Estimation - combines likelihood with a prior. It is regularized estimation under a probabilistic interpretation.
- Entropy and Cross-Entropy - measures uncertainty and prediction mismatch in distributions.
- KL Divergence - measures directed mismatch between two distributions. It is central to variational inference, RLHF, and policy regularization.
How the pieces fit:
- Random variables define what can vary.
- Distributions define how likely each value or region is.
- Expectation and variance summarize distributions into usable quantities.
- Conditioning and Bayes' theorem describe how evidence changes probabilities.
- MLE and MAP turn probabilistic models into parameter estimates.
- Entropy, cross-entropy, and KL divergence compare distributions and become losses.
Core equations to keep active:
- Probability mass normalization:
- Probability density normalization:
- Expectation: or
- Variance:
- Conditional probability:
- Bayes' theorem:
- MLE:
- MAP:
- Entropy:
- KL divergence:
See also: Statistics Fundamentals