Learn AI in Minutes
Foundational concepts in data, statistics, machine learning, and generative AI. Every note is a standalone interactive Marimo notebook with concept intuition, mathematical formulations, code examples, and practical takeaways.
Linear Algebra & Matrix Foundations
-
Note 00: Systems of Linear Equations
Linear combinations, row vs column perspectives, and invertibility
-
Note 01: Inner Products and Angles
Dot products, projection, geometric angles, and Hilbert spaces
-
Note 02: Vector Norms and Metrics
L1, L2, Lp norms, distances, and unit ball geometries
-
Note 03: Hyperplanes and Halfspaces
Decision boundaries, affine sets, and separating hyperplanes
-
Note 04: Rank-One Matrices
Outer products, low-rank factorization, and matrix approximations
-
Note 05: Orthogonality
Orthogonal vectors, bases, projections, and Gram-Schmidt process
-
Note 06: Moore-Penrose Pseudoinverse
Pseudoinverse and least-squares solutions for overdetermined systems
-
Note 07: Spectral Decomposition
Eigendecomposition, symmetric matrices, and singular value decomposition
-
Note 08: Matrix Calculus
Derivatives of vector and matrix expressions for optimization
-
Note 09: Condition Number
Numerical stability, matrix sensitivity, and multicollinearity diagnostics
Probability & Statistical Foundations
-
Note 10: Chebyshev Inequality
Distribution-free probability bounds and concentration
-
Note 11: Empirical CDF
Empirical distribution functions and non-parametric inference
-
Note 12: Multivariate Normal Distribution
Multivariate Gaussian geometry, covariance matrices, and density contours
-
Note 13: Unbiased vs Consistent Estimators
Core properties of statistical estimators and sample size behavior
-
Note 14: Distribution of Minimum
Order statistics and extreme value distributions
-
Note 15: Mutual Information
Information theory, entropy, and non-linear feature dependence
-
Note 16: Point-Biserial Correlation
Measuring association between continuous and binary variables
-
Note 17: Jensen's Inequality
Convexity, expectation inequalities, and bounds in learning algorithms
Applied Statistics & Correlation
-
Note 18: Cramer's V
Strength of association between categorical variables
-
Note 19: Kendall's Tau-b
Non-parametric rank correlation robust to ties
-
Note 20: Spurious Correlation
Confounders, lurking variables, and Simpson's paradox
-
Note 21: Kruskal-Wallis Test
Non-parametric ANOVA for comparing multiple groups
-
Note 22: ACF and PACF
Autocorrelation and partial autocorrelation for time series modeling
-
Note 23: Exponential Moving Averages
EMA smoothing, momentum, and initial bias correction
-
Note 24: Adjusted R-Squared
Penalizing model complexity in linear regression
-
Note 25: Predictive R-Squared
Leave-one-out cross-validation and generalization performance
-
Note 26: Hotelling's T-Squared
Multivariate hypothesis testing and group mean comparisons
Multivariate Methods & Dimensionality
-
Note 27: Principal Component Analysis
Dimensionality reduction via covariance eigendecomposition
-
Note 28: Factor Analysis
Latent variable modeling and unobserved factor estimation
-
Note 29: Canonical Correlation Analysis
Maximizing correlation between two multidimensional variable sets
-
Note 30: Correspondence Analysis
Geometric visualization of contingency tables and categorical associations
-
Note 31: Gaussian Mixture Models
Soft clustering, Expectation-Maximization, and density estimation
Machine Learning Models & Diagnostics
-
Note 32: Elastic Net Regression
Balancing L1 and L2 penalties for correlated feature selection
-
Note 33: Huber Loss
Robust regression combining squared and absolute error penalties
-
Note 34: Mahalanobis Distance
Covariance-scaled distance metrics for outlier detection
-
Note 35: Gini Impurity vs Entropy
Split evaluation criteria for decision trees
-
Note 36: Agglomerative Clustering
Hierarchical clustering, distance metrics, and dendrograms
-
Note 37: Natural Breaks (Jenks)
1D clustering optimization for histogram and choropleth binning
-
Note 38: Oversampling and SMOTE
Synthesizing minority class samples for imbalanced classification
-
Note 39: Permutation Feature Importance
Model-agnostic feature importance via shuffling evaluation
-
Note 40: PCA vs Feature Agglomeration
Linear dimensionality reduction versus hierarchical feature clustering
-
Note 41: Pseudo R-Squared
Goodness-of-fit metrics for logistic regression and GLMs
-
Note 42: Multiclass Classification
Softmax functions, cross-entropy loss, and decision regions
-
Note 43: Energy-Based Models
Energy landscapes, Boltzmann distributions, and score matching
Interpretable AI
-
Note 44: Logistic Regression Interpretability
Log-odds, odds ratios, and marginal feature effects
-
Note 45: Shapley Values and SHAP
Game-theoretic feature attributions and local model explanations
-
Note 46: Model Counterfactuals
Actionable recourse and minimal changes to alter model predictions
Deep Learning & Generative AI
-
Note 47: GELU Activation
Gaussian Error Linear Units in modern Transformer models
-
Note 48: Temperature-Scaled Softmax
Calibrating confidence and diversity in probability distributions
-
Note 49: Focal Loss
Down-weighting easy examples for dense object detection and hard mining
-
Note 50: Attention Mechanism
Scaled dot-product attention as value weighting by query-key similarity
-
Note 51: Causal Attention
Autoregressive masking in decoder-only generative models
-
Note 52: Multi-Head Attention
Parallel representation subspaces in Transformer blocks
-
Note 53: LayerNorm and RMSNorm
Internal activation scaling and modern variance normalization
-
Note 54: Decoding Strategies
Greedy search, beam search, top-k, and nucleus (top-p) sampling
-
Note 55: Perplexity
Information-theoretic evaluation metric for autoregressive language models
-
Note 56: Reparameterization Trick
Differentiable sampling through stochastic nodes via auxiliary noise
-
Note 57: Autoencoder Latent Space
Deterministic bottleneck compression and feature representation
-
Note 58: PCA for Anomaly Detection
Reconstruction error in reduced eigenspaces as anomaly scoring
-
Note 59: VAE on MNIST
Variational Autoencoders with evidence lower bound (ELBO) optimization
-
Note 60: VAE Anomaly Detection
Probabilistic reconstruction likelihood for out-of-distribution detection
Graphs & Applied Pipelines
-
Note 61: User-Item Interaction Matrix
Bipartite graph representations for recommendation systems
Random Notes & Programming Patterns
-
Note 62: Grammar of Graphics
Layered visualization specifications with plotnine
-
Note 63: Einstein Summation (einsum)
Succinct multidimensional array contractions in NumPy and PyTorch
-
Note 64: Data Pivoting
Reshaping and aggregating tabular datasets in Pandas
-
Note 65: GPU Acceleration (cuDF)
Accelerating dataframe pipelines with GPU memory and parallelism
-
Algorithm: Kadanes Algorithm
Algorithmic problem-solving and programming techniques.
-
Algorithm: Prefix Sum
Algorithmic problem-solving and programming techniques.
-
Algorithm: Two Pointer
Algorithmic problem-solving and programming techniques.
Subject Notes (Deep Dives)
-
Multivariate Analysis
Advanced multivariate statistical techniques and geometric formulations (in progress).
-
Functional Data Analysis
Infinite-dimensional representations, smoothing, and functional principal components (in progress).
Research Paper Notes
-
TabICLv2
Tabular foundation model for in-context learning, classification, and regression (research notes).
-
LeJEPA
Joint-Embedding Predictive Architecture formulations and explorations (research notes).
Published at learnaiinminutes.com. Source code: Data-and-AI-Concepts.