Canonical reference pages for ML techniques. Cross-linked to the papers in the corpus that use them.
Direct Preference Optimization
aka DPO
Instruction Tuning
aka supervised fine-tuning, SFT
RLHF
aka reinforcement learning from human feedback
Mixture of Experts
aka MoE, sparse experts
Rotary Position Embedding
aka RoPE, positional encoding
Self-Attention
aka attention mechanism, multi-head attention
State-Space Models
aka SSM, selective state spaces
Transformer
aka transformer architecture
Diffusion Models
aka denoising diffusion, DDPM
Generative Adversarial Networks
aka GAN
Variational Autoencoder
aka VAE
Chain-of-Thought Prompting
aka CoT
Test-Time Compute
aka inference-time scaling
GRPO
aka group relative policy optimization
Model-Based RL
aka world models
Policy Gradient Methods
aka policy optimization
Proximal Policy Optimization
aka PPO
Q-Learning
aka value-based RL, DQN
RL with Verifiable Rewards
aka RLVR
Scaling Laws
aka compute-optimal scaling
Quantization
aka low-bit inference
Retrieval-Augmented Generation
aka RAG
Contrastive Learning
aka contrastive representation learning
LoRA
aka low-rank adaptation
Masked Language Modeling
aka masked autoencoding, self-supervised pretraining