Skip to content
AI.info

AI.info

Evaluation

Turning a number into evidence a decision can rest on: baselines, populations, harms, and what a benchmark cannot answer.

  1. Evaluation as Decision Evidence
  2. Intended Use, Units, Populations, and Harm
  3. Baselines, Comparators, and Counterfactual Thinking
  4. Dataset Partitions and Test-Set Governance
  5. Grouped, Temporal, Spatial, and Hierarchical Splits
  6. Cross-Validation, Nested Resampling, and Variance
  7. Bias, Variance, and Learning-Curve Diagnostics
  8. Benchmark Design, Contamination, and Saturation
  9. Metric Portfolios, Acceptance Criteria, and Release Gates
  10. Confusion Matrices and Error Taxonomy
  11. Accuracy, Balanced Accuracy, and Averaging
  12. Precision, Recall, Specificity, and F-Scores
  13. Thresholds, Costs, Utilities, and Capacity
  14. ROC, Precision–Recall Curves, AUC, and Discrimination
  15. Calibration, Log Loss, Brier Score, and Reliability
  16. Selective Prediction, Abstention, and Risk–Coverage
  17. Conformal Prediction: Coverage and Efficiency
  18. Regression Metrics and Residual Diagnostics
  19. Quantiles, Prediction Intervals, and Probabilistic Regression
  20. Forecasting Evaluation Across Time, Horizons, and Hierarchies
  21. Ranking, Retrieval, and Top-K Metrics
  22. Recommender Evaluation Beyond Relevance
  23. Clustering and Unsupervised Evaluation
  24. Anomaly Detection and Alerting Evaluation
  25. Computer Vision Metrics Across Tasks
  26. NLP Metrics for Extraction, QA, Translation, and Summarization
  27. Generative AI Evals: Groundedness, Tools, and Safety
  28. Human Evaluation, Rubrics, and Annotation Reliability
  29. Slice Analysis and Subgroup Performance
  30. Fairness Metrics, Tradeoffs, and Decision Context
  31. Robustness, Stress Tests, and Out-of-Distribution Evaluation
  32. Uncertainty, Bootstrap, and Confidence Intervals
  33. Significance, Effect Size, Multiplicity, and the Winner’s Curse
  34. Online Controlled Experiments and A/B Testing
  35. Post-Deployment Evaluation, Drift, and Delayed Labels
  36. Evaluation Harnesses, Reporting, and Release Governance
  37. Capstone: Design an Evaluation Program That Can Survive Contact With Reality