Book 7 — Computer Vision¶
From pixels to vision transformers.
Image Basics¶
Architectures¶
- CNNs
- ResNet
- Transfer learning
- Object detection (YOLO, Faster R-CNN)
- Segmentation (U-Net)
- Vision Transformers
- Image embeddings & multimodal vision
Status
Complete deep-dive coverage of convolutional foundations, modern CNN architectures and transfer learning, and advanced vision tasks including U-Net, Vision Transformers, and CLIP.