Faza 04

Viziune computerizată

O imagine este un tensor de eșantioane de lumină. Fiecare model de viziune pe care îl veți folosi vreodată pornește de la acest fapt.

Versiunea curentă AlexBred.com: primele 100 de lecții ale programului în limba română.

28 lecții

Lecțiile fazei

  1. 01Fundamentele imaginilor — pixeli, canale și spații de culoare23 min.
  2. 02Convoluții de la zero18 min.
  3. 03CNN-uri — de la LeNet la ResNet19 min.
  4. 04Clasificarea imaginilor20 min.
  5. 05Învățare prin transfer și ajustare fină18 min.
  6. 06Detectarea obiectelor — YOLO de la zero20 min.
  7. 07Segmentarea semantică — U-Net21 min.
  8. 08Segmentarea instanțelor — Mask R-CNN15 min.
  9. 09Generarea imaginilor — GAN-uri17 min.
  10. 10Generarea imaginilor — modele de difuzie17 min.
  11. 11Stable Diffusion — arhitectură și ajustare fină16 min.
  12. 12Înțelegerea videoclipurilor — modelare temporală17 min.
  13. 13Viziune 3D — nori de puncte și NeRF-uri15 min.
  14. 14Transformere vizuale (ViT)16 min.
  15. 15Viziune în timp real — implementare la marginea rețelei15 min.
  16. 16Construiți un flux complet de viziune — proiect integrator16 min.
  17. 17Viziune auto-supervizată — SimCLR, DINO, MAE14 min.
  18. 18Viziune cu vocabular deschis — CLIP12 min.
  19. 19OCR și înțelegerea documentelor13 min.
  20. 20Regăsirea imaginilor și învățarea metrică14 min.
  21. 21Detectarea punctelor-cheie și estimarea poziției14 min.
  22. 223D Gaussian Splatting de la zero21 min.
  23. 23Transformere de difuzie și flux rectificat20 min.
  24. 24SAM 3 și segmentarea cu vocabular deschis17 min.
  25. 25Modele viziune–limbaj — tiparul ViT-MLP-LLM18 min.
  26. 26Adâncimea monoculară și estimarea geometriei17 min.
  27. 27Urmărirea mai multor obiecte și memoria video18 min.
  28. 28Modele ale lumii și difuzia video20 min.