00:00Selama ini kan, AI itu mengenali gambar lewat satu cara utama,
00:03Convolutional Neural Networks atau CNN.
00:06Tapi, gimana kalau AI bisa membaca sebuah gambar, persis kayak kita baca buku?
00:10Nah, pada tahun 2020, sebuah ide brilian dari dunia pemrosesan bahasa memicu sebuah revolusi.
00:15Dan dari situlah, lahir Vision Transformer. Yuk kita bedah gimana cara kerjanya.
00:19Semuanya berawal dari pertanyaan ini.
00:21Sebuah ide yang kelihatannya sederhana, diajukan oleh para peneliti di Google.
00:24Gimana kalau kita bisa mengajari AI untuk membaca gambar, sama persis seperti ia membaca sebuah kalimat?
00:29Mereka berpikir, arsitektur Transformer kan udah jago banget buat ngertiin bahasa.
00:33Bisa nggak ya keajaiban yang sama kita terapkan ke dunia visual?
00:35Dan ternyata, cara mereka melakukannya itu jenius banget.
00:38Poin pentingnya tuh di sini.
00:40Sama kayak sebuah kalimat yang dipecah menjadi kata-kata,
00:42sebuah gambar dipecah menjadi potongan-potongan kecil yang disebut patch.
00:45Di paper mereka yang fenomenal itu, setiap patch berukuran 16x16 piksel,
00:49ini dianggap sebagai satu kata visual.
00:51Dalam sekejap, masalah pengenalan gambar diubah total jadi masalah pemahaman bahasa.
00:55Keren kan?
00:56Oke, kedengarannya keren.
00:58Tapi gimana persisnya mesin ini bekerja?
01:01Gimana caranya kita menerjemahkan sebuah gambar jadi bahasa yang bisa dimengerti sama Transformer?
01:06Nah, ayo kita bongkar satu per satu komponennya.
01:09Semuanya dimulai dari yang namanya patch embedding.
01:12Coba bayangin gambar ini kayak puzzle.
01:13Pertama, kita potong-potong jadi beberapa bagian kecil yang ukurannya sama dan nggak tumpang dindih.
01:17Setiap potongan ini kemudian kita ratakan jadi barisan piksel yang panjang.
01:21Nah, barisan piksel inilah yang kemudian diubah menjadi representasi matematis yang disebut embedding.
01:25Inilah bahasanya si Transformer.
01:27Selanjutnya, ada satu trik cerdas yang mereka pinjam langsung dari model bahasa kayak BERT, namanya token CLS.
01:33Jadi ada satu token spesial yang kita tambahkan di paling depan urutan patch kita tadi.
01:37Tujuannya apa?
01:38Nah, token ini fungsinya kayak jadi wadah buat menampung rangkuman dari keseluruhan gambar.
01:42Sesuatu yang krusial banget buat cara kerja arsitektur Transformer.
01:45Nah, ini dia solusinya.
01:47Beda sama model-model lama yang memproses data secara berurutan, Transformer itu melihat semua patch secara bersamaan.
01:52Akibatnya, nggak ada tuh yang namanya kesimpulan akhir yang muncul secara alami.
01:56Disinilah token CLS ini berperan.
01:58Dia tuh kayak manajer proyek.
01:59Dia mengamati semua patch, mengumpulkan informasi global, dan pada akhirnya, output dari token inilah yang jadi rangkuman utuh dari gambar
02:06itu untuk membuat keputusan.
02:07Oke, oke.
02:08Mungkin sekarang kalian bertanya-tanya.
02:10Kalau kita cuma punya sekumpulan potongan gambar, gimana caranya si model tahu kalau mata itu ada di atas hidung?
02:16Atau roda itu di bawah mobil?
02:18Gimana modelnya bisa paham struktur spasial?
02:20Tanpa informasi posisi, gambar mobil ini ya cuma jadi sekantong patch acak.
02:24Modelnya nggak akan tahu mana atas, mana bawah.
02:26Kacau kan?
02:27Nah, disinilah poin pentingnya.
02:28Positional Encoding.
02:30Kita menambahkan semacam koordinat digital ke setiap patch.
02:32Jadi kita kasih tahu model di mana posisi patch tersebut di dalam gambar aslinya.
02:36Inilah yang bikin si model bisa paham struktur, bentuk, dan konteks.
02:40Sekarang, kita sampai di jantungnya Vision Transformer.
02:43Mekanisme yang bikin arsitektur ini jadi kuat dan revolusioner banget.
02:46Yuk kita lihat mesin penggeraknya, mekanisme atensi.
02:48Namanya Multi-Head Self-Attention.
02:51Kedengarannya rumit, tapi intinya gini.
02:52Setiap patch gambar, secara mandiri atau self, belajar untuk memberikan perhatian atau attention ke patch lain yang paling relevan untuknya.
02:59Misalnya, patch mata kucing bakal belajar untuk sangat memperhatikan patch telinga dan kumis.
03:03Kemampuan inilah yang memungkinkan model memahami konteks gambar secara keseluruhan, bukan cuma area lokal saja.
03:09Terus, kenapa kok Multi-Head?
03:10Kenapa pakai banyak kepala?
03:12Anggap saja kita punya satu tim ahli yang bekerja bersamaan.
03:15Kepala yang satu jago banget mendeteksi bentuk,
03:17kepala yang lain ahli dalam melihat kesamaan warna,
03:19dan yang lainnya fokus pada pola tekstur.
03:21Dengan bekerja barengan, mereka menciptakan pemaaman gambar yang jauh lebih kaya dan mendalam.
03:25Tapi, model VIT yang asli itu baru permulaan lho.
03:28Ide dasarnya itu langsung memicu ledakan penelitian,
03:30yang dalam waktu singkat menghasilkan arsitektur yang lebih efisien, lebih kuat, dan lebih praktis.
03:35Coba kita lihat beberapa penerus utamanya.
03:37Pertama ada DATED.
03:38Poin pentingnya adalah efisiensi data.
03:41Model ini membuktikan kalau kita nggak perlu data setraksasa untuk melatih VIT.
03:44Gimana caranya?
03:45Lewat teknik pintar yang disebut distilasi pengetahuan,
03:48di mana VIT ini berperan seperti murid yang belajar dari guru,
03:51yaitu model CNN yang sudah ahli.
03:52Ini membuat teknologi VIT jadi jauh lebih mudah diakses.
03:56Selanjutnya, ada Swin Transformer.
03:58Ingat mekanisme atensi di mana setiap patch melihat semua patch lain?
04:01Nah, itu sangat boros komputasi.
04:03Swin memperbaikinya dengan cara yang cerdas.
04:05Ia membatasi perhatian hanya pada area jendela lokal.
04:08Jendela ini kemudian digeser-geser,
04:10yang memungkinkan informasi menyebar secara efisien ke seluruh gambar.
04:13Hasilnya, model ini jadi jagoan untuk tugas-tugas beresolusi tinggi.
04:16Terakhir, ada MA yang merevolusi cara pelatihan model ini.
04:19Ide-nya sangat elegan.
04:20Hapus saja 75% bagian dari gambar secara acak,
04:23lalu latih model untuk merekonstruksi bagian yang hilang itu.
04:26Dengan melakukan ini berulang kali pada jutaan gambar tanpa label,
04:28model ini secara mandiri belajar pemahaman visual yang sangat mendalam tentang dunia,
04:32bahkan sebelum diberi tugas spesifik.
04:33Jadi, dengan memperlakukan gambar sebagai sebuah bahasa,
04:37kita telah membuka pintu bagi AI untuk memahami dunia visual
04:40dengan cara yang jauh lebih dalam dan kontekstual.
04:42Ini bukan lagi hanya tentang mengidentifikasi objek,
04:44tapi tentang memahami hubungan, adegan, dan bahkan narasi.
04:48Pertanyaannya sekarang adalah,
04:50apa batas selanjutnya?
04:51Terima kasih telah menyimat.
Komentar