هوش مصنوعی مولد برای صدا و تصاویر: مدلها و کاربردها
✅ سرفصل و جزئیات آموزش
توضیحات دوره
دورهی «هوش مصنوعی مولد برای صدا و تصاویر: مدلها و کاربردها» یک بررسی عمیق از این موضوع ارائه میدهد که چگونه مدلهای مولد مدرن مانند Variational Autoencoders (VAEs) ،Generative Adversarial Networks (GANs) ،Transformers و Diffusion models برای ایجاد، دستکاری و بهبود محتوای صوتی، تصویری و ویدیویی به کار میروند.
یادگیرندگان معماریها، فرآیندهای آموزش و موارد استفادهی این مدلها را در قالب modalityهای مختلف بررسی میکنند و از طریق فعالیتهای عملی، هم درک مفهومی و هم بینش کاربردی به دست میآورند. این دوره همچنین پیامدهای اخلاقی و اجتماعی هوش مصنوعی مولد را از جمله bias ،transparency ،intellectual property و چالشهای فناوریهای deepfake برجسته میکند.
این دوره با پوشش همزمان مبانی نظری و رویکردهای پیشرفته و روز، یادگیرندگان را برای بهکارگیری و توسعهی خلاقانه و مسئولانهی هوش مصنوعی مولد در حوزههای صوت و تصویر آماده میکند.
در پایان این دوره، یادگیرندگان قادر خواهند بود:
- مفاهیم اصلی، چالشها و تاریخچهی audio تولیدشده با هوش مصنوعی را بیان کنند.
- مدلهای مهم و بنیادی تولید صدا، مانند variational و vector quantized autoencoders (VAE و VQ-VAE) را تحلیل کنند.
- بررسی کنند که این مدلها چگونه با جدیدترین فناوریهای GenAI ادغام میشوند تا سامانههای تولید صدای ترکیبی، پیشرفته و مبتنی بر transformer و diffusion را شکل دهند.
- معماری و عملکرد Generative Adversarial Networks (GANs) و انواع آنها را مطالعه کنند.
- مدلهای GAN را برای ایجاد و بهبود محتوای بصری پیادهسازی و آموزش دهند.
- تکنیکهای پیشرفتهای مانند diffusion models و transformers را برای تولید تصویر و ویدیو بررسی کنند.
- ملاحظات اخلاقی مربوط به هوش مصنوعی مولد برای صدا و تصاویر را مطرح کنند.
هوش مصنوعی مولد برای صدا و تصاویر: مدلها و کاربردها
-
مقدمهی دوره 5:45
-
با مدرس خود آشنا شوید: Anahita Doosti 1:17
-
با مدرس خود آشنا شوید: Nasimeh Asgarian 1:21
-
مروری بر هوش مصنوعی برای تولید صدا و موسیقی 7:05
-
چرا تولید صدا دشوار است؟ 9:01
-
نمایش داده: Waveform در برابر Symbolic 7:50
-
فرمتهای داده 7:24
-
ارزیابی (بخش 1) 4:47
-
ارزیابی (بخش 2) 9:54
-
دستهبندی رویکردهای تولید صدا 5:30
-
اشکال گوناگون تولید صدا 6:18
-
کارکردهای صوتی 8:33
-
همکاری انسان و هوش مصنوعی 6:56
-
بهکارگیری در عمل 3:23
-
مروری بر روند پیشرفت در طول سالها 6:53
-
رویکردهای پیش از ML: الگوریتمی، مبتنی بر قانون 9:36
-
رویکردهای اولیهی ML: HMMها، شبکههای عصبی FF 6:41
-
رویکردهای مدرن 1: RNNها و CNNها 9:40
-
رویکردهای مدرن 2: Autoencoderها/VAEs و GANs 6:20
-
رویکردهای مدرن 3: Transformers و Diffusion 9:12
-
مرور Module 1 2:00
-
اصطلاحات None
-
کتابخانههای Python برای دادههای صوتی None
-
پیادهسازی WaveNet (کارگاه عملی) None
-
مقدمهای بر Variational Autoencoderها 4:17
-
Autoencoderها 4:54
-
فضای نهفته 7:51
-
درون بلوکهای Encoder-Decoder 7:31
-
آموزش VAEها (بخش 1) 4:44
-
آموزش VAEها (بخش 2) 7:02
-
Vector Quantized Variational Autoencoders (بخش 1) 6:03
-
Vector Quantized Variational Autoencoders (بخش 2) 5:37
-
استفاده از VAE برای تولید ملودی 7:04
-
چگونه VAEs را با اطلاعات موسیقایی اضافی مانند chord و scale شرطی کنیم؟ 7:15
-
نمونه: MusicVAE 8:06
-
محاسبهی بردار ویژگی برای ملودیها 7:42
-
نمونه: Jukebox 6:22
-
نمونه: Speech Synthesis 8:12
-
نقاط قوت و محدودیتهای رویکردهای مبتنی بر VAE 4:53
-
مقدمهای بر Transformer 5:57
-
Transformers برای تولید صدا 5:52
-
نمونه: Music Transformer 12:34
-
بازنگری JukeBox: Transformers چگونه میتوانند audio موجی تولید کنند! (بخش 1) 8:43
-
بازنگری JukeBox: Transformers چگونه میتوانند audio موجی تولید کنند! (بخش 2) 3:47
-
یک پارادایم جدید: Audio Codec + Language Model (بخش 1) 5:46
-
یک پارادایم جدید: Audio Codec + Language Model (بخش 2) 8:09
-
نمونه: FastSpeech 7:39
-
نقاط قوت و محدودیتهای رویکردهای مبتنی بر Transformer 5:01
-
Diffusion models چه هستند و چگونه میتوانند صدا تولید کنند؟ 5:12
-
نمونه: Stable Audio 6:14
-
نمونه: DiffWave 4:32
-
نقاط قوت و محدودیتهای رویکردهای مبتنی بر Diffusion 5:20
-
مدلهای اخیر چگونه با یکدیگر مقایسه میشوند؟ 9:14
-
چه چیزی در پیش است؟ به کجا میرویم؟ 7:28
-
مرور Module 2 2:40
-
راهنمای منابع None
-
استنتاج و مقایسهی مدلهای تولید صدا (کارگاه عملی) None
-
مروری بر هوش مصنوعی برای تولید تصویر و ویدیو 7:33
-
کاربردهای تولید تصویر و ویدیو 7:32
-
نمونههای DALL-E و MidJourney 7:49
-
نمونههای Sora 4:57
-
تاریخچهای کوتاه از تولید تصویر 7:56
-
بازنگری VAE 5:56
-
معرفی GAN 7:40
-
Discriminator 6:44
-
Generator 8:42
-
آموزش GAN 6:07
-
چالشها و بهترین شیوهها برای آموزش GAN 5:39
-
Progressive GAN 7:51
-
Conditional GANs 7:32
-
کاربردها، مزایا و محدودیتهای cGANs 6:43
-
Image-to-Image Translation 7:19
-
چالشها و کاربردهای Image-to-Image Translation 5:09
-
GAN تبدیل متن به تصویر 8:59
-
سایر انواع GAN: بررسی Cycle GAN ،DCGAN ،StyleGAN 9:57
-
طراحی خلاقانه 9:11
-
موارد استفادهی تجاری 7:17
-
افزایش داده 7:02
-
مرور Module 3 2:28
-
Style GAN None
-
ترکیب داده None
-
DCGAN از صفر (کارگاه عملی) None
-
مروری بر مدلها و معماریهای کلیدی 7:51
-
نمای کلی سطحبالا از Vision Transformer 7:42
-
الگوی طراحی Encoder-Decoder 8:49
-
Encoderهای کانولوشنی 9:44
-
Self Attention 9:07
-
Attention مکانی در برابر کانالی در برابر زمانی 8:26
-
نمای کلی سطحبالا از معماری Diffusion Model 7:19
-
فرآیند پیشرو / Diffusion 6:35
-
فرآیند معکوس 7:09
-
آموزش Diffusion Model 4:36
-
نمونههایی از Diffusion Model 5:44
-
سوگیری در دادههای آموزشی 8:00
-
شفافیت 9:00
-
مالکیت فکری 8:25
-
حریم خصوصی داده 7:15
-
مقدمهای بر Deepfake 9:13
-
Deepfake - جابهجایی چهره 5:14
-
شبیهسازی صدا 4:26
-
Deepfake ویدیویی 6:08
-
مرور Module 4 2:21
-
جمعبندی دوره 3:18
-
ViT در برابر Diffusion (کارگاه عملی) None
مشخصات آموزش
هوش مصنوعی مولد برای صدا و تصاویر: مدلها و کاربردها
- تاریخ به روز رسانی: 1405/04/02
- سطح دوره:None
- تعداد درس:104
- مدت زمان :10:39:32
- حجم :7.21GB
- زبان:دوبله زبان فارسی
- دوره آموزشی:AI Academy