دوره آموزشی
The Great Courses
دوبله زبان فارسی

هوش مصنوعی مولد برای صدا و تصاویر: مدل‌ها و کاربردها

هوش مصنوعی مولد برای صدا و تصاویر: مدل‌ها و کاربردها

✅ سرفصل و جزئیات آموزش

توضیحات دوره

دوره‌ی «هوش مصنوعی مولد برای صدا و تصاویر: مدل‌ها و کاربردها» یک بررسی عمیق از این موضوع ارائه می‌دهد که چگونه مدل‌های مولد مدرن مانند Variational Autoencoders (VAEs) ،Generative Adversarial Networks (GANs) ،Transformers و Diffusion models برای ایجاد، دست‌کاری و بهبود محتوای صوتی، تصویری و ویدیویی به کار می‌روند.

یادگیرندگان معماری‌ها، فرآیندهای آموزش و موارد استفاده‌ی این مدل‌ها را در قالب modalityهای مختلف بررسی می‌کنند و از طریق فعالیت‌های عملی، هم درک مفهومی و هم بینش کاربردی به دست می‌آورند. این دوره همچنین پیامدهای اخلاقی و اجتماعی هوش مصنوعی مولد را از جمله bias ،transparency ،intellectual property و چالش‌های فناوری‌های deepfake برجسته می‌کند.

این دوره با پوشش هم‌زمان مبانی نظری و رویکردهای پیشرفته و روز، یادگیرندگان را برای به‌کارگیری و توسعه‌ی خلاقانه و مسئولانه‌ی هوش مصنوعی مولد در حوزه‌های صوت و تصویر آماده می‌کند.

در پایان این دوره، یادگیرندگان قادر خواهند بود:

  • مفاهیم اصلی، چالش‌ها و تاریخچه‌ی audio تولیدشده با هوش مصنوعی را بیان کنند.
  • مدل‌های مهم و بنیادی تولید صدا، مانند variational و vector quantized autoencoders (VAE و VQ-VAE) را تحلیل کنند.
  • بررسی کنند که این مدل‌ها چگونه با جدیدترین فناوری‌های GenAI ادغام می‌شوند تا سامانه‌های تولید صدای ترکیبی، پیشرفته و مبتنی بر transformer و diffusion را شکل دهند.
  • معماری و عملکرد Generative Adversarial Networks (GANs) و انواع آن‌ها را مطالعه کنند.
  • مدل‌های GAN را برای ایجاد و بهبود محتوای بصری پیاده‌سازی و آموزش دهند.
  • تکنیک‌های پیشرفته‌ای مانند diffusion models و transformers را برای تولید تصویر و ویدیو بررسی کنند.
  • ملاحظات اخلاقی مربوط به هوش مصنوعی مولد برای صدا و تصاویر را مطرح کنند.

هوش مصنوعی مولد برای صدا و تصاویر: مدل‌ها و کاربردها

  • مقدمه‌ی دوره 5:45
  • با مدرس خود آشنا شوید: Anahita Doosti 1:17
  • با مدرس خود آشنا شوید: Nasimeh Asgarian 1:21
  • مروری بر هوش مصنوعی برای تولید صدا و موسیقی 7:05
  • چرا تولید صدا دشوار است؟ 9:01
  • نمایش داده: Waveform در برابر Symbolic 7:50
  • فرمت‌های داده 7:24
  • ارزیابی (بخش 1) 4:47
  • ارزیابی (بخش 2) 9:54
  • دسته‌بندی رویکردهای تولید صدا 5:30
  • اشکال گوناگون تولید صدا 6:18
  • کارکردهای صوتی 8:33
  • همکاری انسان و هوش مصنوعی 6:56
  • به‌کارگیری در عمل 3:23
  • مروری بر روند پیشرفت در طول سال‌ها 6:53
  • رویکردهای پیش از ML: الگوریتمی، مبتنی بر قانون 9:36
  • رویکردهای اولیه‌ی ML: HMMها، شبکه‌های عصبی FF 6:41
  • رویکردهای مدرن 1: RNNها و CNNها 9:40
  • رویکردهای مدرن 2: Autoencoderها/VAEs و GANs 6:20
  • رویکردهای مدرن 3: Transformers و Diffusion 9:12
  • مرور Module 1 2:00
  • اصطلاحات None
  • کتابخانه‌های Python برای داده‌های صوتی None
  • پیاده‌سازی WaveNet (کارگاه عملی) None
  • مقدمه‌ای بر Variational Autoencoderها 4:17
  • Autoencoderها 4:54
  • فضای نهفته 7:51
  • درون بلوک‌های Encoder-Decoder 7:31
  • آموزش VAEها (بخش 1) 4:44
  • آموزش VAEها (بخش 2) 7:02
  • Vector Quantized Variational Autoencoders (بخش 1) 6:03
  • Vector Quantized Variational Autoencoders (بخش 2) 5:37
  • استفاده از VAE برای تولید ملودی 7:04
  • چگونه VAEs را با اطلاعات موسیقایی اضافی مانند chord و scale شرطی کنیم؟ 7:15
  • نمونه: MusicVAE 8:06
  • محاسبه‌ی بردار ویژگی برای ملودی‌ها 7:42
  • نمونه: Jukebox 6:22
  • نمونه: Speech Synthesis 8:12
  • نقاط قوت و محدودیت‌های رویکردهای مبتنی بر VAE 4:53
  • مقدمه‌ای بر Transformer 5:57
  • Transformers برای تولید صدا 5:52
  • نمونه: Music Transformer 12:34
  • بازنگری JukeBox: Transformers چگونه می‌توانند audio موجی تولید کنند! (بخش 1) 8:43
  • بازنگری JukeBox: Transformers چگونه می‌توانند audio موجی تولید کنند! (بخش 2) 3:47
  • یک پارادایم جدید: Audio Codec + Language Model (بخش 1) 5:46
  • یک پارادایم جدید: Audio Codec + Language Model (بخش 2) 8:09
  • نمونه: FastSpeech 7:39
  • نقاط قوت و محدودیت‌های رویکردهای مبتنی بر Transformer 5:01
  • Diffusion models چه هستند و چگونه می‌توانند صدا تولید کنند؟ 5:12
  • نمونه: Stable Audio 6:14
  • نمونه: DiffWave 4:32
  • نقاط قوت و محدودیت‌های رویکردهای مبتنی بر Diffusion 5:20
  • مدل‌های اخیر چگونه با یکدیگر مقایسه می‌شوند؟ 9:14
  • چه چیزی در پیش است؟ به کجا می‌رویم؟ 7:28
  • مرور Module 2 2:40
  • راهنمای منابع None
  • استنتاج و مقایسه‌ی مدل‌های تولید صدا (کارگاه عملی) None
  • مروری بر هوش مصنوعی برای تولید تصویر و ویدیو 7:33
  • کاربردهای تولید تصویر و ویدیو 7:32
  • نمونه‌های DALL-E و MidJourney 7:49
  • نمونه‌های Sora 4:57
  • تاریخچه‌ای کوتاه از تولید تصویر 7:56
  • بازنگری VAE 5:56
  • معرفی GAN 7:40
  • Discriminator 6:44
  • Generator 8:42
  • آموزش GAN 6:07
  • چالش‌ها و بهترین شیوه‌ها برای آموزش GAN 5:39
  • Progressive GAN 7:51
  • Conditional GANs 7:32
  • کاربردها، مزایا و محدودیت‌های cGANs 6:43
  • Image-to-Image Translation 7:19
  • چالش‌ها و کاربردهای Image-to-Image Translation 5:09
  • GAN تبدیل متن به تصویر 8:59
  • سایر انواع GAN: بررسی Cycle GAN ،DCGAN ،StyleGAN 9:57
  • طراحی خلاقانه 9:11
  • موارد استفاده‌ی تجاری 7:17
  • افزایش داده 7:02
  • مرور Module 3 2:28
  • Style GAN None
  • ترکیب داده None
  • DCGAN از صفر (کارگاه عملی) None
  • مروری بر مدل‌ها و معماری‌های کلیدی 7:51
  • نمای کلی سطح‌بالا از Vision Transformer 7:42
  • الگوی طراحی Encoder-Decoder 8:49
  • Encoderهای کانولوشنی 9:44
  • Self Attention 9:07
  • Attention مکانی در برابر کانالی در برابر زمانی 8:26
  • نمای کلی سطح‌بالا از معماری Diffusion Model 7:19
  • فرآیند پیشرو / Diffusion 6:35
  • فرآیند معکوس 7:09
  • آموزش Diffusion Model 4:36
  • نمونه‌هایی از Diffusion Model 5:44
  • سوگیری در داده‌های آموزشی 8:00
  • شفافیت 9:00
  • مالکیت فکری 8:25
  • حریم خصوصی داده 7:15
  • مقدمه‌ای بر Deepfake 9:13
  • Deepfake - جابه‌جایی چهره 5:14
  • شبیه‌سازی صدا 4:26
  • Deepfake ویدیویی 6:08
  • مرور Module 4 2:21
  • جمع‌بندی دوره 3:18
  • ViT در برابر Diffusion (کارگاه عملی) None

6,352,400 1,588,100 تومان

مشخصات آموزش

هوش مصنوعی مولد برای صدا و تصاویر: مدل‌ها و کاربردها

  • تاریخ به روز رسانی: 1405/04/02
  • سطح دوره:None
  • تعداد درس:104
  • مدت زمان :10:39:32
  • حجم :7.21GB
  • زبان:دوبله زبان فارسی
  • دوره آموزشی:AI Academy

آموزش های مرتبط

The Great Courses
6,100,500 1,220,100 تومان
  • زمان: 08:11:21
  • تعداد درس: 28
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
5,679,500 1,135,900 تومان
  • زمان: 07:37:25
  • تعداد درس: 47
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,272,500 254,500 تومان
  • زمان: 01:42:31
  • تعداد درس: 11
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
2,260,000 452,000 تومان
  • زمان: 03:02:02
  • تعداد درس: 14
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
795,000 159,000 تومان
  • زمان: 58:00
  • تعداد درس: 12
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
19,403,000 3,880,600 تومان
  • زمان: 26:02:40
  • تعداد درس: 175
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
8,508,000 1,701,600 تومان
  • زمان: 11:25:13
  • تعداد درس: 94
  • سطح دوره:
  • زبان: دوبله فارسی
  • سطح دوره:
  • زبان: دوبله فارسی
The Great Courses
1,833,000 366,600 تومان
  • زمان: 02:27:39
  • تعداد درس: 24
  • سطح دوره:
  • زبان: دوبله فارسی

آیا سوالی دارید؟

ما به شما کمک خواهیم کرد تا شغل و رشد خود را افزایش دهید.
امروز با ما تماس بگیرید