آموزش هوش مصنوعی از صفر | مدلهای بزرگ چطور سریعتر و کمهزینهتر میشوند؟ - قسمت ۱۳
Persian AI Lab | آزمایشگاه هوش مصنوعی
0:00 / 0:00
آموزش هوش مصنوعی از صفر | مدلهای بزرگ چطور سریعتر و کمهزینهتر میشوند؟ - قسمت ۱۳
44 просмотра · 9 дней назад
Persian AI Lab | آزمایشگاه هوش مصنوعی
100 подписчиков
44 просмотра · 9 дней назад
چطور میتوان مدلهای هوش مصنوعی را کوچکتر و کمهزینهتر کرد یا مدلی بسیار بزرگ ساخت، بدون اینکه برای هر Token تمام بخشهای آن فعال شوند؟
در قسمت ۱۳ «آموزش هوش مصنوعی از صفر» با دو تکنیک مهم آشنا میشویم. ابتدا سراغ Knowledge Distillation میرویم و میبینیم چطور یک مدل کوچکتر میتواند از یک مدل بزرگتر یاد بگیرد. سپس Mixture of Experts یا MoE را بررسی میکنیم و میبینیم چطور Router برای هر Token، Expertهای مناسب را انتخاب میکند.
در این ویدیو یاد میگیرید:
• Distillation در هوش مصنوعی چیست؟
• Teacher Model و Student Model چه هستند؟
• مدل دانشآموز چطور از خروجی مدل معلم یاد میگیرد؟
• Loss و Backpropagation چه نقشی در این فرایند دارند؟
• مدلهای Distilled کجا استفاده میشوند؟
• Mixture of Experts یا MoE چیست؟
• Expert در یک مدل هوش مصنوعی یعنی چه؟
• Router چطور Expert مناسب هر Token را انتخاب میکند؟
• Top-K چیست؟
• چرا در MoE فقط بخشی از مدل برای هر Token فعال میشود؟
در نهایت میبینیم Distillation و MoE با دو روش متفاوت کمک میکنند مدلهای هوش مصنوعی کارآمدتر شوند: یکی با انتقال تواناییهای یک مدل بزرگ به مدلی کوچکتر و دیگری با فعالکردن فقط بخشهای موردنیاز یک مدل بزرگ.
📚 پلیلیست آموزش هوش مصنوعی از صفر:
• آموزش هوش مصنوعی از صفر
⬅️ قسمت قبل:
• آموزش هوش مصنوعی از صفر | مدلها چطور سریع...
#هوش_مصنوعی #AI #LLM #آموزش_هوش_مصنوعی
• آموزش هوش مصنوعی از صفر | مدلهای بزرگ چطو...
00:00 مقدمه - دیستیلیشن و میکسچر آف اکسپرتس
00:24 تقطیر دانش یعنی چه؟
00:47 مدل معلم و مدل دانشآموز
01:44 چه چیزی منتقل میشود؟ توانایی محاسباتی، نه اطلاعات
02:35 چرا ارزانتر است و مدلهای کوچکِ تخصصی
03:38 اگر معلم اشتباه کند، دانشآموز هم اشتباه میکند
04:05 دیستیل بدون اجازه و دو روش انجام آن
05:20 میکسچر آف اکسپرتس (ترکیب متخصصان) چیست؟
06:30 روتر، اکسپرتها و انتخاب Top-K
09:43 مثال عددی و یک سوءبرداشت رایج