Перейти к содержимому

آموزش هوش مصنوعی از صفر | مدل‌های بزرگ چطور سریع‌تر و کم‌هزینه‌تر می‌شوند؟ - قسمت ۱۳

Persian AI Lab | آزمایشگاه هوش مصنوعی

0:00 / 0:00

آموزش هوش مصنوعی از صفر | مدل‌های بزرگ چطور سریع‌تر و کم‌هزینه‌تر می‌شوند؟ - قسمت ۱۳

44 просмотра · 9 дней назад
Persian AI Lab | آزمایشگاه هوش مصنوعی
100 подписчиков
44 просмотра · 9 дней назад
چطور می‌توان مدل‌های هوش مصنوعی را کوچک‌تر و کم‌هزینه‌تر کرد یا مدلی بسیار بزرگ ساخت، بدون اینکه برای هر Token تمام بخش‌های آن فعال شوند؟ در قسمت ۱۳ «آموزش هوش مصنوعی از صفر» با دو تکنیک مهم آشنا می‌شویم. ابتدا سراغ Knowledge Distillation می‌رویم و می‌بینیم چطور یک مدل کوچک‌تر می‌تواند از یک مدل بزرگ‌تر یاد بگیرد. سپس Mixture of Experts یا MoE را بررسی می‌کنیم و می‌بینیم چطور Router برای هر Token، Expertهای مناسب را انتخاب می‌کند. در این ویدیو یاد می‌گیرید: • Distillation در هوش مصنوعی چیست؟ • Teacher Model و Student Model چه هستند؟ • مدل دانش‌آموز چطور از خروجی مدل معلم یاد می‌گیرد؟ • Loss و Backpropagation چه نقشی در این فرایند دارند؟ • مدل‌های Distilled کجا استفاده می‌شوند؟ • Mixture of Experts یا MoE چیست؟ • Expert در یک مدل هوش مصنوعی یعنی چه؟ • Router چطور Expert مناسب هر Token را انتخاب می‌کند؟ • Top-K چیست؟ • چرا در MoE فقط بخشی از مدل برای هر Token فعال می‌شود؟ در نهایت می‌بینیم Distillation و MoE با دو روش متفاوت کمک می‌کنند مدل‌های هوش مصنوعی کارآمدتر شوند: یکی با انتقال توانایی‌های یک مدل بزرگ به مدلی کوچک‌تر و دیگری با فعال‌کردن فقط بخش‌های موردنیاز یک مدل بزرگ. 📚 پلی‌لیست آموزش هوش مصنوعی از صفر:    • آموزش هوش مصنوعی از صفر   ⬅️ قسمت قبل:    • آموزش هوش مصنوعی از صفر | مدل‌ها چطور سریع...   #هوش_مصنوعی #AI #LLM #آموزش_هوش_مصنوعی    • آموزش هوش مصنوعی از صفر | مدل‌های بزرگ چطو...   00:00 مقدمه - دیستیلیشن و میکسچر آف اکسپرتس 00:24 تقطیر دانش یعنی چه؟ 00:47 مدل معلم و مدل دانش‌آموز 01:44 چه چیزی منتقل می‌شود؟ توانایی محاسباتی، نه اطلاعات 02:35 چرا ارزان‌تر است و مدل‌های کوچکِ تخصصی 03:38 اگر معلم اشتباه کند، دانش‌آموز هم اشتباه می‌کند 04:05 دیستیل بدون اجازه و دو روش انجام آن 05:20 میکسچر آف اکسپرتس (ترکیب متخصصان) چیست؟ 06:30 روتر، اکسپرت‌ها و انتخاب Top-K 09:43 مثال عددی و یک سوءبرداشت رایج