23. كيفية تقييم نماذج اللغة الكبيرة(How to Evaluate LLMs)
Learn AI Fast
0:00 / 0:00
23. كيفية تقييم نماذج اللغة الكبيرة(How to Evaluate LLMs)
133 просмотра · 3 недели назад
Learn AI Fast
92 подписчика
133 просмотра · 3 недели назад
يُعدّ تقييم نماذج اللغة الكبيرة (LLMs) من أهم الخطوات في بناء تطبيقات الذكاء الاصطناعي الجاهزة للاستخدام. في هذا الفيديو، نستعرض بالتفصيل كيف تطوّر تقييم نماذج اللغة الكبيرة من مجرد مطابقة الكلمات السطحية إلى تضمينات دلالية متقدمة، والتقييم البشري، وهياكل نماذج اللغة الكبيرة الآلية التي تعمل كحكم.
Timestamps (Video Chapters)
00:00 - Introduction to LLM Evaluation
01:15 - Traditional Lexical Metrics: BLEU & ROUGE
02:40 - The Synonym Bottleneck: Why Exact Word Overlap Fails
03:10 - Semantic Metrics: BERTScore & Embedding Similarity
04:25 - Intrinsic Metrics: Perplexity (PPL) & Model Confidence
05:50 - Human Evaluation: Pointwise & Pairwise Comparative Scoring
06:15 - LLM-as-a-Judge: Automated Grading at Scale
07:30 - Common LLM-as-a-Judge Biases (Verbosity, Position, Self-Preference)
08:05 - Standardized Benchmarks: MMLU, GSM8K, HumanEval & GPQA
08:40 - Quiz
رابط القناه باللغه الانجليزيه : / @ai-academy365
#LLMEvaluation #MachineLearning #ArtificialIntelligence #DataScience #NLP #LLMasAJudge #MMLU #BERTScore #GenerativeAI #AIResearch