Перейти к содержимому

23. كيفية تقييم نماذج اللغة الكبيرة(How to Evaluate LLMs)

Learn AI Fast

0:00 / 0:00

23. كيفية تقييم نماذج اللغة الكبيرة(How to Evaluate LLMs)

133 просмотра · 3 недели назад
Learn AI Fast
92 подписчика
133 просмотра · 3 недели назад
يُعدّ تقييم نماذج اللغة الكبيرة (LLMs) من أهم الخطوات في بناء تطبيقات الذكاء الاصطناعي الجاهزة للاستخدام. في هذا الفيديو، نستعرض بالتفصيل كيف تطوّر تقييم نماذج اللغة الكبيرة من مجرد مطابقة الكلمات السطحية إلى تضمينات دلالية متقدمة، والتقييم البشري، وهياكل نماذج اللغة الكبيرة الآلية التي تعمل كحكم. Timestamps (Video Chapters) 00:00 - Introduction to LLM Evaluation 01:15 - Traditional Lexical Metrics: BLEU & ROUGE 02:40 - The Synonym Bottleneck: Why Exact Word Overlap Fails 03:10 - Semantic Metrics: BERTScore & Embedding Similarity 04:25 - Intrinsic Metrics: Perplexity (PPL) & Model Confidence 05:50 - Human Evaluation: Pointwise & Pairwise Comparative Scoring 06:15 - LLM-as-a-Judge: Automated Grading at Scale 07:30 - Common LLM-as-a-Judge Biases (Verbosity, Position, Self-Preference) 08:05 - Standardized Benchmarks: MMLU, GSM8K, HumanEval & GPQA 08:40 - Quiz رابط القناه باللغه الانجليزيه :    / @ai-academy365   #LLMEvaluation #MachineLearning #ArtificialIntelligence #DataScience #NLP #LLMasAJudge #MMLU #BERTScore #GenerativeAI #AIResearch