בילד גילד #4 - קליברציית שופטים מבוססת מודולי שפה
Serj Smor
0:00 / 0:00
בילד גילד #4 - קליברציית שופטים מבוססת מודולי שפה
26 просмотров · 2 недели назад
Serj Smor
322 подписчика
26 просмотров · 2 недели назад
נניח וצריך לסכם מאמר, איך אנחנו יודעים שהסיכום טוב? זאת שאלה מורכבת, כי בעצם קיימים אינסוף סיכומים לכל מאמר, שכל אחד מהם יכול להשמיט ולהוסיף דברים שונים.
הדרך הכי טובה היא להגדיר קריטריונים מראש, לאסוף דוגמאות ולתת למודל שפה לשפוט, אבל לא לפני שבודקים מה הוא עונה על דוגמאות שאתם מסכימים עליהם מראש (קליברציה).
0:00 פתיחה — למה בונים ב-Live והנושא של היום
4:15 Community Spotlight: הפרויקט של מאור
14:06 ה-Quest: LLM as a Judge ואיך יודעים שסיכום טוב
19:03 סקירת ה-Milestones ולמה Calibration הוא הלב
22:28 EDA על הדאטהסט ואיך אני עובד עם Obsidian
30:43 שאלות: Data Leakage וסקפטיות כלפי ה-Judge
38:19 בונים Summarizer — OpenAI ו-DSPy
46:10 למה מטריקות Reference-Based נכשלות
53:53 בונים את ה-Judge והטריק של הכיול
1:00:08 דוגמאות קשות, Hallucinations ו-Ground Truth מלוכלך
1:07:47 מריצים, משווים תוצאות ו-Continuous Evaluation
1:19:14 סיכום: הקושי האמיתי ב-LLM as a Judge
---------------------------------------------------------
הדרך הכי מהירה לקבל נסיון בתחום היא להירשם לקורס של
https://www.buildatadrivenai.com/
השיעורים הפתוחים מכסים את כל החומר הבסיסי של אבלואציה והקמת פרוייקט.
למפגשים הבאים מוזמנים לעקוב אחרי הקאלנדר שלנו:
https://luma.com/buildguild?period=past
או להצטרף לקבוצה שלנו בווטסאפ:
https://docs.google.com/forms/d/e/1FA...