Агент проходит 61% тестов, но надёжен в 25%. Разбираем evals
Дмитрий Березницкий
0:00 / 0:00
Агент проходит 61% тестов, но надёжен в 25%. Разбираем evals
2 103 просмотра · 7 часов назад
Дмитрий Березницкий
14,4 тыс. подписчиков
2 103 просмотра · 7 часов назад
Как тестировать AI-агента, чтобы ему можно было доверять: тесты проходят, а в проде он врёт, зацикливается и дёргает не те инструменты. Разбираем evals для агентов: что на самом деле тестировать, чем мерить и как отличить регрессию от шума.
В видео:
— почему при нулевой температуре LLM всё равно отвечает по-разному
— pass@k и pass^k: почему агент проходит тесты, но ненадёжен
— что в harness проверяется без единого вызова модели и почему это бесплатно
— как модель меняется под вами, даже если вы её не трогали
— почему в памяти агента опаснее не забытый факт, а устаревший
— LLM-судья видел поломку и всё равно ставил зачёт: как калибровать судью по разметке людей
— тест с живой моделью падает через раз: регрессия это или шум
— как суд в Германии спросил с компании за выдумки её чат-бота
Таймкоды:
0:00 — Введение
2:14 — Почему обычные тесты не работают: pass@k и pass^k
8:59 — Что тестировать: harness и модель
17:30 — Память и tools
23:59 — Кто ставит оценку: код, LLM-судья, человек
29:46 — Регрессия или шум. Откуда брать тест-кейсы
32:57 — Что ещё ломает агентов: от перефразировок до суда
Недетерминизм LLM на GPU (Yuan et al.) — https://arxiv.org/html/2506.09501v2
Метрика pass^k, τ-bench — https://arxiv.org/abs/2406.12045
Средний успех против стабильности, 16 моделей (Zhou et al.) — https://arxiv.org/abs/2606.00920
HAL, надёжность агентов (Принстон) — https://hal.cs.princeton.edu/reliabil...
Harness сильнее модели — https://arxiv.org/abs/2605.23950
Регрессии при обновлении модели, flip rate — https://arxiv.org/abs/2608.13607
From Recall to Forgetting, устаревшая память — https://arxiv.org/html/2604.20006v1
Ошибки tools копятся по цепочке — https://arxiv.org/abs/2608.26189
Судья по результату пропускает тихие сбои — https://arxiv.org/abs/2609.00038
21 LLM-судья и каппа Коэна (Norman et al.) — https://arxiv.org/abs/2606.19544
Судья видел дефект и ставил зачёт за тон — https://arxiv.org/abs/2606.10315
Agent-as-a-Judge — https://arxiv.org/abs/2410.10934
Hamel Husain и Shreya Shankar о системе evals — https://www.lennysnewsletter.com/p/bu...
Решение суда Хамма о чат-боте клиники — https://nrwe.justiz.nrw.de/olgs/hamm/...
AgentChaos, отказы LLM API — https://arxiv.org/abs/2608.06790