AI-агент в продакшне: браузер, тулы и эвалы | Андрей Мелихов, DataLens, Yandex Cloud
Гриненко про
0:00 / 0:00
AI-агент в продакшне: браузер, тулы и эвалы | Андрей Мелихов, DataLens, Yandex Cloud
5 362 просмотра · 2 месяца назад
Гриненко про
1,1 тыс. подписчиков
5 362 просмотра · 2 месяца назад
Обсуждаем создание AI-агента для BI-системы с Андреем Мелиховым, автором https://t.me/melikhov_dev и разработчиком DataLens: почему агент живёт в браузере, как он вызывает тулы, строит чарты, работает с данными, проверяет себя через eval harness и почему просто прикрутить LLM в продакшне быстро превращается в большую инженерную задачу.
Обсудили:
— почему готовых фреймворков не хватает;
— как устроены AI-агенты в браузере;
— SSE-стриминг, BFF, tool calling и agent loop;
— проблемы разных моделей и инференсов;
— evals, LLM-as-a-judge и железного пользователя;
— доверие к числам в BI и проверяемые чарты;
— заменит ли GenBI аналитиков;
— MCP, серверные агенты и будущие API;
— как Claude Code, Codex, OpenCode и другие coding agents меняют разработку;
— почему AI ускоряет разработчика в 3–5 раз, но задач становится только больше;
— безопасность, permissions, sandboxing и корпоративные ограничения;
— AI вне работы: ремонт, ресёрч, медицина, презентации, NotebookLM и новостные боты;
— bus factor, spec-driven development и контекст для агентов.
Больше про ИИ я пишу в Telegram-канале «Гриненко про»: https://t.me/devspotting, а обсудить нейронки можно в чате сообщества — https://t.me/grinenko_pro
ТАЙМ-КОДЫ
01:24 — Андрей Мелихов
03:30 — Почему собрать агента за 15 минут не работает в продакшне
05:08 — Что такое DataLens и GenBI
06:29 — Почему нейронке нельзя просто скормить все данные
07:45 — Что значит «фронтендер» в Яндексе
09:31 — Браузерный state, сессии и Responses API
13:38 — Разные модели, инференсы и проблемы tool calling
16:14 — Первые ошибки: Vercel AI SDK, OpenAI SDK и свой слой
18:28 — Почему без evals нельзя развивать агента
20:33 — Eval harness, LLM-судья и железный пользователь
24:52 — Архитектура агента: BFF, SSE, тулы и agent loop
28:59 — Как агент строит интерактивные чарты в чате
31:06 — Классификатор запросов и отсечение не-BI вопросов
34:55 — Заменит ли GenBI аналитиков
38:51 — Доверие к цифрам: почему LLM не должна считать сама
41:38 — Тула-судья и проверка фильтров
43:38 — Стоимость диалогов и оптимизация контекста
47:55 — MCP, API и перенос агента на сервер
51:14 — Как AI-агенты меняют работу разработчика
54:35 — Flow: план → ревью → реализация → ревью второй моделью
56:46 — Автоматизация багрепортов и тикетов
59:07 — Дежурства, логи и нейронка как третья линия поддержки
01:04:46 — Безопасность coding agents: permissions, sandboxing, open source
01:09:49 — Родные harness’ы, универсальные агенты и бенчмарки
01:14:51 — Ускорение разработки в 3–5 раз
01:18:44 — AI вне работы: ремонт, медицина, презентации
01:21:07 — NotebookLM, подкасты и подготовка к докладам
01:22:09 — Бот для AI/Frontend-новостей
01:24:01 — Что будет с разработкой через 1–2 года
01:25:26 — Bus factor, spec-driven development и контекст для агентов
01:30:28 — Финал
ССЫЛКИ ПО ТЕМАМ:
DataLens: https://datalens.ru/
OpenAI Responses API: https://developers.openai.com/api/doc...
OpenAI Chat Completions: https://developers.openai.com/api/ref...
LangGraph: https://docs.langchain.com/oss/python...
Vercel AI SDK: https://ai-sdk.dev/docs/introduction
Langfuse: https://langfuse.com/docs
Playwright: https://playwright.dev/
NotebookLM: https://notebooklm.google/
Telegram-канал «Гриненко про»: https://t.me/devspotting
Ставьте лайк, подписывайтесь на канал и делитесь выпуском с теми, кто строит AI-агентов.
#AI #LLM #AIAgents #DataLens #GenBI #Frontend #ClaudeCode #Codex #MCP