Перейти к содержимому

Гены и география — биоинформатический проект

OMGenomics

0:00 / 0:00

Гены и география — биоинформатический проект

33 672 просмотра · 4 года назад
OMGenomics
49,6 тыс. подписчиков
33 672 просмотра · 4 года назад
Это полное пошаговое руководство по биоинформатическому проекту: запуск PCA/TSNE на данных генотипов популяции. 00:00 Введение 01:07 Поиск данных 04:55 Анализ VCF-файла 06:02 Поиск популяционных меток для образцов 10:20 Парсинг VCF-файла с помощью pysam 16:02 Преобразование аллелей в числа для массива numpy 21:47 Когда работать в Colab, а когда с помощью скрипта Python 26:00 Сохранение данных с помощью pandas 28:42 Добавление популяционных меток из файла панели 33:33 В Colab! 36:54 PCA 40:17 Первый график! Миссия выполнена :) 42:03 Использование Altair для построения графиков с метками 44:51 Второй график с популяционными метками! 46:05 Объединение с данными igsr_population.tsv 49:43 TSNE 53:36 Упражнение: PCA на SNP 54:21 Заключение и история создания этого проекта Загрузите VCF-файл с генотипами популяций из проекта «1000 геномов». Используйте pysam для его парсинга и преобразования в двумерный массив numpy для запуска PCA и сохранения в виде датафрейма pandas. Запустите PCA и tSNE и визуализируйте результаты с помощью matplotlib и Altair, раскрашивая точки в соответствии с метками происхождения. Вот видео с идеями проекта, где я впервые упомянул этот проект:    • Bioinformatics project ideas   — если вас интересует история его создания. Весь код, включая скрипт на Python, ссылки для скачивания входных файлов и блокнот Colab, доступен по ссылке: https://github.com/MariaNattestad/pca...