Гены и география — биоинформатический проект
OMGenomics
0:00 / 0:00
Гены и география — биоинформатический проект
33 672 просмотра · 4 года назад
OMGenomics
49,6 тыс. подписчиков
33 672 просмотра · 4 года назад
Это полное пошаговое руководство по биоинформатическому проекту: запуск PCA/TSNE на данных генотипов популяции.
00:00 Введение
01:07 Поиск данных
04:55 Анализ VCF-файла
06:02 Поиск популяционных меток для образцов
10:20 Парсинг VCF-файла с помощью pysam
16:02 Преобразование аллелей в числа для массива numpy
21:47 Когда работать в Colab, а когда с помощью скрипта Python
26:00 Сохранение данных с помощью pandas
28:42 Добавление популяционных меток из файла панели
33:33 В Colab!
36:54 PCA
40:17 Первый график! Миссия выполнена :)
42:03 Использование Altair для построения графиков с метками
44:51 Второй график с популяционными метками!
46:05 Объединение с данными igsr_population.tsv
49:43 TSNE
53:36 Упражнение: PCA на SNP
54:21 Заключение и история создания этого проекта
Загрузите VCF-файл с генотипами популяций из проекта «1000 геномов».
Используйте pysam для его парсинга и преобразования в двумерный массив numpy для запуска PCA и сохранения в виде датафрейма pandas.
Запустите PCA и tSNE и визуализируйте результаты с помощью matplotlib и Altair, раскрашивая точки в соответствии с метками происхождения.
Вот видео с идеями проекта, где я впервые упомянул этот проект: • Bioinformatics project ideas — если вас интересует история его создания.
Весь код, включая скрипт на Python, ссылки для скачивания входных файлов и блокнот Colab, доступен по ссылке: https://github.com/MariaNattestad/pca...