Analiza statystyczna danych omicznych w RStudio (3-dniowe warsztaty online)
Kompletny workflow od gotowej macierzy danych i metadanych do statystycznie uzasadnionych wniosków, szlaków biologicznych, sieci i odtwarzalnego raportu
Podczas trzydniowych warsztatów uczestnicy przejdą kompletny schemat statystycznej analizy danych omicznych w RStudio: od kontroli i uporządkowania macierzy danych oraz metadanych, przez filtrowanie, normalizację, analizę eksploracyjną i modelowanie różnicowe, po wizualizację wyników, analizę funkcjonalną, szlaki biologiczne i sieci w Cytoscape.
Praca będzie prowadzona przede wszystkim na macierzach danych proteomicznych, metabolomicznych i lipidomicznych. Osobny moduł pokaże specyfikę danych transkryptomicznych oraz różnice pomiędzy analizą ciągłych intensywności a modelowaniem surowych zliczeń RNA-seq.
Uczestnicy poznają specyfikę macierzy szerokich oraz długich oraz sposoby ich tranformacji i zastosowania. Poznają różnice między ANOVA a modelami limma, PCA a PLS-DA oraz analizą nadreprezentacji a GSEA. Nauczą się tworzyć macierze projektu i macierze danych różnicowych, metody penalizacji danych wielkoskalowych, tj. FDR i jego kontrolę, interpretować wielkości efektów, identyfikować efekty partii i unikać przeuczenia modeli nadzorowanych. Duży nacisk położymy na metodach profesjonalnej wizualizacji wyników pod cele publikacyjne.
Kurs jest przeznaczony dla osób posiadających podstawową wiedzę z zakresu statystyki oraz doświadczenie w pracy z danymi biologicznymi lub omicznymi, które chcą uporządkować i pogłębić znajomość metod statystycznych oraz nauczyć się prowadzić kompletne analizy w środowisku RStudio. Znajomość środowiska R nie jest wymagana. Szkolenie ma charakter praktyczny i zaawansowany – nie jest przeznaczone dla osób rozpoczynających naukę statystyki lub pracy z danymi od podstaw.
Szkolenie nie obejmuje przetwarzania surowych danych LC-MS, RNA-Seq ani identyfikacji związków. Jego celem jest nauczenie uczestników podejmowania poprawnych decyzji statystycznych i tworzenia odtwarzalnego schematu analizy od gotowej macierzy danych do interpretacji biologicznej.
Termin: 26, 27 i 28 października 2026, 9:00 – 14:00 (3-dniowe warsztaty online).
Liczba godzin: 15 (5 godzin każdego dnia z 2 przerwami kawowymi).
Lokalizacja: warsztaty zdalne.
Grupa: do 10 osób.
Wykładowca: Dr hab. inż. Anna Piasecka
Cena: 2499 zł netto (3073,77 zł brutto). Pracownikom finansowanym przez instytucje naukowe (lub inne jednostki finansowane ze środków publicznych) przysługuje zwolnienie z VAT.
Metody płatności: przelew na konto.
Zagadnienia:
przygotowanie i kontrola jakości macierzy danych omicznych,
filtrowanie, transformacja, normalizacja i skalowanie danych,
analiza eksploracyjna: PCA, HCA i identyfikacja efektów partii,
analiza różnicowa z wykorzystaniem ANOVA, limma i metod dla RNA-seq,
projektowanie modeli statystycznych, kontrastów i kontrola FDR,
wizualizacja wyników w ggplot2 i Esquisse,
analiza szlaków i wzbogacenia funkcjonalnego: ORA i GSEA,
analiza i wizualizacja sieci biologicznych w Cytoscape,
wykorzystanie biologicznych baz danych i repozytoriów zgodnie z zasadami FAIR,
tworzenie odtwarzalnych analiz i raportów w RStudio/Quarto.
Harmonogram warsztatów:
Planowanie eksperymentu oraz przygotowanie do wiarygodnej eksploracji danych
pytanie biologiczne, hipoteza i jednostka obserwacji;
projekty sparowane, wieloczynnikowe i longitudinalne;
randomizacja i problem całkowitego pomieszania efektu biologicznego z efektem partii;
macierz intensywności, macierz zliczeń, metadane oraz adnotacje cech.
Wprowadzenie do analizy w RStudio
uruchamianie skryptu; obiekty i ramki danych; instalacja bibliotek; import pliku; struktura projektu RStudio;
poziomy czynników i grupy referencyjne;
format szeroki i długi; tworzenie tabeli metadanych gotowej do modelowania.
Kuracja i preprocessing danych
duplikaty cech i próbek; zera, wartości brakujące i wartości poniżej granicy detekcji;
rozróżnienie MCAR, MAR i MNAR;
filtrowanie niskiej wariancji QR; blank filtering i pooled QC dla danych LC-MS;
różnica między transformacją, normalizacją i skalowaniem;
porównanie wyników uzyskanych po różnych decyzjach preprocessingowych;
analiza wrażliwości zamiast stosowania jednej „obowiązkowej” metody imputacji;
współczynniki zmienności w próbkach QC; identyfikowanie próbek odstających;
Analiza EDA: PCA; PLS-DA, różnice stosowania metod nadzorowanych i nienadzorowanych.
Modele różnicowe i poprawne wnioskowanie statystyczne
zmienna odpowiedzi i zmienne objaśniające; grupa referencyjna;
istotność statystyczna oraz biologiczna, testy statystyczne a porównania post hoc;
projekty jedno- i wieloczynnikowe; interakcje; projekty sparowane; współzmienne ciągłe;
modele mieszane; testowania hipotez w ramach modelu liniowego (ANOVA) oraz stabilizacja modelu liniowego za pomocą empirycznej moderacji Bayesowskiej (limma);
wielokrotne testowanie i interpretacja biologiczna.
Krótkie wprowadzenie do analizy transkryptomicznej
porównanie rezultatów z analizą ciągłej macierzy intensywności.
Wizualizacja wyników różnicowych
ggplot2; oraz Esquisse jako narzędzie do interaktywnego projektowania wykresów;
boxploty, violin plots, jitter i wykresy punktowe; PCA i wykresy scores i loadings; macierze korelacji i heatmapy; MA plot; volcano plot; wykresy wielkości efektów; profile zmian.
ORA, GSEA i analiza topologii szlaków
identyfikatory Ensembl i Entrez; akcesje UniProt; identyfikatory metabolitów i lipidów;
niejednoznaczne mapowania; relacje jeden-do-wielu i wiele-do-jednego;
ortologi i organizm referencyjny;
przygotowanie poprawnego zbioru tła;
analiza nadreprezentacji; GSEA; gene ratio i enrichment score; leading edge;
wizualizacja dotplot, ridgeplot, enrichment plot i cnetplot.
Cytoscape i wprowadzenie do sieci korelacyjnych
rodzaje sieci (WGCNA to nie wszystko), import tabeli wynikowej; import sieci;
mapowanie logFC na kolor węzła; mapowanie FDR lub wielkości efektu na rozmiar węzła;
sieci białko–białko i białko–związek;
opisywanie klastrów funkcjonalnych.
Krótkie wprowadzenie do integracji wieloomicznej
porównanie zmian na poziomie gen–białko–metabolit;
analiza wspólnych szlaków;
integracja nadzorowana i nienadzorowana; mixOmics/DIABLO jako podejście nadzorowane; MOFA2 jako podejście wykorzystujące ukryte czynniki zmienności;
problemy wynikające z różnych skal, liczby cech i brakujących próbek.
Odtwarzalność, raport i repozytoria
względne ścieżki dostępu; kontrola losowości;
sessionInfo; zarządzanie wersjami pakietów za pomocą renv; raport Quarto;
przygotowanie sekcji „Analiza statystyczna” do publikacji;
Git jako kontrola wersji; dane surowe, przetworzone i kod jako osobne elementy projektu;
zasady FAIR; minimalny słownik danych i opis metadanych;
Repozytoria dla danych proteomicznych, metabolomicznych, transkryptomicznych, genomiki funkcjonalnej; GitHub/Zenodo — kod, wersjonowanie i archiwizacja analiz.
Cele kształcenia
Po kursie uczestnik będzie potrafił:
zweryfikować poprawność macierzy danych i metadanych, stworzyć raport QC;
dobrać odpowiednie metody filtrowania, transformacji, normalizacji i skalowania danych;
przeprowadzić kontrolę jakości danych, PCA, HCA oraz diagnostykę efektów partii;
odróżnić analizę eksploracyjną od modelowania predykcyjnego;
zbudować model limma dla projektu jedno- lub wieloczynnikowego;
dobrać odpowiednią metodę analizy danych RNA-seq;
przygotować i interpretować wyniki analizy różnicowej, uwzględniając wielkość efektu i FDR;
wizualizować wyniki analiz statystycznych z wykorzystaniem pakietu ggplot2;
tworzyć wykresy za pomocą interfejsu Esquisse oraz modyfikować wygenerowany kod ggplot2;
przeprowadzić analizę nadreprezentacji i GSEA z zastosowaniem odpowiedniego zbioru tła;
zbudować i zwizualizować sieć biologiczną w Cytoscape;
wygenerować odtwarzalny raport w środowisku Quarto;
wyszukiwać i integrować informacje z biologicznych baz danych oraz korzystać z repozytoriów danych zgodnie z zasadami FAIR.
Dr hab. inż. Anna Piasecka
Adiunkt w Instytucie Chemii Bioorganicznej Polskiej Akademii Nauk w Poznaniu. Autorka licznych publikacji naukowych, kierownik oraz wykonawca wielu projektów badawczych. Doświadczony szkoleniowiec. Ekspert i praktyk w dziedzinie spektrometrii mas oraz bioinformatycznym przetwarzaniu danych metabolomicznych z 14-letnim doświadczeniem. Jeden z najlepszych europejskich specjalistów w dziedzinie metabolomiki. Odbyła staż zagraniczny w Getyndze. Współpracuje m. in. z Uniwersytetem Jagiellońskim, Szkołą Główną Gospodarstwa Wiejskiego, The Leibniz Institute of Plant Genetics and Crop Plant Research, Max Planck Institute for Plant Breeding Research.