Analiza statystyczna danych omicznych w RStudio (3-dniowe warsztaty online)

Analiza statystyczna danych omicznych w RStudio (3-dniowe warsztaty online)

Kompletny workflow od gotowej macierzy danych i metadanych do statystycznie uzasadnionych wniosków, szlaków biologicznych, sieci i odtwarzalnego raportu

Podczas trzydniowych warsztatów uczestnicy przejdą kompletny schemat statystycznej analizy danych omicznych w RStudio: od kontroli i uporządkowania macierzy danych oraz metadanych, przez filtrowanie, normalizację, analizę eksploracyjną i modelowanie różnicowe, po wizualizację wyników, analizę funkcjonalną, szlaki biologiczne i sieci w Cytoscape.

Praca będzie prowadzona przede wszystkim na macierzach danych proteomicznych, metabolomicznych i lipidomicznych. Osobny moduł pokaże specyfikę danych transkryptomicznych oraz różnice pomiędzy analizą ciągłych intensywności a modelowaniem surowych zliczeń RNA-seq.

Uczestnicy poznają specyfikę macierzy szerokich oraz długich oraz sposoby ich tranformacji i zastosowania. Poznają różnice między ANOVA a modelami limma, PCA a PLS-DA oraz analizą nadreprezentacji a GSEA. Nauczą się tworzyć macierze projektu i macierze danych różnicowych, metody penalizacji danych wielkoskalowych, tj. FDR i jego kontrolę, interpretować wielkości efektów, identyfikować efekty partii i unikać przeuczenia modeli nadzorowanych. Duży nacisk położymy na metodach profesjonalnej wizualizacji wyników pod cele publikacyjne.

Kurs jest przeznaczony dla osób posiadających podstawową wiedzę z zakresu statystyki oraz doświadczenie w pracy z danymi biologicznymi lub omicznymi, które chcą uporządkować i pogłębić znajomość metod statystycznych oraz nauczyć się prowadzić kompletne analizy w środowisku RStudio. Znajomość środowiska R nie jest wymagana. Szkolenie ma charakter praktyczny i zaawansowany – nie jest przeznaczone dla osób rozpoczynających naukę statystyki lub pracy z danymi od podstaw.

Szkolenie nie obejmuje przetwarzania surowych danych LC-MS, RNA-Seq ani identyfikacji związków. Jego celem jest nauczenie uczestników podejmowania poprawnych decyzji statystycznych i tworzenia odtwarzalnego schematu analizy od gotowej macierzy danych do interpretacji biologicznej.

Termin: 26, 27 i 28 października 2026, 9:00 – 14:00 (3-dniowe warsztaty online).

Liczba godzin: 15 (5 godzin każdego dnia z 2 przerwami kawowymi).

Lokalizacja: warsztaty zdalne.

Grupa: do 10 osób.

Wykładowca: Dr hab. inż. Anna Piasecka

Cena: 2499 zł netto (3073,77 zł brutto). Pracownikom finansowanym przez instytucje naukowe (lub inne jednostki finansowane ze środków publicznych) przysługuje zwolnienie z VAT.

Metody płatności: przelew na konto.

Zagadnienia:

  • przygotowanie i kontrola jakości macierzy danych omicznych,
  • filtrowanie, transformacja, normalizacja i skalowanie danych,
  • analiza eksploracyjna: PCA, HCA i identyfikacja efektów partii,
  • analiza różnicowa z wykorzystaniem ANOVA, limma i metod dla RNA-seq,
  • projektowanie modeli statystycznych, kontrastów i kontrola FDR,
  • wizualizacja wyników w ggplot2 i Esquisse,
  • analiza szlaków i wzbogacenia funkcjonalnego: ORA i GSEA,
  • analiza i wizualizacja sieci biologicznych w Cytoscape,
  • wykorzystanie biologicznych baz danych i repozytoriów zgodnie z zasadami FAIR,
  • tworzenie odtwarzalnych analiz i raportów w RStudio/Quarto.

Harmonogram warsztatów:

  1. Planowanie eksperymentu oraz przygotowanie do wiarygodnej eksploracji danych
    1. pytanie biologiczne, hipoteza i jednostka obserwacji;
    2. projekty sparowane, wieloczynnikowe i longitudinalne;
    3. randomizacja i problem całkowitego pomieszania efektu biologicznego z efektem partii;
    4. macierz intensywności, macierz zliczeń, metadane oraz adnotacje cech.
  2. Wprowadzenie do analizy w RStudio
    1. uruchamianie skryptu; obiekty i ramki danych; instalacja bibliotek; import pliku; struktura projektu RStudio;
    2. poziomy czynników i grupy referencyjne;
    3. format szeroki i długi; tworzenie tabeli metadanych gotowej do modelowania.
  3. Kuracja i preprocessing danych
    1. duplikaty cech i próbek; zera, wartości brakujące i wartości poniżej granicy detekcji;
    2. rozróżnienie MCAR, MAR i MNAR;
    3. filtrowanie niskiej wariancji QR; blank filtering i pooled QC dla danych LC-MS;
    4. różnica między transformacją, normalizacją i skalowaniem;
    5. porównanie wyników uzyskanych po różnych decyzjach preprocessingowych;
    6. analiza wrażliwości zamiast stosowania jednej „obowiązkowej” metody imputacji;
    7. współczynniki zmienności w próbkach QC; identyfikowanie próbek odstających;
    8. Analiza EDA: PCA; PLS-DA, różnice stosowania metod nadzorowanych i nienadzorowanych.
  4. Modele różnicowe i poprawne wnioskowanie statystyczne
    1. zmienna odpowiedzi i zmienne objaśniające; grupa referencyjna;
    2. istotność statystyczna oraz biologiczna, testy statystyczne a porównania post hoc;
    3. projekty jedno- i wieloczynnikowe; interakcje; projekty sparowane; współzmienne ciągłe;
    4. modele mieszane; testowania hipotez w ramach modelu liniowego (ANOVA) oraz stabilizacja modelu liniowego za pomocą empirycznej moderacji Bayesowskiej (limma);
    5. wielokrotne testowanie i interpretacja biologiczna.
  5. Krótkie wprowadzenie do analizy transkryptomicznej
    1. surowe zliczenia a wartości znormalizowane;
    2. rozkład ujemny dwumianowy; normalizację bibliotek; DESeq2; edgeR; voom-limma;
    3. porównanie rezultatów z analizą ciągłej macierzy intensywności.
  6. Wizualizacja wyników różnicowych
    1. ggplot2; oraz Esquisse jako narzędzie do interaktywnego projektowania wykresów;
    2. boxploty, violin plots, jitter i wykresy punktowe; PCA i wykresy scores i loadings; macierze korelacji i heatmapy; MA plot; volcano plot; wykresy wielkości efektów; profile zmian.
  7. ORA, GSEA i analiza topologii szlaków
    1. identyfikatory Ensembl i Entrez; akcesje UniProt; identyfikatory metabolitów i lipidów;
    2. niejednoznaczne mapowania; relacje jeden-do-wielu i wiele-do-jednego;
    3. ortologi i organizm referencyjny;
    4. przygotowanie poprawnego zbioru tła;
    5. analiza nadreprezentacji; GSEA; gene ratio i enrichment score; leading edge;
    6. wizualizacja dotplot, ridgeplot, enrichment plot i cnetplot.
  8. Cytoscape i wprowadzenie do sieci korelacyjnych
    1. rodzaje sieci (WGCNA to nie wszystko), import tabeli wynikowej; import sieci;
    2. mapowanie logFC na kolor węzła; mapowanie FDR lub wielkości efektu na rozmiar węzła;
    3. sieci białko–białko i białko–związek;
    4. opisywanie klastrów funkcjonalnych.
  9. Krótkie wprowadzenie do integracji wieloomicznej
    1. porównanie zmian na poziomie gen–białko–metabolit;
    2. analiza wspólnych szlaków;
    3. integracja nadzorowana i nienadzorowana; mixOmics/DIABLO jako podejście nadzorowane; MOFA2 jako podejście wykorzystujące ukryte czynniki zmienności;
    4. problemy wynikające z różnych skal, liczby cech i brakujących próbek.
  10. Odtwarzalność, raport i repozytoria
    1. względne ścieżki dostępu; kontrola losowości;
    2. sessionInfo; zarządzanie wersjami pakietów za pomocą renv; raport Quarto;
    3. przygotowanie sekcji „Analiza statystyczna” do publikacji;
    4. Git jako kontrola wersji; dane surowe, przetworzone i kod jako osobne elementy projektu;
    5. zasady FAIR; minimalny słownik danych i opis metadanych;
    6. Repozytoria dla danych proteomicznych, metabolomicznych, transkryptomicznych, genomiki funkcjonalnej; GitHub/Zenodo — kod, wersjonowanie i archiwizacja analiz.

Cele kształcenia

Po kursie uczestnik będzie potrafił:

  1. zweryfikować poprawność macierzy danych i metadanych, stworzyć raport QC;
  2. dobrać odpowiednie metody filtrowania, transformacji, normalizacji i skalowania danych;
  3. przeprowadzić kontrolę jakości danych, PCA, HCA oraz diagnostykę efektów partii;
  4. odróżnić analizę eksploracyjną od modelowania predykcyjnego;
  5. zbudować model limma dla projektu jedno- lub wieloczynnikowego;
  6. dobrać odpowiednią metodę analizy danych RNA-seq;
  7. przygotować i interpretować wyniki analizy różnicowej, uwzględniając wielkość efektu i FDR;
  8. wizualizować wyniki analiz statystycznych z wykorzystaniem pakietu ggplot2;
  9. tworzyć wykresy za pomocą interfejsu Esquisse oraz modyfikować wygenerowany kod ggplot2;
  10. przeprowadzić analizę nadreprezentacji i GSEA z zastosowaniem odpowiedniego zbioru tła;
  11. zbudować i zwizualizować sieć biologiczną w Cytoscape;
  12. wygenerować odtwarzalny raport w środowisku Quarto;
  13. wyszukiwać i integrować informacje z biologicznych baz danych oraz korzystać z repozytoriów danych zgodnie z zasadami FAIR.

Dr hab. inż. Anna Piasecka

Adiunkt w Instytucie Chemii Bioorganicznej Polskiej Akademii Nauk w Poznaniu. Autorka licznych publikacji naukowych, kierownik oraz wykonawca wielu projektów badawczych. Doświadczony szkoleniowiec. Ekspert i praktyk w dziedzinie spektrometrii mas oraz bioinformatycznym przetwarzaniu danych metabolomicznych z 14-letnim doświadczeniem. Jeden z najlepszych europejskich specjalistów w dziedzinie metabolomiki. Odbyła staż zagraniczny w Getyndze. Współpracuje m. in. z Uniwersytetem Jagiellońskim, Szkołą Główną Gospodarstwa Wiejskiego, The Leibniz Institute of Plant Genetics and Crop Plant Research, Max Planck Institute for Plant Breeding Research.

 

Data

26-10-2026 do
28-10-2026
 

Udostępnij wydarzenie

Zapisz się do naszego Newslettera!
Zapisz się do naszego newslettera i otrzymaj 10% zniżki przy pierwszym zamówienia na jeden z naszych dwudniowych warsztatów, bieżące informacje dotyczące darmowych webinarów, naszych produktów i usług oraz nowości ze świata bioinformatyki i sztucznej inteligencji!
icon