Najbliższy wykład szkoleniowy odbędzie się 10 października. Temat: Modele liniowe i probabilistyczne, SVM
Zadania na Olimpiadzie są inspirowane rzeczywistymi problemami nauki i przemysłu. Mogą dotyczyć m.in. wykrywania nieprawidłowości w sygnale EKG, rozpoznawania halucynacji w treściach generowanych przez duże modele językowe, wykrywania obiektów na zdjęciach czy projektowania ataków, które celowo wprowadzają modele AI w błąd. Rozwiązanie zadania może polegać na analizie zbioru danych i odkrywaniu ukrytych w nim zależności lub na stworzeniu i wytrenowaniu własnego modelu sztucznej inteligencji, na przykład sieci neuronowej.
Wiele zadań wymaga obliczeń na kartach graficznych (GPU), do których zapewniamy dostęp podczas 2. i 3. etapu Olimpiady. Zadania są oceniane w pełni automatycznie na specjalnie przygotowanej infrastrukturze systemu sprawdzającego. System sprawdzający jest dostępny dla zarejestrowanych uczestników podczas trwania 1. etapu olimpiady i w czasie etapów stacjonarnych. Rejestracja jest otwierana co roku przed 1. etapem Olimpiady.
Przykłady
Aby lepiej zilustrować na czym mogą polegać zadania, poniżej znajdują się opisy trzech z nich:
wykrywanie zaburzeń sygnału EKG (II OAI, 1. etap)
W tym zadaniu Uczestnik dostaje zbiór danych zawierający syntetyczne sygnały EKG, czyli zapis pracy serca w czasie. Część sygnałów EKG jest prawidłowa, a część odpowiada wybranym schorzeniom, np. migotaniu przedsionków. Zadaniem uczestnika jest wyodrębnienie z fragmentów EKG czterech liczbowych cech sygnału, które pozwolą najlepiej przewidzieć obecność schorzeń. Dobór cech jest oceniany przez jakość wytrenowanego na ich podstawie modelu uczenia maszynowego, którego nie można zmieniać. Im lepsze cechy, tym dokładniejsze przewidywania modelu oraz wyższa ocena rozwiązania.
Zadaniem jest odkrycie anomalii, które znajdują się tylko w szczególnych fragmentach sygnału. Rozwiązanie nie wymaga wiedzy medycznej, a całe niezbędne wprowadzenie jest przedstawione w treści zadania.
W powyższym problemie nacisk postawiony jest na analizę danych wejściowych, a model nie jest modyfikowany przez użytkownika. Poniżej opiszemy zadanie z finałowego etapu, w którym należało dotrenować dostarczony model sieci neuronowej.
Stylizacja tłumaczeń maszynowych (II OAI, 3. etap)
W ramach tego zadania dostarczony jest konkretny mały wytrenowany model do tłumaczeń z języka angielskiego na język polski oraz zdania w języku angielskim zawierające specjalistyczne terminy z dziedziny uczenia maszynowego. Dla każdego z takich zdań zbiór danych zawiera również listę występujących w nich specjalistycznych terminów oraz oczekiwane tłumaczenie tego zdania na język polski. Jednakże, w tym tłumaczeniu terminy specjalistyczne są przetłumaczone inaczej niż dokonałby tego dostarczony model - stosowane są polskie odpowiedniki, podczas gdy celem tego zadania było pozostawienie angielskich terminów.
Zadanie to wymaga implementacji pętli do wydajnego dotrenowania modelu z uwzględnieniem nowoczesnych technik, tak jak np. zmiana tempa treningu w ramach kolejnych etapów poprzez zmniejszanie współczynnika uczenia, z uwzględnieniem fazy “rozgrzewki”.
W poprzednim zadaniu uczestnicy dostosowywali gotowy model do nowych wymagań. Kolejny przykład, pochodzący z III edycji Olimpiady, łączy samodzielny dobór i trening modelu z odpowiednim przygotowaniem danych wejściowych.
Segmentacja multispektralna (III OAI, 1. etap)
W tym zadaniu uczestnik otrzymuje obrazy satelitarne zarejestrowane w dwunastu pasmach spektralnych o różnych zakresach promieniowania elektromagnetycznego, z których każdy niesie inną informację o obserwowanym terenie. Zadaniem jest przygotowanie i wytrenowanie modelu, który przypisze każdemu pikselowi jedną z czterech kategorii: wodę, ląd, roślinność lub tereny przemysłowe, czyli dokona segmentacji obrazu. Uczestnik ma do dyspozycji obrazy z prawidłowymi etykietami, na których może trenować model i sprawdzać jego skuteczność.
Dodatkowym wyzwaniem jest ograniczenie liczby kanałów przekazywanych do modelu. Rozwiązania korzystające ze wszystkich dwunastu nie otrzymują punktów za tę część oceny, a maksymalną ich liczbę zdobywają dopiero te ograniczone do trzech. Uczestnik musi więc zmierzyć się z problemem redukcji zbędnej informacji: wybrać najbardziej przydatne pasma lub przekształcić dane tak, by zachować kluczowe informacje w mniejszej liczbie kanałów, szukając kompromisu między jakością segmentacji a ilością wykorzystywanych danych. Zadanie łączy więc analizę i przetwarzanie danych z samodzielnym doborem i treningiem modelu uczenia maszynowego.