Agnieszka Nowak Brzezińska

Transkrypt

1 Agnieszka Nowak Brzezińska

2 Klasyfikacja Bayesowska jest klasyfikacją statystyczną. Pozwala przewidzieć prawdopodobieństwo przynależności obiektu do klasy. Opiera się na twierdzeniu Bayesa. Twierdzenia Bayesa pokazuje, w jaki sposób obliczyć prawdopodobieństwo warunkowe P(H X), jeśli znane są prawdopodobieństwa: warunkowe P(X H) oraz bezwarunkowe P(H) i P(X). Prawdopodobieństwa: P(X H), P(H) oraz P(X) mogą być bezpośrednio wyliczone z danych zgromadzonych w treningowym zbiorze danych (w bazie danych).

3 Każdy obiekt traktowany jest jako wektor X (krotka) wartości atrybutów A 1,..., A n : X = (x1, x2,..., xn). Niech C 1,..., C m będą klasami, do których może należeć X, P(C X) niech oznacza prawdopodobieństwo przynależności X (ściślej: obiektów o właściwości X) do klasy C. W klasyfikacji Bayesa przypisujemy X do tej klasy, do której prawdopodobieństwo warunkowe przynależności X jest największe. X jest więc przypisany do C i, jeśli P(C i X) P(C k X), dla każdego k, 1 k m, k i.

4 1. W klasyfikacji Bayesa maksymalizujemy: 2. Ponieważ P(X) jest stałe, więc wystarczy maksymalizować Iloczyn P(X C i )P(C i ). 3. Ponadto przyjmujemy: P(C i ) = s i / s, gdzie s oznacza liczbę obiektów w zbiorze treningowym, a s i oznacza liczbę obiektów w klasie C i. 4. Dla X = (x 1, x 2,..., x n ), wartość P(X C i ) obliczamy jako iloczyn: P(X C i ) = P(x 1 C i )*P(x 2 C i )*... *P(x n C i ), przy czym: P(x k C i ) = s ik / s i, gdzie s ik oznacza liczbę obiektów klasy C i, dla których wartość atrybutu A k jest równa x k, a s i oznacza liczbę wszystkich obiektów klasy Ci w zadanym zbiorze treningowym.

5 Klasyfikacja bayesowska, to metoda budowy systemu ekspertowego, w której wiedza przedstawiona jest á priori z warunkowymi prawdopodobieństwami, a wnioskowanie polega na liczeniu następnych prawdopodobieństw. Mechanizm wnioskowania wykorzystujący twierdzenie Bayesa polega na obliczaniu prawdopodobieństwa każdego możliwego wyniku, gdy znany jest dany konkretny przypadek.

6 Wadą tej metody jest fakt, że wymaga ona znajomości dokładnych wartości lub rozkładów prawdopodobieństw pojawienia się parametrów zjawiska, czyli problemu będącego przedmiotem rozważań. Innym problemem jest to, że należy dokonać pewnych nierealistycznych założeń na przykład w klasyfikacji bayesowskiej wymagane wyniki, np. rozpoznawania, musza się wzajemnie wykluczać. Niestety w wielu przypadkach mogą występować liczne podobne wyniki (np. w diagnostyce: pacjent może mieć wiele chorób). Innym założeniem, co prawda niewymaganym przez twierdzenie Bayesa, ale wymuszonym przez praktykę, jest statystyczna niezależność cechy problemu.

7 Koncepcja sieci Bayesa wynika wprost z koncepcji prawdopodobieństwa warunkowego. Jak się okazuje w rzeczywistym świecie jest wiele sytuacji w których wystąpienie jakiegoś zdarzenia ściśle zależy od innego zdarzenia. Zastosowanie sieci Bayesa pozwala na uniknięcie obliczeń o dużej złożoności obliczenie jednego prawdopodobieństwa a posteriori łączy się z uprzednim obliczeniem wykorzystywanych prawdopodobieństw. Sieci Bayesa służą do przedstawiania niepewności wiedzy. Niepewność wiedzy używanej zawartej w systemach ekspertowych może mieć wiele czynników: niepewność ekspertów dotycząca ich wiedzy niepewność tkwiąca w modelowanej dziedzinie niepewność inżyniera próbującego przetłumaczyć wiedzę niepewność wynikła z dokładności dostępnej wiedzy

8 Sieci Bayesa używają teorii prawdopodobieństwa do określenia niepewności przez jawne reprezentowanie warunkowych zależności pomiędzy różnymi częściami wiedzy. Pozwala to na intuicyjną graficzną wizualizację wiedzy zawierającą wzajemne oddziaływania pomiędzy różnymi źródłami niepewności. Sieci Bayesa są stosowane w diagnostyce, w rozumowaniu przebiegającym od efektów do przyczyn i odwrotnym. W systemach ekspertowych sieci Bayesa znalazły zastosowanie w medycynie (systemy doradcze, które rozpoznają chorobę na podstawie podawanych objawów).

9 Wejście: Rozważana populacja obiektów (klientów) opisana jest za pomocą czterech atrybutów: Wiek, Dochód, Studia, OcenaKred. Interesuje nas przynależność obiektów do jednej z dwóch klas: klienci kupujący komputery (o etykiecie TAK) i klienci nie kupujący komputerów (o etykiecie NIE). Z bazy danych wybrano zbiór treningowy. Obiekt X o nieznanej przynależności klasowej ma postać: X = (Wiek = <=30, Dochód = średni, Student = tak, OcenaKred = dobra ) Wyjście: Określić przynależność obiektu X do klasy C1 ( tak ) lub C2 ( nie ) za pomocą klasyfikacji Bayesa.

10

11 Klasyfikowany obiekt: X = (Wiek = <=30, Dochód = średni, Student = tak, OcenaKred = dobra ) Należy obliczyć, dla jakiej wartości i, (i =1, 2) iloczyn P(X C i )*P(C i ), osiąga maksimum. 2. P(C i ) oznacza prawdopodobieństwo bezwarunkowe przynależności obiektu do klasy (inaczej: prawdopodobieństwo klasy) C i, i = 1, 2. Ze zbioru treningowego obliczamy: P(C 1 ) = 9/14 = P(C 2 ) = 5/14 = Prawdopodobieństwa warunkowe P(X C i ) są odpowiednio równe iloczynom prawdopodobieństw warunkowych: P(X C 1 ) = P(Wiek= <=30 C 1 ) * P(Dochód= średni C 1 ) P(Studia= tak C 1 ) * P(OcenaKred= dobra C 1 ), P(X C 2 ) = P(Wiek= <=30 C 2 ) * P(Dochód= średni C 2 ) P(Studia= tak C 2 ) * P(OcenaKred= dobra C 2 ),

12 Ze zbioru treningowego obliczamy: P(Wiek= <=30 C 1 ) = 2/9 = P(Dochód= średni C 1 ) = 4/9 = P(Studia= tak C 1 ) = 6/9 = P(OcenaKred= dobra C 1 ) = 6/9 = P(Wiek= <=30 C 2 ) = 3/5 = P(Dochód= średni C 2 ) = 2/5 = 0,400 P(Studia= tak C 2 ) = 1/5 = P(OcenaKred= dobra C 2 ) = 2/5 = 0.400

13 Stąd: P(X C 1 ) = 0.222*0.444*0.667*0.667 = P(X C 1 )P(C 1 ) = 0.044*0.643 = P(X C 2 ) = 0.600*0.400*0.200*0.400 = P(X C 2 )P(C 2 ) = 0.019*0.357 = X został zaklasyfikowany do C 1.

14 Thomas Bayes (ur. ok w Londynie zm. 17 kwietnia 1761) brytyjski matematyk i duchowny prezbiteriański, znany ze sformułowania opublikowanego pośmiertnie twierdzenia Bayesa, które to zapoczątkowało dział statystyki.

15 (od nazwiska Thomasa Bayesa) to twierdzenie teorii prawdopodobieństwa, wiążące prawdopodobieństwa warunkowe zdarzeń. Na przykład, jeśli jest zdarzeniem "u pacjenta występuje wysoka gorączka", i jest zdarzeniem "pacjent ma grypę", twierdzenie Bayesa pozwala przeliczyć znany odsetek gorączkujących wśród chorych na grypę i znane odsetki gorączkujących i chorych na grypę w całej populacji, na prawdopodobieństwo, że ktoś jest chory na grypę, gdy wiemy że ma wysoką gorączkę. Twierdzenie stanowi podstawę teoretyczną sieci bayesowskich, stosowanych w eksploracji danych.

16 Jeśli A i B są prostymi zdarzeniami w przestrzeni prób, to prawdopodobieństwo warunkowe P(A/B) będzie określone jako: P( A B) P( A B) P( B) liczba wyników liczba Również P(B/A) = P(AB)/P(A). zarówno wyników w w A jak B Przekształcając ten wzór, otrzymujemy wzór na przecięcie zdarzeń P(AB) = P(B/A)P(A) i po podstawieniu mamy: P( B / A) P( A) P( A B) P( B) Co jest tezą twierdzenia Bayesa dla prostych zdarzeń. i B

17

18 Sieć bayesowska to acykliczny (nie zawierający cykli) graf skierowany, w którym: węzły reprezentują zmienne losowe (np. temperaturę jakiegoś źródła, stan pacjenta, cechę obiektu itp.) łuki (skierowane) reprezentują zależność typu zmienna X ma bezpośredni wpływ na zmienna Y, każdy węzeł X ma stowarzyszona z nim tablice prawdopodobieństw warunkowych określających wpływ wywierany na X przez jego poprzedników (rodziców) w grafie, Zmienne reprezentowane przez węzły przyjmują wartości dyskretne (np.: TAK, NIE).

19 Siecią Bayesa nazywamy skierowany graf acykliczny o wierzchołkach reprezentujących zmienne losowe i łukach określających zależności. Istnienie łuku pomiędzy dwoma wierzchołkami oznacza istnienie bezpośredniej zależności przyczynowo skutkowej pomiędzy odpowiadającymi im zmiennymi. Siła tej zależności określona jest przez tablice prawdopodobieństw warunkowych.

20 a E b d c G F gdzie a, b, c, d to obserwacje, E, F, G to hipotezy Aby zdefiniować graf zwykle podaje się zbiór jego wierzchołków oraz zbiór jego krawędzi. Każdy wierzchołek reprezentuje obserwację lub hipotezę, każda krawędź jest określona w ten sposób, że podaje się dla niej informacje o wierzchołkach które dana krawędź łączy, oraz ewentualnie dla grafów skierowanych informację o kierunku krawędzi. Załóżmy, że G będzie grafem określonym zbiorem wierzchołków N i krawędzi E. Załóżmy, również że dany jest zbiór prawdopodobieństw warunkowych CP. Elementami tego zbiory są prawdopodobieństwa opisujące poszczególne krawędzie grafu

21 Pod pojęciem sieci Bayesowskiej rozumieć będziemy trójkę: B = { N, E, CP } gdzie dwójka {N,E} jest zorientowanym grafem acyklicznym zbudowanym na podstawie zadanych prawdopodobieństw warunkowych zawartych w zbiorze CP. N (ang. Nodes) węzły w grafie odpowiadające zbiorom obserwacji i hipotez E (ang. edges) krawędzie odzwierciedlające kierunek wnioskowania Każdy wierzchołek w sieci przechowuje rozkład P(X i (i) ) gdzie X (i) jest zbiorem wierzchołków odpowiadających (i) poprzednikom (rodzicom) wierzchołka (i).

22 Prawdopodobieństwo wystąpienia anginy w przypadku objawów takich jak ból gardła i gorączka jest wysokie i wynosić może 0.8. Jednak wystąpienie gorączki i bólu głowy może świadczyć o grypie, co jest hipoteza prawdopodobna na 0.6. W przypadku gdy pacjent cierpiący na grypę nie wyleczył się całkowicie może dojść do zapalenia oskrzeli z prawdopodobieństwem 0.4. Zapalenie oskrzeli może spowodować ból gardła z prawdopodobieństwem 0.3. Hipotezy: A Angina D-grypa O-Zapalenie oskrzeli b g 0.8 A 0.3 Objawy: b-ból gardła g-gorączka c-ból głowy c 0.6 D e 0.4 O e-brak całkowitego wyleczenia CP = {P(A b,g)=0.8; P(D g,c)=0.6; P(O D,e)=0.4;P(b O)=0.3}

23 Rozkład prawdopodobieństw zapisuje się jako: P( x n,..., x ) P( x X ) 1 n i ( i) i1 W grafie wierzchołki są etykietowane nazwami atrybutów. Przy każdym wierzchołku występuje tabela prawdopodobieństw warunkowych pomiędzy danym wierzchołkiem i jego rodzicami.

24 Węzeł A jest rodzicem lub poprzednikiem wierzchołka X, a wierzchołek X jest potomkiem lub następnikiem węzła A, jeżeli istnieje bezpośrednia krawędź z wierzchołka A do X. p( X m 1 x1, X 2 x2,..., X m xm) p( X i xi rodzice( X i )) i1 A więc prawdopodobieństwo pojawienia się wierzchołka potomnego zależy tylko od jego rodziców!

25 zdefiniowanie zmiennych, zdefiniowanie połączeń pomiędzy zmiennymi, określenie prawdopodobieństw warunkowych i a priori (łac. z założenia) wprowadzenie danych do sieci, uaktualnienie sieci, wyznaczenie prawdopodobieństw a posteriori ( łac. z następstwa) Sieć bayesowska koduje informacje o określonej dziedzinie za pomocą wykresu, którego wierzchołki wyrażają zmienne losowe, a krawędzie obrazują probabilistyczne zależności między nimi.

26 Sieci te mają wiele zastosowań m.in. w Sztucznej inteligencji, medycynie (w diagnozowaniu), w genetyce, statystyce, w ekonomii. O popularności SB zadecydowało to, że są dla nich wydajne metody wnioskowania. Możliwe jest proste wnioskowanie o zależności względnej i bezwzględnej badanych atrybutów. Niezależność może tak zmodularyzować naszą wiedzę, że wystarczy zbadanie tylko części informacji istotnej dla danego zapytania, zamiast potrzeby eksploracji całej wiedzy. Sieci Bayesowskie mogą być ponadto rekonstruowane, nawet jeśli tylko część właściwości warunkowej niezależności zmiennych jest znana. Inną cechą SB jest to, że taką sieć można utworzyć mając niepełne dane na temat zależności warunkowej atrybutów.

27 Przykład: jakie są szanse zdania ustnego egzaminu u prof. X, który jest kibicem Wisły i nie lubi deszczu? Z - zaliczony egzamin N - dobre przygotowanie H - dobry humor egzaminatora A - awans Wisły do Ligi Mistrzów D - deszcz Łączny rozkład prawdopodobieństwa: P(Z, N, H, A,D) wyznaczony przez 2 5 wartości (32 wartości)

28 Prawdopodobieństwo dobrego humoru, jeżeli Wisła awansowała: P(H=trueA=true): D N Z D A H N Z P A H P,, ),,,, ( ), ( D H N Z D A H N Z P A P,,, ),,,, ( ) ( 8 sumowań 16 sumowań ) ( ), ( ) ( A P A H P A H P obliczymy z łącznego rozkładu P(Z, N, H, A,D), na podstawie prawdopodobieństw brzegowych:

29 P(A) 0.20 P(D) 0.30 P(N) 0.20 A D P(H) T 0.95 T F 0.99 T 0.05 F F 0.15 P(Z H,D) = P(Z H) N H P(Z) T 0.90 T F 0.55 T 0.45 F F 0.05

30 Musimy pamiętać mniej wartości: w naszym przypadku 11 zamiast 31 (ogólnie n2 k, n-liczba wierzchołków, k - maksymalna liczba rodziców; zamiast 2 n -1 wszystkich wartości w rozkładzie pełnym) Naturalne modelowanie: łatwiej oszacować prawd. warunkowe bezpośrednich zależności niż koniunkcji wszystkich możliwych zdarzeń Dowolny kierunek wnioskowania Czytelna reprezentacja wiedzy Łatwa modyfikacja

31 Reguła łańcuchowa: z def. P(X 1,X 2 )=P(X 1 X 2 )P(X 2 ) P( X,..., X n) P( X i X i1,..., X 1 n i Numerując wierzchołki grafu tak aby indeks każdej zmiennej był mniejszy niż indeks przypisany jego przodkom oraz korzystając z warunkowej niezależności otrzymujemy: ) P( Xi X i1,..., X n) P( Xi Parents ( Xi)) Model zupełny P( X1,..., X n) P( X i i Parents ( X i ))

32 P(Z,N,H,A,D) = P(Z N,H) P(N) P(H A,D) P(A) P(D) Jaka jest szansa zaliczenia dla nieprzygotowanego studenta, gdy pada, Wisła odpadła i egzaminator jest w złym humorze? P(Z N H A D) = = P(A) 0.20 P(D) 0.30 P(N) 0.20 N H P(Z) T 0.90 T F 0.55 T 0.45 F F 0.05 A D P(H) T 0.95 T F 0.99 T 0.05 F F 0.15

33 Prawdopodobieństwo Zaliczenia 74%

34 Egzamin zaliczony, jakie były tego przyczyny? Wzrost P(A) z 20% do 40%, przy spadku P(D) - wykluczanie

35 Jeśli się przygotowaliśmy, to jaka jest szansa na zaliczenie? Spadek P(Z) z 26% do 17%

36 ... ale dodatkowo, Wisła awansowała i świeci słońce! Wzrost P(Z) z 17% do 45%. Podchodzić?

37 Dodajemy wierzchołki decyzyjne (Podejście) oraz użyteczności (Stypendium) i możemy mierzyć wpływ ilościowy decyzji (Podchodzić, Nie Podchodzić) Podej Zalicz Styp true false true true false false

38 Czy warto iść gdy jesteśmy nieprzygotowani, świeci słońce i Wisła awansowała?

39 A pogoda (słonecznie/pochmurno/deszczowo/wietrznie) B czas wolny (tak/nie) X humor (bardzo dobry/dobry/nietęgi) C zajęcie na zewnątrz (spacer/basen/rower) D zajęcie w domu(komputer/książka/gotowanie) A X B C D

40 If A=a1 and B=b1 then X=x1 with 30% If A=a1 and B=b1 then X=x2 with 30% If A=a1 and B=b1 then X=x2 with 40% If A=a1 and B=b2 then X=x1 with 20% If A=a1 and B=b2 then X=x2 with 40% If A=a1 and B=b2 then X=x2 with 40% If A=a2 and B=b1 then X=x1 with 10% If A=a2 and B=b1 then X=x2 with 30% If A=a2 and B=b1 then X=x2 with 60% If A=a2 and B=b2 then X=x1 with 5% If A=a2 and B=b2 then X=x2 with 35% If A=a2 and B=b2 then X=x2 with 60% If A=a3 and B=b1 then X=x1 with 40% If A=a3 and B=b1 then X=x2 with 40% If A=a3 and B=b1 then X=x2 with 20% P(X A,B) x1 x2 x3 a1b a1b a2b a2b a3b a3b a4b a4b If A=a3 and B=b2 then X=x1 with 20% If A=a3 and B=b2 then X=x2 with 50% If A=a3 and B=b2 then X=x2 with 30% If A=a4 and B=b1 then X=x1 with 60% If A=a4 and B=b1 then X=x2 with 35% If A=a4 and B=b1 then X=x2 with 5% If A=a4 and B=b2 then X=x1 with 30% If A=a4 and B=b2 then X=x2 with 40% If A=a4 and B=b2 then X=x2 with 30%

41 A a a a a P(X A,B) x1 x2 x3 a1b a1b a2b a2b a3b a3b a4b a4b B b1 0.4 b2 0.6 P(C X) c1 c2 c3 X X X P(DX) d1 d2 d3 X X X

42 A a a a a B b1 0.4 b2 0.6 P(X A,B) X1 x2 x3 a1b a1b a2b a2b a3b a3b a4b a4b P(C X) c1 c2 c3 X X X P(DX) d1 d2 d3 X X X *0.6*0.05*0.5*0.4 ) ( ) ( ) ( ) ( ) ( ),,,, ( ) ( ) ( ) ( ) ( ) ( ),,,, ( x X d D p x X c C p b B a A x X p b B p a A p x X d D c C b B a A p x X d D p x X c C p b B a A x X p b B p a A p x X d D c C b B a A p

43 A a a a a P(X A,B) X1 x2 x3 a1b a1b a2b a2b a3b a3b a4b a4b B b1 0.4 b2 0.6 p( X x1 A a1 B b1 )* p( A a1)* p( B b1 ) 0.3*(0.25*0.4) 0.3*

44 A a a a a B b1 0.4 b2 0.6 P(C X) c1 c2 c3 X X X P(DX) d1 d2 d3 X X X * * * * * * * *0.1 ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( ) ( b B a A p b B a A x X p b B a A p b B a A x X p b B a A p b B a A x X p b B a A p b B a A x X p b B a A p b B a A x X p b B a A p b B a A x X p b B a A p b B a A x X p b B a A p b B a A x X p x X p P(X A,B) X1 x2 x3 a1b a1b a2b a2b a3b a3b a4b a4b

45 Jakie są szanse zdania ustnego egzaminu u prof. X, który jest kibicem Wisły i nie lubi deszczu? Wynik egzaminu zależy od: dobrego przygotowania studenta dobrego humor egzaminatora awansu Wisły do Ligi Mistrzów Deszczu by nie padał!!!

46 Jak prawdopodobne jest zdanie egzaminu gdy humor egzaminatora i przygotowanie studenta jest pewne w skali pół na pół?

47 Jak prawdopodobne jest zdanie egzaminu gdy humor egzaminatora i przygotowanie studenta jest pewne przynajmniej w 70 %?

48 Jak prawdopodobne jest zdanie egzaminu gdy humor egzaminatora jest dobry ale przygotowanie studenta niestety fatalne!?

49

50

51

52

53

54

55 SMILE Zestaw klas C++ implementujących różne modele decyzyjne w oparciu o analizę probabilistyczną. Wśród nich sieci Bayesa, modele równań strukturalnych. SMILE doskonałe sprawdzi się w roli engine'u dla różnego rodzaju aplikacji, których celem jest tworzenia graficznej reprezentacji model probabilistycznego. Biblioteka została zaprojektowana w ten sposób, iż może być wykorzystana w kodzie C poprzez wywołania funkcji. Co więcej, istnieje również wersja przeznaczona dla platformy.net. Platforma: Macintosh, Linux, Solaris, Windows Licencja: Decision Systems Laboratory, University of Pittsburgh License GeNIe 2 GeNIe stanowi komplementarny element dla SMILE. Jest graficzną nakładką dla tej biblioteki. Z uwagi na to, że twórcy SMILE rozwijali również GeNIe, można być pewnym bezproblemowej współpracy. Za sprawą wbudowanego edytora modeli GeNIe pozwala na swobodną modyfikację modeli probabilistycznych. Możliwa jest także wymiana danych z innymi aplikacjami (Excel). Platforma: Windows Licencja: Decision Systems Laboratory, University of Pittsburgh License

56 Przedstawione na grafie zależności są modelowane przez przedstawione liczbowo prawdopodobieństwo wyrażające siłę, z jaką oddziałują na siebie zmienne. Prawdopodobieństwo jest kodowane w tabelach dołączanych do każdego węzła i indeksowanych przez węzły nadrzędne. Górne wiersze tabeli przedstawiają wszystkie kombinacje stanów zmiennych nadrzędnych.

57 Węzły bez poprzedników są opisane głównymi prawdopodobieństwami. Węzeł Success będzie opisany przez rozkład prawdopodobieństw tylko jego dwóch wyników możliwych: Success i Failure. Węzeł Forecast będzie natomiast opisany przez rozkład prawdopodobieństw wyjściowych wartości (Good, Moderate, Poor) uwarunkowanych dodatkowo przez ich poprzedniki (węzeł Success, i wyjściowe wartości Success i Failure).

58

59

60

61

62

63

64

65 Sieć Bayesa

66 Rozważmy osobę, która spędza sporo czasu przy komputerze, w wolnych chwilach gra na komputerze oraz przegląda Internet. Mało czasu poświęca na sport czy spotkania z przyjaciółmi. W szkole nie ma problemów z przedmiotami ścisłymi typu matematyka czy fizyka, jednak ma pewne problemy z przedmiotami humanistycznymi. Osoba lubi majsterkować ze sprzętem Węzeł Odpowiedź Komentarz zdolności techniczne tak Typowy gracz jest zainteresowany nowinkami technologicznymi, zdobywa różnego rodzaju gadżety i potrafi je obsługiwać. Dodatkowo, gry uczą logicznego myślenia. twórczość nie Brak poczucia estetyki i twórczego myślenia. zdolności werbalne nie Mogą być problemy z wysłowieniem się poza wirtualnym światem, dosyć ograniczone słownictwo. zdolności liczbowe tak Zamiłowanie do matematyki, fizyki. praca z ludźmi nie Trudności w poznawaniu nowych ludzi. Rzadkie spotkania z przyjaciółmi wskazują na zamkniętość osoby. polityka nie Brak zainteresowania bieżącymi wydarzeniami społecznymi i gospodarczymi. status społeczny wysoki Oczekiwanie wysokiego statusu społecznego. zarobki wysokie Oczekiwanie wysokich zarobków. kontakt z ludźmi brak Oczekiwanie braku częstego kontaktu z ludźmi w pracy praca indywidualna.

67 Rozważmy osobę, która spędza sporo czasu przy komputerze, w wolnych chwilach gra na komputerze oraz przegląda Internet. Mało czasu poświęca na sport czy spotkania z przyjaciółmi. W szkole nie ma problemów z przedmiotami ścisłymi typu matematyka czy fizyka, jednak ma pewne problemy z przedmiotami humanistycznymi. Osoba lubi majsterkować ze sprzętem

68 Otrzymane wyniki (kolor fioletowy na diagramie): Warstwa kierunki studiów: Kierunki techniczne: otrzymały najwyższy wynik (pole żaden uzyskało tylko 5%). Osoba nie mająca problemów z przedmiotami ścisłymi ma predyspozycje do kierunków technicznych. W ramach tego typu kierunków widać niewielką przewagę kierunku informatyka (50%) nad kierunkiem budownictwo (45%). Kierunki ekonomiczne: również przystępny wynik (pole żaden uzyskało 33%). Brak problemów z matematyką osoby, wpłynął na dosyć wysoki wynik dla kierunku finanse (48%) oraz niższy dla kierunku marketing (20%). Sumowanie się wyników do 101% jest spowodowane zapewne błędem programu GeNIe. Kierunki społeczne i artystyczne: otrzymano 100% i 96% dla pola żaden. Osoba, która rzadko spotyka się z przyjaciółmi, czy ma problemy z przedmiotami humanistycznymi powinna unikać tych kierunków.

69 Warstwa praca zawodowa, stanowisko: Praca inżynierska: Wysoki wynik dla kierunków technicznych w poprzedniej warstwie wpłynął na dosyć wysoki wynik dla zawodów, które wymagają tytułu inżyniera (85%). Branża rozrywkowa: Niski wynik spowodowany unikaniem kontaktów z ludźmi przez typowego gracza Stanowisko kierownicze: Dosyć wysoki wynik (80%) wynika z predyspozycji osoby do kierunków technicznych oraz ekonomicznych. Marketing: Tutaj również unikanie kontaktów z ludźmi zaniżyło wynik (11%), mimo dosyć dobrych wyników kierunków ekonomicznych. Finanse: Dosyć wysoki wynik (63%) spowodowany zdolnościami technicznymi oraz liczbowymi typowego gracza. Warstwa różne cechy i aspekty pracy: Kariera zawodowa: Dobre wyniki dla pracy jako inżynier oraz w finansach w poprzedniej warstwie, spowodowały wysoki wynik dla stabilności kariery zawodowej typowego gracza (87%).

70 Sieci bayesowskie - efektywne narzędzie w zagadnieniach systemów eksperckich oraz sztucznej inteligencji Szerokie zastosowania: NASA-AutoClass, Microsoft-Office Assistant, w przemyśle - medycyna, sądownictwo, itd. Sieci Bayesa stanowią naturalną reprezentację niezależności warunkowej (indukowanej przyczynowo). Topologia sieci i tablice prawdopodobieństwa warunkowego (CPT) pozwalają na zwartą reprezentację rozkładu łącznego prawdopodobieństwa. Sieci Bayesa są szczególnie przydane i łatwe do zastosowania w systemach ekspertowych.

71

72 Naiwny klasyfikator bayesowski jest prostym probabilistycznym klasyfikatorem. Zakłada się wzajemną niezależność zmiennych niezależnych (tu naiwność) Bardziej opisowe może być określenie- model cech niezależnych. Model prawdopodobieństwa można wyprowadzić korzystając z twierdzenia Bayesa. W zależności od rodzaju dokładności modelu prawdopodobieństwa, naiwne klasyfikatory bayesowskie można uczyć bardzo skutecznie w trybie uczenia z nadzorem.

73

74

75 Jeśli wiemy, że kulek czerwonych jest 2 razy mniej niż zielonych (bo czerwonych jest 20 a zielonych 40) to prawdopodobieństwo tego, że kolejna (nowa) kulka będzie koloru zielonego jest dwa razy większe niż tego, że kulka będzie czerwona. Dlatego możemy napisać, że znane z góry prawdopodobieństwa:

76 Jeśli więc czerwonych jest 20 a zielonych 40, to razem wszystkich jest 60. Więc Więc teraz gdy mamy do czynienia z nową kulką ( na rysunku biała):

77 To spróbujmy ustalić jaka ona będzie. Dokonujemy po prostu klasyfikacji kulki do jednej z dwóch klas: zielonych bądź czerwonych. Jeśli weźmiemy pod uwagę sąsiedztwo białej kulki takie jak zaznaczono, a więc do 4 najbliższych sąsiadów, to widzimy, że wśród nich są 3 kulka czerwone i 1 zielona. Obliczamy liczbę kulek w sąsiedztwie należących do danej klasy : zielonych bądź czerwonych z wzorów: W naszym przypadku, jest dziwnie, bo akurat w sąsiedztwie kulki X jest więcej kulek czerwonych niż zielonych, mimo, iż kulek zielonych jest ogólnie 2 razy więcej niż czerwonych. Dlatego zapiszemy, że

78 Dlatego ostatecznie powiemy, że Prawdopodobieństwo że kulka X jest zielona = prawdopodobieństwo kulki zielonej * prawdopodobieństwo, że kulka X jest zielona w swoim sąsiedztwie = Prawdopodobieństwo że kulka X jest czerwona = prawdopodobieństwo kulki czerwonej * prawdopodobieństwo, że kulka X jest czerwona w swoim sąsiedztwie = Ostatecznie klasyfikujemy nową kulkę X do klasy kulek czerwonych, ponieważ ta klasa dostarcza nam większego prawdopodobieństwa posteriori.

79 Tylko dla cech jakościowych Tylko dla dużych zbiorów danych

80

81

82

83 Aby obliczyć P(diabetes=1) należy zliczyć liczbę obserwacji dla których spełniony jest warunek diabetes=1. Jest ich dokładnie 9 z 20 wszystkich. Podobnie, aby obliczyć P(diabetes=0) należy zliczyć liczbę obserwacji dla których spełniony jest warunek diabetes=0. Jest ich dokładnie 11 z 20 wszystkich.

84 Zakładając, że zmienne niezależne faktycznie są niezależne, wyliczenie P(X diabetes=1) wymaga obliczenia prawdopodobieństwa warunkowego wszystkich wartości dla X: Np. obliczenie P(BP=high diabetes=1) wymaga znów obliczenia P(BP=high) i P(diabetes=1) co jest odpowiednio równe 4 i 9 zatem prawdopodobieństwo to wynosi 4/9:

85 Zatem: Mając już prawdopodobieństwa P(X diabetes=1) i P(diabetes=1) można wyznaczyć iloczyn tych prawdopodobieństw:

86 Teraz podobnie zrobimy w przypadku P(X diabetes=0)

87 Możemy więc wyznaczyć P(X diabetes=0): Ostatecznie iloczyn prawdopodobieństw jest wyznaczany: Jakoże P(X diabeltes=1)p(diabetes=1) jest większe niż P(X diabetes=0)p(diabetes=0) nowa obserwacja będzie zaklasyfikowana do klasy diabetes=1. Prawdopodobieństwo ostateczne że jeśli obiekt ma opis taki jak X będzie z klasy diabetes=1 jest równe:

88 Jakie będzie prawdopodobieństwo klasyfikacji do klasy diabetes=1 gdy mamy następujące przypadki: X:BP=Average ; weight=above average; FH= yes; age=50+ X:BP=low ; weight=average; FH= no; age=50+ X:BP=high ; weight=average; FH= yes; age=50+

89

90

91 jeden z algorytmów regresji nieparametrycznej używanych w statystyce do prognozowania wartości pewnej zmiennej losowej. Może również być używany do klasyfikacji. - Założenia Dany jest zbiór uczący zawierający obserwacje z których każda ma przypisany wektor zmiennych objaśniających oraz wartość zmiennej objaśnianej Y. Dana jest obserwacja C z przypisanym wektorem zmiennych objaśniających dla której chcemy prognozować wartość zmiennej objaśnianej Y.

92

93

94 Wyznaczanie odległości obiektów: odległość euklidesowa

95 Obiekty są analizowane w ten sposób, że oblicza się odległości bądź podobieństwa między nimi. Istnieją różne miary podobieństwa czy odległości. Powinny być one wybierane konkretnie dla typu danych analizowanych: inne są bowiem miary typowo dla danych binarnych, inne dla danych nominalnych a inne dla danych numerycznych. Nazwa Wzór gdzie: x,y - to wektory wartości cech porównywanych obiektów w przestrzeni p- wymiarowej, gdzie odpowiednio wektory wartości to: oraz. odległość euklidesowa odległość kątowa współczynnik korelacji liniowej Pearsona Miara Gowera

96 Oblicz odległość punktu A o współrzędnych (2,3) do punktu B o współrzędnych (7,8) A B D (A,B) = pierwiastek ((7-2) 2 + (8-3) 2 ) = pierwiastek ( ) = pierwiastek (50) = 7.07

97 9 8 B A A B C 2 1 C Mając dane punkty: A(2,3), B(7,8) oraz C(5,1) oblicz odległości między punktami: D (A,B) = pierwiastek ((7-2) 2 + (8-3) 2 ) = pierwiastek ( ) = pierwiastek (50) = 7.07 D (A,C) = pierwiastek ((5-2) 2 + (3-1) 2 ) = pierwiastek (9 + 4) = pierwiastek (13) = 3.60 D (B,C) = pierwiastek ((7-5) 2 + (3-8) 2 ) = pierwiastek (4 + 25) = pierwiastek (29) = 5.38

98 1. porównanie wartości zmiennych objaśniających dla obserwacji C z wartościami tych zmiennych dla każdej obserwacji w zbiorze uczącym. 2. wybór k (ustalona z góry liczba) najbliższych do C obserwacji ze zbioru uczącego. 3. Uśrednienie wartości zmiennej objaśnianej dla wybranych obserwacji, w wyniku czego uzyskujemy prognozę. Przez "najbliższą obserwację" mamy na myśli, taką obserwację, której odległość do analizowanej przez nas obserwacji jest możliwie najmniejsza.

99

100

101 Najbliższy dla naszego obiektu buźka jest obiekt Więc przypiszemy nowemu obiektowi klasę:

102 Mimo, że najbliższy dla naszego obiektu buźka jest obiekt Metodą głosowania ustalimy, że skoro mamy wziąć pod uwagę 5 najbliższych sąsiadów tego obiektu, a widać, że 1 z nich ma klasę: Zaś 4 pozostałe klasę: To przypiszemy nowemu obiektowi klasę:

103 Obiekt klasyfikowany podany jako ostatni : a = 3, b = 6 Teraz obliczmy odległości poszczególnych obiektów od wskazanego. Dla uproszczenia obliczeń posłużymy sie wzorem:

104

105

106 Znajdujemy więc k najbliższych sąsiadów. Załóżmy, że szukamy 9 najbliższych sąsiadów. Wyróżnimy ich kolorem zielonym. Sprawdzamy, które z tych 9 najbliższych sąsiadów są z klasy + a które z klasy -? By to zrobić musimy znaleźć k najbliższych sąsiadów (funkcja Excela o nazwie MIN.K)

107

108

109 Wyobraźmy sobie, że nie mamy 2 zmiennych opisujących każdy obiekt, ale tych zmiennych jest np. 5: {v1,v2,v3,v4,v5} i że obiekty opisane tymi zmiennymi to 3 punkty: A, B i C: V1 V2 V3 V4 V5 A B C Policzmy teraz odległość między punktami: D (A,B) = pierwiastek (( ) 2 + ( ) 2 + ( ) 2 + ( ) 2 + ( ) 2 ) = pierwiastek ( ) = pierwiastek (0.03) = 0.17 D (A,C) = pierwiastek (( ) 2 + ( ) 2 + ( ) 2 + ( ) 2 + ( ) 2 ) = pierwiastek ( ) = pierwiastek (0.69) = 0.83 D (B,C) = pierwiastek (( ) 2 + ( ) 2 + ( ) 2 + ( ) 2 + ( ) 2 ) = pierwiastek ( ) = pierwiastek (0.74) = 0.86 Szukamy najmniejszej odległości, bo jeśli te dwa punkty są najbliżej siebie, dla których mamy najmniejszą odległości! A więc najmniejsza odległość jest między punktami A i B!

110

111

112

113

114

115

116

117 Schemat algorytmu: Poszukaj obiektu najbliższego w stosunku do obiektu klasyfikowanego. Określenie klasy decyzyjnej na podstawie obiektu najbliższego. Cechy algorytmu: Bardziej odporny na szumy - w poprzednim algorytmie obiekt najbliższy klasyfikowanemu może być zniekształcony - tak samo zostanie zaklasyfikowany nowy obiekt. Konieczność ustalenia liczby najbliższych sąsiadów. Wyznaczenie miary podobieństwa wśród obiektów (wiele miar podobieństwa). Dobór parametru k - liczby sąsiadów: Jeśli k jest małe, algorytm nie jest odporny na szumy jakość klasyfikacji jest niska. Jeśli k jest duże, czas działania algorytmu rośnie - większa złożoność obliczeniowa. Należy wybrać k, które daje najwyższą wartość klasyfikacji.