CUDA część 1. platforma GPGPU w obliczeniach naukowych. Maciej Matyka



Podobne dokumenty
CUDA jako platforma GPGPU w obliczeniach naukowych

Programowanie Równoległe Wykład, CUDA praktycznie 1. Maciej Matyka Instytut Fizyki Teoretycznej

Programowanie Równoległe wykład, CUDA, przykłady praktyczne 1. Maciej Matyka Instytut Fizyki Teoretycznej

Programowanie procesorów graficznych GPGPU

Programowanie procesorów graficznych NVIDIA (rdzenie CUDA) Wykład nr 1

Porównanie wydajności CUDA i OpenCL na przykładzie równoległego algorytmu wyznaczania wartości funkcji celu dla problemu gniazdowego

Modelowanie komputerowe dynamiki płynów Maciej Matyka Instytut Fizyki Teoretycznej

Programowanie Współbieżne

Programowanie Równoległe wykład 12. OpenGL + algorytm n ciał. Maciej Matyka Instytut Fizyki Teoretycznej

i3: internet - infrastruktury - innowacje

Programowanie Równoległe wykład 13. Symulacje komputerowe cieczy LBM w CUDA. Maciej Matyka Instytut Fizyki Teoretycznej

JCuda Czy Java i CUDA mogą się polubić? Konrad Szałkowski

Programowanie w modelu równoległości danych oraz dzielonej globalnej pamięci wspólnej. Krzysztof Banaś Obliczenia równoległe 1

CUDA Median Filter filtr medianowy wykorzystujący bibliotekę CUDA sprawozdanie z projektu

Przetwarzanie Równoległe i Rozproszone

Programowanie kart graficznych

Programowanie z wykorzystaniem technologii CUDA i OpenCL Wykład 1

Zastosowanie technologii nvidia CUDA do zrównoleglenia algorytmu genetycznego dla problemu komiwojażera

Programowanie procesorów graficznych GPGPU. Krzysztof Banaś Obliczenia równoległe 1

PROGRAMOWANIE WSPÓŁCZESNYCH ARCHITEKTUR KOMPUTEROWYCH DR INŻ. KRZYSZTOF ROJEK

Programowanie kart graficznych

Architektury komputerów Architektury i wydajność. Tomasz Dziubich

CUDA ćwiczenia praktyczne

Nowoczesne technologie przetwarzania informacji

Moc płynąca z kart graficznych

Praca dyplomowa magisterska

Libra.cs.put.poznan.pl/mailman/listinfo/skisrkolo.

Od wielkoskalowych obliczeń równoległych do innowacyjnej diagnostyki w kardiologii.

Wprowadzenie do programowania w środowisku CUDA. Środowisko CUDA

Katarzyna Jesionek Zastosowanie symulacji dynamiki cieczy oraz ośrodków sprężystych w symulatorach operacji chirurgicznych.

OpenGL - Open Graphics Library. Programowanie grafiki komputerowej. OpenGL 3.0. OpenGL - Architektura (1)

Tworzenie programów równoległych cd. Krzysztof Banaś Obliczenia równoległe 1

Tworzenie programów równoległych. Krzysztof Banaś Obliczenia równoległe 1

Alternatywne modele programowania równoległego

Zapoznanie z technikami i narzędziami programistycznymi służącymi do tworzenia programów współbieżnych i obsługi współbieżności przez system.

CUDA. obliczenia na kartach graficznych. Łukasz Ligowski. 11 luty Łukasz Ligowski () CUDA 11 luty / 36

Modelowanie przepływu krwi przez aortę brzuszną człowieka

Programowanie aplikacji równoległych i rozproszonych

GRAFIKA KOMPUTEROWA. Rozwiązania sprzętowe i programowe. Przyspieszanie sprzętowe. Synteza dźwięku i obrazu

Raport Hurtownie Danych

GRAFIKA KOMPUTEROWA. Rozwiązania sprzętowe i programowe. Przyspieszanie sprzętowe. Synteza i obróbka obrazu

Architektura von Neumanna

Budowa i użytkowanie klastrów w opaciu o układy Cell BE oraz GPU

Tworzenie programów równoległych. Krzysztof Banaś Obliczenia równoległe 1

Tesla. Architektura Fermi

Obliczenia na GPU w technologii CUDA

CUDA. cudniejsze przyk ady

CUDA obliczenia ogólnego przeznaczenia na mocno zrównoleglonym sprzęcie. W prezentacji wykorzystano materiały firmy NVIDIA (

Programowanie równoległe i rozproszone. Praca zbiorowa pod redakcją Andrzeja Karbowskiego i Ewy Niewiadomskiej-Szynkiewicz

Wstęp do programowania

Programowanie procesorów graficznych w CUDA.

Przetwarzanie Równoległe i Rozproszone

METODY I JĘZYKI PROGRAMOWANIA PROGRAMOWANIE STRUKTURALNE. Wykład 02

Architektura komputerów

Wysokowydajna implementacja kodów nadmiarowych typu "erasure codes" z wykorzystaniem architektur wielordzeniowych

4 NVIDIA CUDA jako znakomita platforma do zrównoleglenia obliczeń

Programowanie Obiektowo Zorientowane w języku c++ Przestrzenie nazw

Programowanie procesorów graficznych GPGPU

dr inż. Jarosław Forenc

Klasyfikacja systemów komputerowych. Architektura von Neumanna Architektura harwardzka Zmodyfikowana architektura harwardzka. dr inż.

Programowanie Równoległe wykład 12. Thrust C Maciej Matyka Instytut Fizyki Teoretycznej

Grzegorz Cygan. Wstęp do programowania mikrosterowników w języku C

MMX i SSE. Zbigniew Koza. Wydział Fizyki i Astronomii Uniwersytet Wrocławski. Wrocław, 10 marca Zbigniew Koza (WFiA UWr) MMX i SSE 1 / 16

Potok graficzny i shadery. Hubert Rutkowski

Przykładowe sprawozdanie. Jan Pustelnik

Programowanie kart graficznych. Sprzęt i obliczenia

Introduction to Computer Science

Akceleracja obliczeń algebry liniowej z wykorzystaniem masywnie równoległych, wielordzeniowych procesorów GPU Świerczewski Ł.

Programowanie procesorów graficznych do obliczeń ogólnego przeznaczenia GPGPU

Obliczenia Wysokiej Wydajności

Dodatek A. CUDA. 1 Stosowany jest w tym kontekście skrót GPCPU (od ang. general-purpose computing on graphics processing units).

Wstęp. Przetwarzanie współbieżne, równoległe i rozproszone

Wykład VII. Programowanie. dr inż. Janusz Słupik. Gliwice, Wydział Matematyki Stosowanej Politechniki Śląskiej. c Copyright 2014 Janusz Słupik

Programowanie równoległe Wprowadzenie do OpenCL. Rafał Skinderowicz

WIDMOWA I FALKOWA ANALIZA PRĄDU SILNIKA LSPMSM Z WYKORZYSTANIEM OPENCL

Tworzenie programów równoległych. Krzysztof Banaś Obliczenia równoległe 1

CUDA PROGRAMOWANIE PIERWSZE PROSTE PRZYKŁADY RÓWNOLEGŁE. Michał Bieńkowski Katarzyna Lewenda

Laboratorium 1 Temat: Przygotowanie środowiska programistycznego. Poznanie edytora. Kompilacja i uruchomienie prostych programów przykładowych.

Podsystem graficzny. W skład podsystemu graficznego wchodzą: karta graficzna monitor

ZARZĄDZANIE PAMIĘCIĄ W TECHNOLOGII CUDA

Grafika komputerowa. Grafika komputerowa. Grafika komputerowa

Przyspieszanie sprzętowe

Politechnika Rzeszowska

Algorytmy dla maszyny PRAM

Implementacja modelu FHP w technologii NVIDIA CUDA

Mo liwoœæ zastosowania GPU do przetwarzania obrazów dla celów analizy sceny**

Microsoft IT Academy kurs programowania

Jacek Matulewski - Fizyk zajmujący się na co dzień optyką kwantową i układami nieuporządkowanymi na Wydziale Fizyki, Astronomii i Informatyki

Programowanie niskopoziomowe. dr inż. Paweł Pełczyński

Wykład I. Programowanie II - semestr II Kierunek Informatyka. dr inż. Janusz Słupik. Wydział Matematyki Stosowanej Politechniki Śląskiej

Programowanie w modelu równoległości danych oraz dzielonej globalnej pamięci wspólnej. Krzysztof Banaś Obliczenia równoległe 1

16. Taksonomia Flynn'a.

Larrabee GPGPU. Zastosowanie, wydajność i porównanie z innymi układami

Programowanie proceduralne w języku C++ Podstawy

Wprowadzenie do OpenMP

Przygotowanie kilku wersji kodu zgodnie z wymogami wersji zadania,

Klasyfikacja systemów komputerowych. Architektura von Neumanna. dr inż. Jarosław Forenc

Implementacje algorytmów oddziałujących cząstek na architekturach masywnie równoległych

Procesory kart graficznych i CUDA wer

Technologia GPGPU na przykładzie środowiska CUDA

Transkrypt:

CUDA część 1 platforma GPGPU w obliczeniach naukowych Maciej Matyka

Bariery sprzętowe (procesory) ok na. 1 10 00 la raz t y Gdzie jesteśmy? a ok. 2 razy n 10 lat (ZK)

Rozwój 1985-2004 i dalej? O roku ów (ZK)

Specjalizowane układy graficzne GPU?? (ZK)

Obliczenia wysokiej wydajności Superkomputer: Altix 3700, 128 procesorów (Intel Itanium 2) Używana np. w Cyfronet AGH 0.768 TFLOPS mocy obliczeniowej Cena: 1/2 miliona zł!

Superkomputer na biurku? Karta graficzna: GeForce 285 (używana w pokoju 521 w IFT ) 240 procesory CUDA 1.06 TFLOPS mocy obliczeniowej (teoretycznie) Cena: 670zł

Rachunek wydaje się prosty.. 1.38x więcej mocy za 0.134% ceny (+ energia + pomieszczenia + chłodzenie etc.) Zasada zachowania trudności, czyli coś za coś Kartę trzeba jeszcze oprogramować!

GPGPU GPGPU General-purpose computing on graphics processing units

Gdzie umiejscowić GPGPU? SISD Single Instruction Single Data SIMD Single Instruction Multiple Data (MSIMD?) SPMD Single Process Multiple Data MISD Multiple Instruction Single Data MIMD - Multiple Instruction Multiple Data ( http://perilsofparallel.blogspot.com/2008/09/larrabee-vs-nvidia-mimd-vs-simd.html )

Na jakiej platformie programować GPU? Niskopoziomowe API Vertex i Pixel Shaders (OpenGL) Direct Compute (DirectX) CUDA driver API C runtime for CUDA OpenCL Kompilatory PGI OpenACC API wysokiego poziomu

C runtime for CUDA Co to jest CUDA? Compute Unified Device Architecture Platforma programowania GPU (dla kart nvidii) Rozszerzenie języka C (działa również z C++) kompilator (nvcc) zbiór dyrektyw kompilatora i dodatkowych funkcji Np. słowa kluczowe: device, host wyróżniające rodzaj sprzętu na którym implementowana jest funkcja lub dana Np. funkcja: cudamemcpy( ) (kopiowanie pamięci CPU <-> GPU)

CUDA pod Windows Microsoft Visual C++ (2008, 2010) można użyć darmowej wersji Express Sterownik (ze strony Parallel NSIGHT): CUDA Toolkit CUDA SDK nvidia Parallel NSIGHT HOST/MONITOR

CUDA pod LINUX-em Inaczej niż pod Windows nie używamy Parallel Nsight Sterowniki nvidia-current (repozytoria) Cuda Toolkit (biblioteki, pliki nagłówkowe,.so) Po zainstalowaniu kompilacja (plik program.cu): > nvcc program.cu >./a.out

Hello World Pierwszy prosty program w CUDA 1. CPU wywołuje funkcję na GPU Funkcja wstawia do pamięci GPU ciąg Hello world! 2. Kopiujemy dane z GPU do pamięci CPU 3. Dane wypisujemy przy pomocy funkcji i/o (cout etc.)

Hello World Pierwszy prosty program w CUDA 1. CPU wywołuje funkcję na GPU Funkcja wstawia do pamięci GPU ciąg Hello world! 2. Kopiujemy dane z GPU do pamięci CPU 3. Dane wypisujemy przy pomocy funkcji i/o (cout etc.)

Hello World #include <stdio.h> #include <cuda.h> device char napis_device[14]; global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } int main(void) { helloworldondevice <<< 1, 1 >>> (); char napis_host[14]; const char *symbol="napis_device"; cudamemcpyfromsymbol (napis_host, symbol, sizeof(char)*13, 0, cudamemcpydevicetohost); printf("%s",napis_host); }

Hello World #include <stdio.h> #include <cuda.h> device char napis_device[14]; global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } int main(void) { helloworldondevice <<< 1, 1 >>> (); char napis_host[14]; const char *symbol="napis_device"; cudamemcpyfromsymbol (napis_host, symbol, sizeof(char)*13, 0, cudamemcpydevicetohost); printf("%s",napis_host); }

Hello World #include <stdio.h> #include <cuda.h> device char napis_device[14]; global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } int main(void) { helloworldondevice <<< 1, 1 >>> (); char napis_host[14]; const char *symbol="napis_device"; cudamemcpyfromsymbol (napis_host, symbol, sizeof(char)*13, 0, cudamemcpydevicetohost); printf("%s",napis_host); }

Hello World #include <stdio.h> #include <cuda.h> device char napis_device[14]; global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } int main(void) { helloworldondevice <<< 1, 1 >>> (); char napis_host[14]; const char *symbol="napis_device"; cudamemcpyfromsymbol (napis_host, symbol, sizeof(char)*13, 0, cudamemcpydevicetohost); printf("%s",napis_host); }

Hello World #include <stdio.h> #include <cuda.h> device char napis_device[14]; global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } int main(void) { helloworldondevice <<< 1, 1 >>> (); char napis_host[14]; const char *symbol="napis_device"; cudamemcpyfromsymbol (napis_host, symbol, sizeof(char)*13, 0, cudamemcpydevicetohost); printf("%s",napis_host); }

Hello World #include <stdio.h> #include <cuda.h> device char napis_device[14]; global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } int main(void) { helloworldondevice <<< 1, 1 >>> (); char napis_host[14]; const char *symbol="napis_device"; cudamemcpyfromsymbol (napis_host, symbol, sizeof(char)*13, 0, cudamemcpydevicetohost); printf("%s",napis_host); }

Deklaracja funkcji na GPU Funkcja uruchamiana na GPU to kernel (jądro) Zmienne na GPU przedrostek device Preambuła jądra - przedrostek global char napis_device[14]; device char napis_device[14]; void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } global void helloworldondevice(void) { napis_device[0] = 'H'; napis_device[1] = 'e'; napis_device[11] = '!'; napis_device[12] = '\n'; napis_device[13] = 0; } CPU GPU

Wywołanie funkcji na GPU Wywołanie funkcji GPU: funkcja <<< numblocks, threadsperblock >>> ( parametry ); numblocks liczba bloków w macierzy wątków threadsperblock liczba wątków na blok W naszym przykładzie <<<1,1>>> oznaczało uruchomienie jądra na jednym wątku który zawierał się w jednym jedynym bloku macierzy wątków.

numblocks, threadsperblock <<< 1, 1 >>> <<<4,1>>> <<< 1, 4 >>> <<< dim3(3,2,1), 4 >>>

A tak to widzi nvidia CUDA Programming Guide 3.2 <<< dim3(3,2,1), dim3(4,3,1) >>>

Hello World wielowątkowo 1. CPU wywołuje funkcję na GPU Funkcja wstawia do pamięci GPU ciąg Hello world! jedna litera na jeden wątek! (pomoc: P. Czubiński)

Hello World wielowątkowo jedna litera na jeden wątek stwórzmy 14 bloków po 1 wątku Każdy wątek widzi swój numer i numer bloku Numer bloku -> miejsce w tablicy do skopiowania

Hello World wielowątkowo Jądro dla hello world w wersji wielowątkowej: constant device char hw[] = "Hello World!\n"; device char napis_device[14]; global void helloworldondevice(void) { int idx = blockidx.x; napis_device[idx] = hw[idx]; } idxhelloworldondevice <<< 14, 1 >>> (); zawiera numer bloku w którym znajduje się wątek mapowanie blok/wątek -> fragment problemu wątek z idx-ego bloku kopiuje idx-ą literę napisu Kopiowanie GPU-GPU (bez sensu, ale chodzi nam o najprostszy problem)

Hello World wielowątkowo Jądro dla hello world w wersji wielowątkowej: constant device char hw[] = "Hello World!\n"; device char napis_device[14]; global void helloworldondevice(void) { int idx = blockidx.x; napis_device[idx] = hw[idx]; } idxhelloworldondevice <<< 14, 1 >>> (); zawiera numer bloku w którym znajduje się wątek mapowanie blok/wątek -> fragment problemu wątek z idx-ego bloku kopiuje idx-ą literę napisu Kopiowanie GPU-GPU (bez sensu, ale chodzi nam o najprostszy problem)

Hello World wielowątkowo Jądro dla hello world w wersji wielowątkowej: constant device char hw[] = "Hello World!\n"; device char napis_device[14]; global void helloworldondevice(void) { int idx = blockidx.x; napis_device[idx] = hw[idx]; } idxhelloworldondevice <<< 14, 1 >>> (); zawiera numer bloku w którym znajduje się wątek mapowanie blok/wątek -> fragment problemu wątek z idx-ego bloku kopiuje idx-ą literę napisu Kopiowanie GPU-GPU (bez sensu, ale chodzi nam o najprostszy problem)

Hello World wielowątkowo Jądro dla hello world w wersji wielowątkowej: constant device char hw[] = "Hello World!\n"; device char napis_device[14]; global void helloworldondevice(void) { int idx = blockidx.x; napis_device[idx] = hw[idx]; } idxhelloworldondevice <<< 14, 1 >>> (); zawiera numer bloku w którym znajduje się wątek mapowanie blok/wątek -> fragment problemu wątek z idx-ego bloku kopiuje idx-ą literę napisu Kopiowanie GPU-GPU (bez sensu, ale chodzi nam o najprostszy problem)

W praktyce

Modele ośrodków porowatych P=0.4 P=0.7 Ogromne układy (miliony komórek obliczeniowych).

Przykład rozwiązania P=0.4, T=1.7 P=0.7, T=1.28

Model gazu sieciowego LGA Uproszczenie: model gazu sieciowego opisany przez U. Frisha, B. Hasslachera i Y. Pomeau gaz FHP 1) Transport 2) Kolizje Rys. Kolizje w modelu FHP5 U. Frish, B. Hasslacher, Y. Pomeau 1986 Lattice-Gas Automata for the Navier-Stokes Equation, Phys. Rev. Lett. 56, 1505 1508. Matyka, M. and Koza, Z., Spreading of a density front in the Kuentz-Lavallee model of porous media J. Phys. D: Appl. Phys. 40, 4078-4083 (2007)

Metoda gazu sieciowego Boltzmanna Historycznie wprowadzona jako rozwinięcie LGA Zmienne ni (0,1) zastąpione funkcją rozkładu

Podstawowy Algorytm LBM Podstawowy algorytm LBM to dwa kroki: kolizji: transportu: Lokalność!

Przykład działania LBM na CUDA 512 x 512 CPU stoi. GPU w tym czasie.. (przykład cpu, gpu)

Hydrodynamika cząstek rozmytych 1. Lagrangian Fluid Dynamics, Using Smoothed Particle Hydrodynamics, Micky Kelager, 2006 2. http://pl.wikipedia.org/wiki/sph) Podejście Lagrange a (ruchome punkty) Każda cząstka reprezentuje pewną objętość cieczy Wielkości fizyczne interpolowane po sąsiadach Gdzie Wij jest tytułowym rozmyciem np.

Rys. Algorytm SPH na CUDA (GTX285). (w działaniu)

Rys. Skalowanie algorytmów LBM i SPH na karcie GTX 285 względem jednego rdzenia CPU.

Łyżka dziegciu

Analiza wydajności CPU / GPU Przypadek testowy: driven cavity 3d Porównanie czasów określonej liczby iteracji Kody: Palabos (MPI) i Sailfish (CUDA) Rys: Wizualizacja przepływu przez trójwymiarową komorę wyznaczonego kodem Sailfish dla liczby Reynoldsa Re=100. Matyka, M., Miroslaw, Ł., Koza,Z., Wydajność otwartych implementacji metody sieciowej Boltzmanna na CPU i GPU, (KOWBAN) XVIII (2011)

Wydajność Sailfish / Palabos Czas wykonania 30000 kroków na 4xCPU i GPU (Gtx460 i Tesla). Matyka, M., Miroslaw, Ł., Koza,Z., Wydajność otwartych implementacji metody sieciowej Boltzmanna na CPU i GPU, (KOWBAN) XVIII (2011)

Przyszłość? Niskopoziomowe API Vertex i Pixel Shaders (OpenGL) Direct Compute (DirectX) CUDA driver API C runtime for CUDA OpenCL Kompilatory PGI OpenACC API wysokiego poziomu

Czym się zajmujemy? Grant MNiSW Grant N N519 437939 Przepływ płynu (LBM) w ośrodkach porowatych na GPU Projekt Zielony Transfer (Vratis Sp. z o.o.) akceleracja CFD metod FVM na GPU 2011 Akceleracja obliczeń macierzowych (z Z. Kozą, J. Połą) na GPU Wizualizacja przepływów 3D w ośrodkach porowatych z użyciem OpenCL (multi GPU) http://people.brunel.ac.uk/bst/vol1201/re beccaclunn/home.html

Dziękuję za uwagę