CUDA tutorial/fr: Difference between revisions

CUDA tutorial/fr (view source)

Revision as of 20:29, 1 March 2018

827 bytes removed , 6 years ago

no edit summary

Cgeroux

cc_staff

1,486

edits

@@ Line 144: / Line 144: @@
 La tâche est maintenant distribuée sur des fils parallèles plutôt que sur des blocs. Quel est l'avantage des fils parallèles? Contrairement aux blocs, les fils peuvent communiquer ensemble; autrement dit, nous parallélisons sur plusieurs fils dans le bloc quand la communication est intense. Les portions de code qui peuvent être exécutées indépendamment, soit avec peu ou pas de communication, sont distribuées sur des blocs parallèles.
-<div class="mw-translate-fuzzy">
 = Avantages de la mémoire partagée=
 Jusqu'ici, tous les transferts en mémoire dans le ''kernel'' ont été via la mémoire régulière (globale) du GPU, ce qui est relativement lent. Il y a souvent tellement de communication entre fils que la performance est significativement diminuée.   Pour contrer ce problème, nous pouvons utiliser la mémoire partagée qui peut accélérer les transferts en mémoire entre les fils. Le secret par contre est que seuls les fils du même bloc peuvent communiquer. Pour illustrer l'utilisation de cette mémoire, voyons l'exemple du produit scalaire où deux vecteurs sont multipliés élément par élément et additionnés par la suite, ainsi :
- <syntaxhighlight lang="cpp" line highlight="1,5">
-__global__   void dot(int *a, int *b, int *c){
-        int temp = a[threadIdx.x]*b[threadIdx.x];
-}
-</syntaxhighlight>
-Après que chaque fil a exécuté sa portion, il faut tout additionner; chaque fils doit partager ses données. Toutefois, le problème est que chaque copie de la variable temporaire du fil est privée. La solution est d'utiliser la mémoire partagée avec les modifications suivantes au ''kernel'' :
-<syntaxhighlight lang="cpp" line highlight="1,4">
-#define N 512
-__global__   void dot(int *a, int *b, int *c){
-   __shared__ int temp[N];
-   temp[threadIdx.x] = a[threadIdx.x]*b[threadIdx.x];
-   __syncthreads();
-   if(threadIdx.x==0){
-	int sum; for(int i=0;i<N;i++) sum+= temp[i];
-	*c=sum; }
-}
-</syntaxhighlight>
-</div>
 <syntaxhighlight lang="cpp" line highlight="1,5">
 __global__   void dot(int *a, int *b, int *c){

CUDA tutorial/fr: Difference between revisions

CUDA tutorial/fr (view source)

Revision as of 20:29, 1 March 2018

Navigation menu

Search