Note : Ceci est une note de recherche complétant le livre L’ère de la post-pénurie, désormais disponible à l’achat. Ces notes approfondissent les concepts du texte principal. Commencez ici ou procurez-vous le livre.
Grappes de calcul : les usines de l’ère de l’intelligence
Comment les installations d’entraînement de l’IA sont devenues les raffineries de pétrole du XXIe siècle, et pourquoi vos petits-enfants pourraient recevoir une allocation de calcul en même temps que leur acte de naissance.
Qu’est-ce qu’une grappe de calcul, vraiment ?
« Grappe de calcul » : l’expression sonne très technique, mais elle recouvre quelque chose de simple. Une grappe de calcul, c’est tout bonnement un grand nombre d’ordinateurs qui travaillent ensemble sur le même problème. La magie tient dans le « ensemble ».
Quand vous entraînez un grand modèle de langage comme GPT-4 ou Llama 4, la tâche est bien trop lourde pour un seul ordinateur, même d’une puissance obscène. Il faut répartir le travail entre des milliers de processeurs qui communiquent en permanence, partagent leurs résultats et coordonnent leurs efforts. Si une machine calcule quelque chose, toutes les autres doivent le savoir immédiatement. Le délai entre elles se mesure en microsecondes, pas en secondes. Ces grappes ne sont que la première étape d’un trajet plus long : quand l’intelligence devient bon marché, la valeur ne disparaît pas, elle migre vers la couche qui reste rare, et pour l’instant cette couche, c’est le calcul lui-même.
La construction d’une pyramide offre une bonne analogie. Une personne seule avec une brouette y passerait des millénaires. Mille personnes doivent se coordonner : qui porte quoi, où va le prochain bloc, ne lâchez pas ça sur Steve. Une grappe de calcul, c’est ce problème de coordination, résolu à la vitesse de la lumière.
Les processeurs qui font ce travail sont des processeurs graphiques (GPU), conçus à l’origine pour afficher les images des jeux vidéo, puis réaffectés à l’IA parce qu’ils excellent à mener de front une multitude de calculs simples. Si un CPU classique est un chirurgien brillant qui enchaîne les opérations délicates une par une, un GPU est un atelier où des milliers d’ouvriers exécutent chacun, très vite, une petite tâche.
L’état actuel des lieux : bienvenue dans la course aux armements GPU
En 2024-2025, nous avons changé de territoire. Les grappes de calcul qui entraînent les modèles d’IA de pointe ont atteint une échelle proprement stupéfiante :
Colossus : de 100 000 GPU au gigawatt à louer
La société d’IA d’Elon Musk, xAI, a construit ce qui fut brièvement le plus grand superordinateur d’IA au monde dans une ancienne usine Electrolux reconvertie à Memphis, dans le Tennessee. Le calendrier était absurde : 122 jours entre la décision et la mise en service, quand des projets comparables prennent d’ordinaire des années. En septembre 2024, il faisait tourner 100 000 GPU Nvidia H100.
Puis ils l’ont doublé, en 92 jours, et ils ont continué.
Colossus 2 est sorti de terre plus vite encore : une première grappe d’environ 110 000 processeurs GB200 et 210 mégawatts en 91 jours, puis une seconde de 110 000 GB300 et 220 mégawatts en 64 jours, selon le prospectus d’introduction en bourse de SpaceX, qui a fusionné avec xAI en février 2026. Lors de sa première présentation de résultats, le 4 août, SpaceX a indiqué avoir terminé juin avec 1,4 gigawatt de puissance de calcul nominale, contre 400 mégawatts un an plus tôt, et en attendre plus de 2 gigawatts d’ici la fin de l’année.
Le nombre de puces que cela représente dépend de celui qui compte. En septembre 2026, Musk a publié sur X un décompte qui totalise 230 000 GPU pour Colossus 1 et 550 000 pour Colossus 2, avec jusqu’à 660 000 de plus promis d’ici fin décembre, le dernier tiers seulement « si nous avons de la chance ». Epoch AI, qui estime les capacités de façon indépendante à partir d’images satellite, attribue 440 000 puces et 946 mégawatts de puissance informatique à Colossus 2, sur la base d’images dont les plus récentes datent de juin, et en fait le plus grand centre de données d’IA connu au monde par la puissance informatique. Trois autres centres de données sont prévus à proximité, dont l’un a été surnommé « Macrohardrr ».
Puis vint le coup de théâtre : la forteresse est devenue un bien locatif. SpaceX est entrée en bourse le 12 juin 2026 à 1 770 milliards de dollars, la plus grosse introduction jamais réalisée, et ses documents boursiers ont révélé que les plus gros utilisateurs de Colossus sont les concurrents de xAI. Anthropic paie 1,25 milliard de dollars par mois jusqu’en mai 2029 pour environ 325 000 GPU répartis sur les deux sites (les premières informations parlaient d’une location du seul Colossus 1). Google paie 920 millions de dollars par mois d’octobre 2026 à juin 2029 pour environ 110 000 GPU, ce qu’un porte-parole de Google Cloud a décrit comme une « capacité relais ». Reflection AI a signé pour 150 millions de dollars par mois, et en septembre le directeur financier de SpaceX a révélé l’existence d’un quatrième client, non nommé, à environ 1,11 milliard de dollars par mois à compter du 1er décembre. Quand les quatre paieront, cela fera 3,43 milliards de dollars par mois, soit environ 41 milliards par an, dont l’essentiel vient d’entreprises que SpaceX désigne comme ses concurrentes, et les trois contrats divulgués peuvent chacun être résiliés avec un préavis de 90 jours. Les bâtisseurs deviennent propriétaires, et les locataires sont des géants.
Ce n’est pas un projet de R&D. C’est de la production d’intelligence industrialisée, à une échelle qui n’existait pas il y a deux ans, et elle puise dans un bien commun. Colossus 2 est alimenté par des turbines à gaz installées de l’autre côté de la frontière de l’État, dans le Mississippi. Après une plainte de la NAACP fondée sur le Clean Air Act, SpaceX s’est engagée auprès des régulateurs de l’État à retirer ses 69 turbines temporaires d’ici juillet 2027 et à les remplacer par une centrale permanente de 1,2 gigawatt. Memphis envisage un moratoire de 12 mois sur les nouveaux centres de données, l’un des nombreux vetos locaux opposés au déploiement de l’IA : le conseil municipal l’a adopté en première lecture en août, l’a retiré de l’ordre du jour du 15 septembre, et y reviendra le 6 octobre. Les électrons qui alimentent une grappe d’entraînement privée sont des électrons qui n’alimentent pas les foyers, les hôpitaux et les écoles.
L’infrastructure de Meta : des millions de GPU
Meta a donné le coup d’envoi du boom de l’IA en accumulant 350 000 GPU H100 à la fin de 2024. Ce n’était qu’un début. Début 2026, Meta et Nvidia ont annoncé un partenariat pluriannuel portant sur des « millions » de GPU Blackwell et, bientôt, Rubin, l’un des plus gros engagements d’infrastructure de l’histoire des semi-conducteurs. Une semaine plus tard, Meta concluait un accord distinct avec AMD pour un volume de GPU pouvant atteindre 6 gigawatts. L’entreprise a depuis relevé sa prévision de dépenses d’investissement pour 2026 à 130 à 145 milliards de dollars, soit environ le double des 72,2 milliards dépensés en 2025. Meta construit aussi Hyperion, un campus d’IA en Louisiane qu’elle prévoit de porter à 5 gigawatts de capacité de calcul, alimenté par dix centrales à gaz totalisant 7,5 gigawatts de capacité, dont sept attendent encore un vote des régulateurs. Et le 1er juillet 2026, Bloomberg a rapporté que Meta monte une activité cloud pour vendre sa capacité d’IA excédentaire, baptisée Meta Compute selon l’agence, qui proposerait à la fois des cycles GPU bruts et un accès hébergé à ses modèles, en concurrence directe avec AWS, Azure et Google Cloud. Verdict de Wall Street : l’action a bondi d’environ 10 % en une journée.
Quatre semaines plus tard, le marché a valorisé la même stratégie en sens inverse. Les résultats du deuxième trimestre de Meta, publiés le 29 juillet 2026, ont fait apparaître 31,1 milliards de dollars dépensés en centres de données, serveurs et puces en un seul trimestre, en hausse de 83 % sur un an, face à 31,9 milliards de flux de trésorerie d’exploitation. Le flux de trésorerie disponible est ressorti à 784 millions de dollars, contre 8,55 milliards au même trimestre un an plus tôt, et l’action a perdu jusqu’à 10 % après la clôture. Lors de la conférence téléphonique, Zuckerberg a déclaré que Meta reçoit « beaucoup d’offres pour du calcul, avec une prime significative par rapport à ce que nous l’avons payé ». Il n’a pas exclu de les accepter, mais a jugé qu’« il serait insensé de vendre, en gros, tout le calcul et d’empocher un profit à court terme » quand l’intelligence bâtie dessus en vaut un multiple. Arrêtez-vous sur ce que cette prime implique. Des acheteurs paieront plus que le prix coûtant pour la capacité déjà raccordée de quelqu’un d’autre, parce qu’une commande de puces se règle en quelques mois alors qu’un raccordement au réseau à l’échelle du gigawatt prend des années. L’argent peut acheter du silicium. Il ne peut pas acheter une place dans la file d’attente.
Leur modèle Llama 3 s’est entraîné sur une grappe de 16 384 H100 pendant 54 jours, au cours desquels ils ont subi 148 interruptions dues à des GPU défectueux et 72 à des défaillances de mémoire. C’est de l’ingénierie aérospatiale où l’on remplace les moteurs en plein vol.
La vision zettascale d’Oracle
En septembre 2024, Oracle a commencé à prendre des commandes pour ce qu’il appelait le premier superordinateur d’IA « zettascale » : jusqu’à 131 072 GPU dans une seule grappe, plus de trois fois le nombre de GPU du superordinateur Frontier d’Oak Ridge. Deux ans plus tard, ce plafond paraît modeste : Oracle dit avoir livré plus de 300 000 GPU à ses clients IA en un seul trimestre.
Le projet Stargate : 500 milliards de dollars face à la réalité
Annoncé en janvier 2025 lors d’une conférence de presse à la Maison-Blanche, le projet Stargate est peut-être le chantier d’infrastructure d’IA le plus ambitieux jamais conçu. SoftBank, OpenAI, Oracle et MGX ont promis jusqu’à 500 milliards de dollars sur quatre ans, dont 100 milliards déployés immédiatement.
Fin 2026, la réalité s’est imposée. Le site phare d’Abilene, au Texas, a connu des déboires, dont un épisode météorologique violent qui, selon les mots de Sam Altman, a temporairement « tout mis à l’arrêt ». Le site livre pourtant. Oracle a indiqué aux investisseurs en septembre y avoir remis 131 000 GPU en un trimestre et avoir livré six des huit bâtiments du campus, soit 618 mégawatts. (L’estimation par satellite d’Epoch AI est plus basse : 421 mégawatts de puissance informatique.) Microsoft a pris deux bâtiments supplémentaires juste à côté, ce qui porte le complexe à dix bâtiments et environ 2,1 gigawatts de capacité projetée.
La carte continue de s’étendre. OpenAI, qui en mars ne possédait aucun centre de données, a annoncé en juillet qu’elle conçoit et développe le sien dans le comté d’Effingham, en Géorgie, avec 3,2 gigawatts d’électricité livrés par étapes entre 2028 et 2032. En août, Nvidia a accepté de garantir jusqu’à 105 milliards de dollars d’obligations locatives sur un campus d’OpenAI dans l’Ohio, soit environ 4,25 gigawatts sous des baux de 20 ans. Le fournisseur de puces se porte caution du loyer de son client : voilà à quoi ressemble le calcul comme collatéral.
La liste de ce qui peut l’arrêter s’allonge aussi. Oracle a envoyé un avis de force majeure au promoteur de Project Jupiter, un campus Stargate de 2,45 gigawatts au Nouveau-Mexique, qui lui permettrait de différer ses paiements si le site manque son échéance de 2028 ; Oracle assure que le projet « reste sur notre calendrier prévu ». Au Texas, le gouverneur Greg Abbott a ordonné à l’agence environnementale de l’État, le 21 septembre, de suspendre tous les permis liés aux projets de centres de données jusqu’à ce que le gestionnaire du réseau ait terminé son examen.
Ce qu’il y a à l’intérieur de ces grappes : le matériel
Le cheval de bataille : Nvidia H100
Le Nvidia H100 (nom de code « Hopper ») est la puce qui a défini le boom de l’IA de 2023-2024, et elle reste largement déployée. Ses principales caractéristiques :
- 80 Go de mémoire HBM3 (le type de mémoire le plus rapide au moment du lancement)
- 3,35 téraoctets par seconde de bande passante mémoire (la vitesse à laquelle les données circulent)
- 4 pétaflops de calcul IA (un pétaflop, c’est un million de milliards de calculs par seconde)
- ~25 000-40 000 $ par puce à l’état neuf
Le H100 a été réellement rare en 2023-2024, les entreprises d’IA l’entassant comme des lingots d’or. Les prix de location ont baissé depuis, mais la vieille puce refuse de se déprécier au rythme prévu. L’indice de Silicon Data affiche 2,53 $ par heure-GPU ; celui d’Ornn indiquait 3,28 $ le 7 septembre 2026, en hausse de 22 % en un mois.
Blackwell : la génération actuelle
L’architecture Blackwell de Nvidia a été livrée en masse tout au long de 2025 et a porté Nvidia à un chiffre d’affaires record de 215,9 milliards de dollars sur l’exercice 2026. Au trimestre clos le 26 juillet 2026, Nvidia a publié un chiffre d’affaires de 96,2 milliards de dollars, en hausse de 106 % sur un an. Le GPU B200 représente un saut de génération par rapport à Hopper :
- 192 Go de mémoire HBM3e (2,4 fois le H100)
- 8 téraoctets par seconde de bande passante (2,4 fois le H100)
- 20 pétaflops de calcul IA (5 fois le H100)
- ~30 000-40 000 $ par puce
Le système GB200 NVL72 relie 72 GPU Blackwell pour qu’ils se comportent comme un seul processeur géant, avec 1,4 exaflop de performance IA. Soit 1,4 milliard de milliards de calculs par seconde. Pour donner un ordre de grandeur, on estime que le cerveau humain effectue environ un exaflop : cette baie de GPU égale donc 1,4 cerveau humain en débit de calcul brut.
La prochaine vague : Vera Rubin
Vera Rubin, le successeur de Blackwell, est livré en production depuis août 2026, et Nvidia s’attend à ce qu’il représente environ 20 % de son chiffre d’affaires dans les centres de données au trimestre suivant. La baie Vera Rubin NVL72 relie 72 GPU Rubin à 36 CPU Vera au moyen de commutateurs NVLink 6. Nvidia revendique un débit par mégawatt 30 fois supérieur et un coût par token 35 fois inférieur à ceux de Grace Blackwell Ultra. Lors de la GTC de mars 2026, Jensen Huang a dit s’attendre à ce que les commandes de Blackwell et de Vera Rubin atteignent 1 000 milliards de dollars d’ici fin 2027, le double des 500 milliards que l’entreprise projetait un an plus tôt. Nvidia s’attend à ce que l’offre « reste un goulot d’étranglement au moins jusqu’à la fin de l’exercice 2028 ». L’architecture qui succédera à Rubin, nom de code Feynman, est déjà en développement et vise le procédé A16 de TSMC.
Le réseau : NVLink et InfiniBand
La puissance brute des GPU ne sert à rien si les puces ne peuvent pas se parler assez vite.
NVLink est l’interconnexion propriétaire de Nvidia pour la communication de GPU à GPU au sein d’un même serveur ou d’une même baie :
- 1,8 téraoctet par seconde de bande passante bidirectionnelle (dans sa dernière version)
- 7 fois plus rapide que le PCIe Gen 5 (la connexion standard des ordinateurs)
- Permet aux GPU de partager directement leur mémoire, comme s’ils ne formaient qu’une seule puce
InfiniBand relie les serveurs à travers le centre de données :
- 400-800 Gb/s par port (le Quantum-X800 InfiniBand est désormais livré)
- Moins de 100 nanosecondes de latence (une nanoseconde est un milliardième de seconde)
- Capacité RDMA (Remote Direct Memory Access : les GPU peuvent lire la mémoire les uns des autres sans passer par le CPU)
L’architecture type : NVLink relie les GPU au sein d’un nœud, InfiniBand relie les nœuds à travers la grappe. Ensemble, ils font fonctionner des milliers de GPU comme un seul processeur géant.
Le problème de l’énergie : ces choses ont faim
Le déploiement des grappes de calcul se heurte à la réalité physique : ces installations consomment des quantités obscènes d’électricité.
Selon l’Agence internationale de l’énergie :
- La consommation mondiale d’électricité des centres de données était d’environ 415 TWh en 2024 (~1,5 % de l’électricité mondiale)
- La consommation des centres de données américains devrait augmenter d’environ 240 TWh d’ici 2030, soit 130 % de plus qu’en 2024
- La mise à jour 2026 de l’agence situe 2025 à 485 TWh, en hausse de 17 % en une seule année, et projette environ 950 TWh en 2030, soit autour de 3 % de la demande mondiale d’électricité
L’IA consomme à elle seule 10 à 20 % de l’énergie actuelle des centres de données, mais cette part augmente vite et pourrait atteindre 35 à 50 % d’ici 2030. La demande d’électricité des centres de données croît d’environ 15 % par an, plus de quatre fois plus vite que celle de tous les autres secteurs réunis.
SpaceX construit sa propre centrale à gaz de 1,2 gigawatt pour Colossus. Le campus Hyperion de Meta, en Louisiane, est conçu autour de 7,5 GW d’électricité au gaz, qui ajouteraient plus de 30 % à la capacité totale du réseau de l’État.
Le rapport environnemental de Google, publié le 2 juillet 2026, montre ce que cela donne au compteur d’une seule entreprise : une consommation d’électricité en hausse de 37 % en 2025, la plus forte progression annuelle de son histoire, dont 42 millions de MWh pour les seuls centres de données. C’est une entreprise qui tire à peu près la consommation annuelle d’un pays de taille moyenne. La raison que Google avance pour s’attendre à voir la courbe se raidir est la phrase que les planificateurs devraient lire deux fois : le déploiement s’accélère plus vite que le réseau ne se décarbone.
C’est plus qu’un problème d’ingénierie. C’est une contrainte de civilisation.
La connexion à la fusion
L’obsession de l’industrie technologique pour l’énergie de fusion repose sur de l’arithmétique, pas sur de la communication. Quand vous prévoyez d’exploiter des centres de données qui consomment chacun des gigawatts, il vous faut des sources d’énergie capables de changer d’échelle.
Microsoft a signé un accord avec Helion pour 50 mégawatts d’électricité de fusion, fournis par une centrale censée entrer en service d’ici fin 2028. Helion a lancé le chantier en 2025 et a depuis assoupli ce que 2028 veut dire : son site internet ne promet plus que des « opérations initiales », et un cadre de l’entreprise a déclaré lors d’une conférence sur la fusion : « Dans aucun univers nous n’aurons 50 mégawatts en pleine exploitation en 2028. » L’accord qu’OpenAI négocierait de son côté avec Helion, évoqué en mars 2026 pour 5 GW d’ici 2030 et 50 GW d’ici 2035, reste une négociation ; Helion indique qu’elle « n’a annoncé aucun nouveau contrat client ». Google a signé un contrat d’achat de 200 MW d’électricité de fusion avec Commonwealth Fusion Systems, qui a levé 4 milliards de dollars au total et vise un premier plasma pour sa machine SPARC en 2027. La Fusion Industry Association recense 14,24 milliards de dollars levés par les entreprises de fusion depuis 2021 ; un décompte européen atteignait déjà 15 milliards en septembre 2025.
Le calendrier est agressif mais pas arbitraire. L’infrastructure actuelle du réseau ne peut tout simplement pas absorber le déploiement prévu de centres de données d’IA. Quelque chose doit céder. Soit le développement de l’IA ralentit, soit nous trouvons de nouvelles sources d’énergie.
C’est la composante « carburant » du trépied de la Post-Pénurie (Le Cerveau, Le Corps, Le Carburant). La fusion et l’IA sont des nécessités symbiotiques, et pas de simples technologies voisines.
L’investissement des hyperscalers : des centaines de milliards
Les capitaux qui affluent vers l’infrastructure d’IA n’ont pas de précédent historique :
| Entreprise | Prévisions 2026 : précédente → dernière | Priorité |
|---|---|---|
| Amazon (AWS) | ~200 Md$ → ~220 Md$ | Infrastructure cloud d’IA |
| 180-190 Md$ → 195-205 Md$ | Cloud, entraînement de Gemini | |
| Meta | 125-145 Md$ → 130-145 Md$ | Entraînement de Llama, IA sociale |
| Microsoft | ~190 Md$ → ~175 Md$ (changement comptable sur les baux) | Azure, OpenAI/Stargate |
| Oracle | 55,7 Md$ dépensés sur l’exercice 2026 → 90-95 Md$ prévus pour l’exercice 2027 | Sites Stargate, cloud d’IA |
En août 2026, la directrice financière de Nvidia a indiqué aux investisseurs que les dépenses d’investissement des cinq premiers hyperscalers devraient atteindre près de 800 milliards de dollars en 2026 et 1 300 milliards en 2027. Un mois plus tard, les stratèges de Goldman Sachs chiffraient 2027 à 1 200 milliards et estimaient que les cinq auraient besoin d’environ 300 milliards de dollars de revenus annuels tirés de l’IA pour atteindre le seuil de rentabilité. D’ici 2030, les dépenses d’investissement cumulées dans les centres de données d’IA devraient dépasser 5 200 milliards de dollars.
Ces chiffres sont difficiles à mettre en perspective. L’ensemble du programme Apollo a coûté environ 280 milliards de dollars en dollars d’aujourd’hui. Les dépenses d’infrastructure d’IA de 2026 représentent à elles seules près de trois fois ce montant.
La géopolitique : le calcul est le nouveau pétrole
Sam Altman a qualifié le calcul de « monnaie du futur », « peut-être la marchandise la plus précieuse au monde ». Jonathan Ross, de Groq, lui fait écho : « Le calcul est le nouveau pétrole. »
La formule n’a rien d’une hyperbole. La concentration est stupéfiante :
- Les États-Unis contrôlent ~75 % de la capacité mondiale de supercalcul d’IA
- La Chine en détient ~15 % (en baisse, du fait du durcissement des restrictions à l’exportation)
- Nvidia détient ~85 % du marché des GPU dans son ensemble, et plus de 80 % des puces d’entraînement d’IA (en léger recul par rapport aux 92 % de début 2025, AMD atteignant ~7 %)
- TSMC fabrique ~90 % des puces avancées du monde, et a relevé en juillet 2026 son budget d’investissement pour l’année à 60-64 milliards de dollars
Le conflit sino-américain sur les semi-conducteurs est, de fait, une guerre pour les moyens de production de l’intelligence. Le CHIPS and Science Act a alloué plus de 52 milliards de dollars pour encourager la fabrication de puces sur le sol américain. TSMC a annoncé un investissement supplémentaire de 100 milliards de dollars en Arizona en juillet 2026, ce qui, selon son président C.C. Wei, signifierait probablement quatre usines de plus. L’objectif explicite est de réduire la dépendance à l’égard de Taïwan, situé à 160 kilomètres de la Chine continentale.
Les contrôles à l’exportation ont fait de la Chine un producteur marginal de puces d’IA. Ils ont aussi fermé la Chine à Nvidia : le dernier rapport trimestriel de l’entreprise indique qu’elle a été « de fait exclue de la concurrence sur le marché chinois du calcul pour centres de données ». Les estimations de la part de Nvidia sur le marché chinois des accélérateurs d’IA en 2025 vont de 55 % à 40 % ; Bernstein prévoit 8 % pour 2026, et TrendForce s’attend à ce que les puces de fabrication chinoise prennent 90 % du marché intérieur. Le fondateur de DeepSeek, Liang Wenfeng, l’a dit sans détour : « L’argent n’a jamais été le problème pour nous ; le problème, ce sont les interdictions de livraison de puces avancées. »
Pourtant, la Chine riposte. SMIC continue de faire progresser la production nationale de puces. Le « Grand Fonds » de Pékin injecte des milliards dans le développement des semi-conducteurs. Un découplage technologique est en cours, qui crée deux écosystèmes d’IA de plus en plus incompatibles, l’américain et le chinois, en concurrence pour l’influence mondiale.
La question de Taïwan
La vérité qui dérange : si la Chine impose un blocus à Taïwan ou l’envahit, l’économie technologique mondiale s’effondre du jour au lendemain. Les armées modernes feraient face à une pénurie immédiate de semi-conducteurs. Chaque iPhone, chaque modèle d’IA, chaque système d’armes avancé dépend de puces qui viennent pour l’essentiel d’une seule petite île.
C’est pourquoi TSMC s’étend dans le monde entier : au Japon (avec des subventions du gouvernement japonais, et une usine de Kumamoto déjà en cours de passage du 6 nm au 3 nm), en Arizona (où iront les 100 milliards de dollars supplémentaires), en Allemagne. La diversification géographique est devenue un impératif de sécurité nationale, bien au-delà d’une stratégie d’entreprise ordinaire.
Terafab : posséder toute la pile
La logique de l’intégration verticale atteint son extrême avec Terafab. Annoncé en mars 2026 comme une collaboration entre SpaceX et Tesla, qu’Intel a rejointe en avril, c’est un projet de fabrication de puces dont l’objectif à long terme est de produire un térawatt de matériel de calcul par an. Le 6 août, les entreprises ont dévoilé le site et la mise de départ : le comté de Grimes, au Texas, et 16,8 milliards de dollars pour commencer, pour une usine de 100 millions de pieds carrés, soit plus de 9 millions de mètres carrés. (Un document déposé en mai évoquait 55 milliards de dollars au départ et 119 milliards si toutes les phases sont construites.) Les accords conclus avec l’État prévoient un début des travaux le 1er décembre et un achèvement d’ici fin 2028. L’objectif affiché : des puces pour les robots Optimus et les Cybercab de Tesla, et pour les centres de données spatiaux de SpaceX.
L’annonce de mars ne comportait ni calendrier ni prix ; les deux existent désormais. L’ambition reste la partie difficile. Construire une usine de semi-conducteurs de pointe compte parmi les entreprises industrielles les plus difficiles que l’humanité tente : TSMC a dépensé plus de 30 milliards de dollars pour ses usines d’Arizona, qui ne sont toujours pas pleinement opérationnelles, et l’ensemble de l’industrie mondiale des semi-conducteurs produit aujourd’hui des puces consommant environ 300 à 400 gigawatts en pointe. Une seule installation revendiquant un térawatt de production annuelle fournirait, en théorie, plus de capacité de calcul par an que le monde n’en utilise actuellement.
Que Terafab soit construit ou non selon le calendrier annoncé par Musk (son bilan : en retard, mais dans la bonne direction), c’est la structure qui compte. Un seul écosystème concevrait les puces, les fabriquerait, les installerait dans des voitures, des robots et des fusées, entraînerait de l’IA dessus et déploierait le résultat dans le monde physique, sans contrôle du Congrès sur les architectures, sans audit indépendant des modèles gravés dans le silicium, et sans examen public de la chaîne d’approvisionnement. Le calcul devient le nouveau pétrole, et Terafab est une tentative de posséder à la fois la raffinerie, l’oléoduc et les stations-service. Le problème plus profond de la concentration est traité dans À qui appartient la pile de l’abondance ?, Libertarianisme d’infrastructure et La Loi d’Airain de l’Oligarchie.
Pourquoi les puces individuelles n’importent pas (et pourquoi les grappes importent)
Un H100 isolé est impressionnant, mais inutile pour entraîner une IA de pointe. Les modèles sont tout simplement trop gros. GPT-4 compterait, dit-on, environ 1 700 milliards de paramètres. La plus grande version de Llama 3 en a 405 milliards. Chaque paramètre doit être stocké, mis à jour et communiqué.
Le calcul est le suivant :
- Un modèle de mille milliards de paramètres a besoin de ~2 téraoctets rien que pour stocker les poids en virgule flottante demi-précision
- Pendant l’entraînement, il faut aussi stocker les gradients et les états de l’optimiseur, soit environ 16 octets par paramètre
- Cela fait 16 téraoctets de mémoire pour un modèle de mille milliards de paramètres
- Un H100 dispose de 80 Go de mémoire
Il vous faut au minimum 200 H100 rien que pour contenir le modèle, plus des GPU supplémentaires pour le traitement par lots. En pratique, l’entraînement mobilise des milliers à des dizaines de milliers de GPU pendant des semaines ou des mois.
Voilà pourquoi les grappes comptent. La prouesse technologique centrale, c’est la capacité à coordonner des dizaines de milliers de processeurs sur un même entraînement, avec une latence de communication minimale, une bande passante maximale et une tolérance aux pannes fiable. Chaque puce est impressionnante en soi, mais c’est l’orchestre qui transforme le domaine.
La démocratisation à venir (peut-être)
C’est ici que la thèse de la Post-Pénurie devient concrète.
Aujourd’hui, l’entraînement d’IA de pointe est réservé à une douzaine d’organisations dans le monde : OpenAI, Anthropic, Google DeepMind, Meta, xAI, Mistral, une poignée de laboratoires chinois et quelques startups bien financées. Les besoins en capital (des milliards de dollars en GPU, en électricité et en talents d’ingénierie) créent des barrières naturelles.
Mais trois forces pourraient démocratiser l’accès :
1. L’inférence est moins chère que l’entraînement
Entraîner GPT-4 a demandé des mois sur une grappe massive. Faire de l’inférence (obtenir des réponses du modèle entraîné) coûte bien moins cher. Les fournisseurs de cloud proposent désormais un accès par API aux modèles de pointe pour quelques centimes par requête. La capacité devient de plus en plus accessible, alors même que les moyens de production restent concentrés.
2. Les modèles plus petits s’améliorent
Les techniques de distillation, des architectures efficaces et de meilleures données d’entraînement permettent à des modèles plus petits d’approcher les performances des plus grands. Le modèle Llama 3 à 8 milliards de paramètres surpasse GPT-3.5 (175 milliards de paramètres) sur de nombreux bancs d’essai. Le plancher monte.
3. Réseaux de calcul décentralisés
Des réseaux émergents comme Aethir agrègent la capacité GPU inutilisée à l’échelle mondiale. L’idée : si un million de personnes apportent chacune un peu de calcul, vous obtenez un superordinateur distribué. La technologie est balbutiante, et le concept est solide.
Connexion avec la vision de la Post-Pénurie : le Calcul de base universel
Cela nous amène au Calcul de base universel (UBC) : l’idée que chaque citoyen devrait recevoir une allocation garantie de capacité de traitement d’IA.
Si le calcul devient le moyen de production, l’équivalent moderne de la terre dans une économie agraire, alors distribuer le calcul revient à distribuer le pouvoir d’agir économique. Un citoyen doté d’une allocation de calcul peut :
- Faire tourner des agents d’IA personnels qui gèrent l’administration de sa vie
- Participer à des coopératives mutualisées pour des projets plus vastes
- Déléguer son allocation à des Guildes de Mission en échange de services
- Créer, chercher ou bâtir avec les mêmes outils que les grandes entreprises
La couche de La Fondation, dans le cadre de la Post-Pénurie, pourrait à terme fournir du calcul comme elle fournit le logement ou la nourriture : une infrastructure pour une existence digne, un socle plutôt qu’un luxe.
Rien de tout cela ne relève de la fantaisie. Les institutions de recherche allouent déjà des quotas de calcul. Des initiatives nationales de cloud en Arabie saoudite, aux Émirats arabes unis et à Singapour bâtissent une infrastructure d’IA souveraine. L’idée du « calcul comme service public » émerge dans les débats de politique publique.
Mais parvenir à l’UBC suppose :
- Un calcul total suffisant : c’est aujourd’hui une contrainte, mais Blackwell, Vera Rubin et les générations futures multiplient la capacité par 10 à chaque génération
- Une infrastructure de distribution : des plateformes cloud capables d’allouer et de mesurer le calcul équitablement
- Des interfaces accessibles : pour qu’« utiliser du calcul » devienne aussi intuitif qu’« utiliser de l’électricité »
- Des cadres de gouvernance : pour empêcher la concentration, la corruption et l’accaparement
Le mécanisme de la Garde de la Diversité traite la gouvernance. Le programme de Service Civique comprend une formation à l’orchestration d’IA. Le Protocole EXIT négocie une transition progressive avec les détenteurs actuels du pouvoir.
Ce qu’il faut surveiller
2026-2027
- Vera Rubin monte en puissance malgré un goulot d’étranglement de l’offre que Nvidia voit durer au moins jusqu’à la fin de son exercice 2028 ; l’architecture Feynman suit (2028)
- Le premier gigawatt de systèmes Nvidia de Stargate, visé pour le second semestre 2026, et la capacité de Project Jupiter, au Nouveau-Mexique, à tenir son échéance de 2028
- Les dépenses d’investissement des hyperscalers, près de 800 milliards de dollars en 2026, se dirigent vers 1 200 à 1 300 milliards en 2027
- Le marché des propriétaires du calcul arrive à maturité : Meta Compute, les baux SpaceX-xAI et CoreWeave se disputent la location de capacité ; à surveiller, l’évolution des prix vers un service banalisé ou vers une rente verrouillée
- Le découplage en deux écosystèmes s’accélère à mesure que la part de Nvidia sur le marché chinois des puces d’IA descend vers moins de 10 %
- TSMC engage ses 100 milliards de dollars supplémentaires en Arizona
- Les États passent de la répartition des coûts à la suspension pure et simple : Memphis réexamine son moratoire le 6 octobre 2026, et les régulateurs texans rendent compte d’ici le 19 octobre (qui paie l’électricité de l’IA)
2027-2030
- Les premières centrales à fusion commerciales pourraient entrer en service (« opérations initiales » d’Helion en 2028, CFS/Google au début des années 2030)
- L’achèvement prévu de Terafab et les premières capacités des campus d’OpenAI en Géorgie et dans l’Ohio (2028)
- Les architectures de puces dédiées à l’IA (silicium sur mesure de Meta, Amazon, Google) arrivent à maturité aux côtés de Nvidia
- La demande de calcul pour l’inférence dépasse celle de l’entraînement
- Programmes pilotes d’UBC dans certaines juridictions
2030+
- L’énergie de fusion commence à alimenter de façon significative les centres de données
- L’infrastructure de calcul de La Fondation dans ses premiers déploiements
- Les dépenses cumulées d’infrastructure d’IA dépassent 5 000 milliards de dollars
- Les contours de « qui contrôle la production d’intelligence » se précisent
Les enjeux
Quelque chose de précis se décide dans les entrepôts de GPU de Memphis, d’Abilene et d’autres lieux tenus secrets à travers le monde :
Qui contrôlera les moyens de production de l’intelligence ?
Si la réponse est « une poignée d’entreprises et d’États-nations », nous obtenons la trajectoire Star Wars : un féodalisme technologique avec de meilleurs graphismes. L’abondance créée par l’IA se concentre au sommet. Tous les autres deviennent économiquement inutiles, mais biologiquement vivants.
Si la réponse est « une infrastructure distribuée avec un accès universel », nous obtenons quelque chose de plus proche de la vision de la Post-Pénurie, où le calcul est un service public, où la capacité d’IA est largement partagée, et où la couche de La Fondation assure une existence digne tandis que la couche de L’Ascension récompense la contribution.
La course à la construction de grappes de calcul est une compétition commerciale, mais c’est aussi la construction de l’infrastructure qui déterminera la façon dont l’intelligence sera répartie dans la civilisation humaine.
Les usines de l’ère de l’intelligence se construisent en ce moment même. Reste à savoir si elles produiront la libération ou l’enfermement.
Références
- xAI Colossus Official Page
- SpaceX IPO Prospectus (Form S-1/A), SEC
- SpaceX Q2 2026 Earnings Call, Investing.com
- SpaceXAI to Add 660,000 GPUs, Tom’s Hardware (septembre 2026)
- Colossus 2 Data Center Profile, Epoch AI
- Anthropic Will Pay xAI $1.25B per Month for Compute, TechCrunch (mai 2026)
- Google to Pay SpaceX $920M a Month for xAI Compute Capacity, CNBC (juin 2026)
- SpaceX Signs Reflection AI, CNBC (juin 2026)
- SpaceX’s Mystery $1 Billion-a-Month Customer, Business Insider (septembre 2026)
- Greater Memphis Area Site Updates, SpaceXAI
- Memphis Delays Data Center Moratorium, Commercial Appeal (septembre 2026)
- Building Meta’s GenAI Infrastructure, Engineering at Meta
- Meta Is Building a Cloud Business to Sell Excess AI Compute, Bloomberg (juillet 2026)
- Meta’s Stock Drops on Disappointing Guidance, Dwindling Free Cash Flow, CNBC (29 juillet 2026)
- Meta Q2 2026 Earnings Call Transcript, Meta
- Meta Hyperion Louisiana Power Plants, Fortune (mars 2026)
- Hyperion Expansion to 5 GW, Meta (juillet 2026)
- Louisiana’s Debate Over Meta’s Power Needs, NOLA.com
- Announcing The Stargate Project, OpenAI
- OpenAI’s Data Center Pivot, CNBC (mars 2026)
- Oracle Q1 FY2027 Earnings Call, TradingKey (septembre 2026)
- Project Camellia in Effingham County, OpenAI (juillet 2026)
- Nvidia Backs OpenAI’s Ohio Data Center, CNBC (août 2026)
- Oracle’s Force Majeure Notice in New Mexico, TechCrunch (septembre 2026)
- Governor’s Letter Pausing Data Center Permits, State of Texas (septembre 2026)
- Oracle’s Zettascale AI Supercomputer
- H100 Rental Price Index, Silicon Data
- H100 Rental Prices Rebound, Motley Fool (septembre 2026)
- Nvidia Blackwell Architecture
- GB200 NVL72, Nvidia
- Nvidia Q2 FY2027 Results, Nvidia (août 2026)
- Nvidia Q2 FY2027 Earnings Call Transcript, Nvidia
- Nvidia Q2 FY2027 Form 10-Q, Nvidia
- Nvidia Vera Rubin Platform at GTC 2026, VideoCardz
- Huang Expects $1 Trillion in Orders, CNBC (mars 2026)
- What Is NVLink?, Nvidia Blog
- Energy Demand from AI, IEA
- Key Questions on Energy and AI, IEA (2026)
- Amazon Q2 2026 Earnings Call, Investing.com
- Alphabet Q2 2026 Earnings Call, Alphabet
- Microsoft Holds the Line on AI Spending, CFO Dive (juillet 2026)
- Oracle Q4 FY2026 Earnings, CNBC (juin 2026)
- Goldman Sees Hyperscaler Capex at $1.2 Trillion, Bloomberg (septembre 2026)
- Why the AI Industry Is Betting on Fusion Energy, TIME
- Helion Shifts Goalpost on Fusion, Axios Pro (septembre 2026)
- Helion and OpenAI Fusion Talks, GeekWire (août 2026)
- CFS Raises $1bn, Data Center Dynamics
- Record Fusion Funding of $4.48bn, Fusion Industry Association (juillet 2026)
- TSMC Q2 2026 Earnings Call, Investing.com
- Compute is the New Oil, Analytics India Magazine
- US Export Controls on China AI, AI Frontiers
- China’s Homegrown AI Accelerators, Tom’s Hardware
- Terafab’s $16.8 Billion First Phase, Reuters (août 2026)
- Terafab Timeline, Austin American-Statesman
- Universal Basic Compute, CoinDesk