Groq : l'inférence la plus rapide du marché, et ce qu'il faut savoir avant de l'utiliser
Groq est sans doute le fournisseur d’inférence le plus rapide du marché en 2026. Mais derrière la promesse de vitesse se cachent une architecture matérielle vraiment différente, un rebondissement industriel majeur (le deal NVIDIA), et des questions concrètes sur la conformité européenne. Voici un tour d’horizon complet.
Attention dès le départ à un piège classique : Groq (avec un q) n’a rien à voir avec Grok (avec un k), le modèle de xAI. Deux entreprises, deux produits, une lettre de différence.
Qui ils sont
Groq est une entreprise américaine basée à Mountain View, en Californie, fondée en 2016 par Jonathan Ross.1 Ross n’est pas n’importe qui : avant Groq, il avait lancé chez Google ce qui est devenu le projet TPU (Tensor Processing Unit), les puces maison de Google pour le machine learning, qu’il a démarré comme un projet à 20 % de son temps.2
L’entreprise conçoit une puce spécialisée pour l’IA, à l’origine appelée Tensor Streaming Processor (TSP), rebaptisée plus tard LPU (Language Processing Unit) après l’explosion des grands modèles de langage.1 Groq exploite aussi GroqCloud, une plateforme cloud qui permet aux développeurs d’appeler des modèles open source via une API compatible OpenAI.
Le rebondissement NVIDIA (à connaître absolument)
C’est l’événement qui change tout. Fin décembre 2025, NVIDIA et Groq ont annoncé un accord d’environ 20 milliards de dollars : NVIDIA obtient une licence non exclusive sur la technologie d’inférence de Groq.3 Point important, ce n’est pas un rachat de l’entité : Groq conserve sa propriété intellectuelle et continue d’opérer GroqCloud comme une entreprise indépendante. Le fondateur Jonathan Ross et le président Sunny Madra sont partis chez NVIDIA, et Simon Edwards est devenu le nouveau CEO de Groq.4
À la GTC 2026, NVIDIA a dévoilé la puce Groq 3 LPU, premier résultat concret de ce deal, intégrée à sa plateforme Vera Rubin comme coprocesseur dédié à la phase de décodage.5 Et en juin 2026, Groq a levé 650 millions de dollars supplémentaires pour financer son virage vers un business de cloud d’inférence pur.6
Ce qu’il faut en retenir si tu construis sur Groq : la plateforme GroqCloud tourne toujours, les prix n’ont pas bougé, mais la trajectoire long terme du produit autonome comporte une vraie incertitude. La majorité de l’équipe d’ingénierie qui a construit le LPU est partie chez NVIDIA.4 Construis donc avec un minimum de portabilité (l’API compatible OpenAI aide beaucoup sur ce point).
Pourquoi ils sont différents : le LPU
La vraie singularité de Groq, c’est le matériel. Un GPU (le standard NVIDIA) est conçu pour tout faire : graphisme, entraînement, inférence. Le LPU, lui, ne fait qu’une seule chose, mais le fait extrêmement vite : exécuter de l’inférence avec une performance prévisible.2
La différence clé est dans la mémoire. Les GPU s’appuient sur de la mémoire externe (DRAM/HBM) avec une hiérarchie complexe, parfaite pour l’entraînement mais mal adaptée à l’inférence, où l’exécution séquentielle des couches fait que les accès mémoire dominent la latence. Le LPU utilise de la SRAM intégrée à la puce comme mémoire principale (pas comme cache), ce qui supprime le goulot d’étranglement de la bande passante mémoire.7
flowchart LR
A[Requête] --> B{Architecture}
B -->|GPU| C[Mémoire externe HBM/DRAM<br/>goulot de bande passante]
B -->|LPU Groq| D[SRAM intégrée<br/>pas de goulot mémoire]
C --> E[~30-80 tokens/s]
D --> F[300-840 tokens/s]
Concrètement, ça donne des vitesses de 300 à plus de 800 tokens par seconde selon le modèle, soit grossièrement 4 à 12 fois plus rapide qu’un hébergeur sur GPU H100 pour les mêmes modèles.8 Pour des cas d’usage où la latence définit l’expérience utilisateur (agents vocaux, IA conversationnelle temps réel, boucles agentiques), l’avantage est concret et mesurable. Pour du traitement batch non temps réel, l’inférence GPU classique suffit largement.4
Est-ce que c’est RGPD ? Et est-ce que ça tourne en Europe ?
Deux questions liées mais distinctes, donc je les sépare.
La conformité contractuelle
Côté paperasse, Groq coche les bonnes cases. L’entreprise propose un Data Processing Addendum (DPA) qui s’appuie sur les Clauses Contractuelles Types européennes (EU SCCs), couvre le RGPD, le UK GDPR et la loi suisse (FADP), et prévoit une notification de violation de données sous 72 heures, conformément aux obligations RGPD.9 Groq dispose aussi de représentants RGPD désignés en Europe (à Hambourg) et au Royaume-Uni (Londres), et d’un Trust Center dédié à la sécurité.1011
La localisation des données : le point sensible
C’est là qu’il faut être précis. La politique de confidentialité de Groq indique clairement que tes données peuvent être transférées vers les États-Unis ou d’autres pays où l’entreprise ou ses prestataires opèrent des installations.10 Or, rappel utile : le RGPD n’interdit pas en soi de stocker des données hors d’UE, il encadre les transferts vers les pays tiers, qui doivent reposer sur un mécanisme légal (décision d’adéquation, SCCs, etc.).12 Groq utilise les SCCs, donc le transfert est en principe licite, mais ce n’est pas la même chose que de garder les données en Europe.
La bonne nouvelle : Groq s’étend en Europe. L’entreprise a annoncé en 2025 son premier datacenter européen à Helsinki, en Finlande, via un partenariat avec Equinix. L’objectif affiché est précisément de permettre le traitement des charges d’inférence entièrement à l’intérieur des frontières européennes, pour répondre aux exigences de souveraineté des données et réduire la latence.13 La Finlande a été choisie pour son énergie renouvelable abondante et son refroidissement naturel.
En clair : si tu veux la simplicité maximale côté conformité (données qui ne quittent jamais l’UE, pas de Transfer Impact Assessment à gérer), il faut t’assurer de router explicitement tes requêtes vers une région européenne et le vérifier contractuellement. Le DPA et les SCCs rendent l’usage défendable, mais pour des données personnelles sensibles, vérifie la région de traitement effective avant de mettre en production. Si la résidence stricte des données en UE est une exigence dure de ton client, c’est un point à contractualiser noir sur blanc.
Les modèles disponibles
Point fondamental : Groq n’héberge que des modèles open source / open weights. Pas de GPT-5, pas de Claude, pas de Gemini.8 Ce n’est donc pas un remplaçant d’OpenAI ou d’Anthropic, mais plutôt un complément ultra-rapide pour la couche sensible à la latence.
Le catalogue compte une dizaine de LLM, plus des modèles voix (reconnaissance et synthèse vocale) et des modèles de sécurité (type Llama Guard). Parmi les modèles texte phares :
- Llama 3.1 8B : le plus rapide (~840 tokens/s) et le moins cher, idéal pour la classification et les tâches simples.
- Llama 3.3 70B : le cheval de bataille, qualité proche de GPT-4o à ~394 tokens/s.
- GPT-OSS 20B et 120B : les modèles open weights d’OpenAI.
- Llama 4 Scout : modèle plus récent de Meta (~594 tokens/s).
- Qwen3 32B : alternative d’Alibaba.
Groq propose aussi des systèmes “Compound”, des wrappers agentiques qui ajoutent recherche web et exécution de code intégrées au modèle.14
Les prix
Le modèle économique est simple : paiement au token, pas de frais d’infrastructure à vide, pas de tarification élastique qui explose sans prévenir. Les prix sont en USD, par million de tokens.15 Voici les tarifs au 19 juin 2026 :16
| Modèle | Input / 1M | Output / 1M | Vitesse (TPS) |
|---|---|---|---|
| GPT-OSS 20B | 0,037 $ | 0,300 $ | — |
| Llama 3.1 8B | 0,050 $ | 0,080 $ | 840 |
| GPT-OSS 120B | 0,075 $ | 0,600 $ | — |
| Llama 4 Scout | 0,110 $ | 0,340 $ | 594 |
| Qwen3 32B | 0,290 $ | 0,590 $ | 662 |
| Llama 3.3 70B | 0,590 $ | 0,790 $ | 394 |
Pour situer : Llama 3.1 8B à 0,05 $/M en entrée compte parmi les inférences de production les moins chères disponibles, environ 3 fois moins cher que GPT-4o mini. Globalement, Groq est de 5 à 10 fois moins cher qu’un appel OpenAI ou Anthropic équivalent à volume de tokens comparable.17
Niveaux et remises
Groq fonctionne avec trois niveaux : Free, Developer et Enterprise.18
- Free : accès à tous les modèles, sans carte bancaire. Limites de débit (~30 requêtes/min, 14 400 requêtes/jour par modèle). Largement suffisant pour le prototypage et la petite production.
- Developer : ajoute une carte bancaire (sans minimum de dépense), débloque jusqu’à 10x les limites de débit et 25 % de remise sur les tokens.
- Enterprise : limites sur mesure, à négocier avec le commercial.
Deux leviers d’économie supplémentaires : les tokens en cache sont à -50 %, et l’API Batch (traitement asynchrone sous 24 h) offre encore -50 % sur n’importe quel modèle.8
En résumé : quand choisir Groq ?
Groq occupe une position unique en 2026 : le fournisseur d’inférence le plus rapide, avec un free tier généreux, mais limité aux modèles open source. Choisis-le quand la vitesse définit l’expérience (chatbots, assistants de code, agents vocaux) ou quand le coût est déterminant sur des modèles open weights. Reste sur OpenAI ou Anthropic quand tu as besoin de la qualité spécifique d’un modèle propriétaire. Et garde un œil sur l’incertitude post-deal NVIDIA : construis portable, et contractualise la région européenne si le RGPD strict fait partie de ton cahier des charges.
Sources
- Groq - Wikipediaen.wikipedia.org
- Groq vs. GPUs: The future of AI inference in 2026 - Civocivo.com
- Nvidia's $20B Groq Acquisition - IntuitionLabsintuitionlabs.ai
- Groq AI in 2026: Nvidia Deal, LPU Architecture, GroqCloud - Voiceflowvoiceflow.com
- Nvidia Groq 3 LPU: Speeding AI Inference Tasks - IEEE Spectrumspectrum.ieee.org
- Groq Raises $650M to Scale Its AI Inference Cloud Businessgroq.com
- Groq pricing in 2026 - eesel AIeesel.ai
- Groq API Pricing 2026 - TokenMix Blogtokenmix.ai
- Data Processing Addendum for GroqCloud Services - GroqDocsconsole.groq.com
- Privacy Policy - Groqgroq.com
- Trust Center - Groqtrust.groq.com
- Data Residency Requirements: EU vs US Explained - Secure Privacysecureprivacy.ai
- Helsinki becomes AI hotspot as Groq expands to Europe - Finnish AI Regionfairedih.fi
- Groq pricing in 2026 (Compound systems) - eesel AIeesel.ai
- Groq On-Demand Pricing for Tokens-as-a-Servicegroq.com
- Groq Pricing - All Models & Speed - Price Per Tokenpricepertoken.com
- Groq Cloud Pricing and Free Tier Details 2026 - NeuraPlusAIneuraplus-ai.github.io
- Groq Free Tier 2026 - Price Per Tokenpricepertoken.com