LLM : cinq API gratuites en 2026, quotas et modèles clés

Le brief IA que les pros lisent chaque soir
Les 7 actus IA du jour, décryptées en 5 min. Gratuit.
Inclus dès l'inscription : notre sélection des meilleurs guides & comparatifs IA.
Choisis ton rythme
Gratuit · Pas de spam · Désabonnement en 1 clic
Cinq plateformes proposent en 2026 des accès API LLM gratuits suffisants pour apprendre, prototyper et tester. Quotas, modèles disponibles et spécificités varient nettement entre Groq, OpenRouter, Cloudflare, Mistral et Google Gemini.
Google rend Gemini 3.7 Flash gratuit avec 1 million de contexte
Gemini 3.7 Flash est proposé gratuitement, côté jetons d’entrée et de sortie, sur le niveau gratuit de l’API. Ce modèle dispose d’une fenêtre de contexte de 1 million de jetons et accepte jusqu’à 64K jetons de sortie. Google présente 3.7 Flash comme le modèle Flash le plus capable pour le codage, les workflows agentiques et le raisonnement multimodal. Le niveau gratuit inclut par ailleurs des modèles plus récents. L’API couvre aussi la compréhension d’images, d’audio et de vidéo, ainsi que des modèles d’embeddings textuels et multimodaux gratuits. Google indique offrir une utilisation gratuite sur des modèles sélectionnés.
Cloudflare Workers AI alloue 10 000 Neurons par jour, remis à zéro
Chaque compte Workers AI reçoit 10 000 Neurons d’inférence par jour, avec une réinitialisation quotidienne. La solution associe des modèles hébergés à la plateforme serverless de Cloudflare. Un modèle n’a pas besoin d’être affiché à 0 $ pour être utilisable gratuitement dans la limite de l’allocation, et nombre d’entre eux conservent un prix par jeton, couvert tant que l’usage reste dans les 10 000 Neurons journaliers. Cette mécanique permet de tester des modèles récents et de grande taille sans paiement immédiat par jeton, si l’usage reste dans le quota gratuit.
Mistral crédite 10 $ par mois sans carte, utilisables sur ses modèles
Mistral inclut 10 $ de crédits API mensuels dans son offre gratuite et ne requiert pas de carte bancaire pour démarrer avec Mistral Studio. Cette enveloppe n’est pas limitée à un seul modèle et finance l’usage API des modèles Mistral disponibles dans le compte Studio, y compris des versions récentes normalement facturées au jeton. Les crédits peuvent servir à construire des applications dans Studio ou à essayer le codage agentique avec Vibe Code. Parmi les modèles accessibles figure Mistral Medium.
GroqCloud : 10 000 Neurons/jour et accès à GPT-OSS-120B
GroqCloud fixe un plafond de 10 000 Neurons utilisables quotidiennement. L’offre gratuite permet d’utiliser Groq Compound, GPT-OSS-20B, GPT-OSS-120B ainsi que Qwen3.6-27B. Les quotas sont spécifiques à chaque modèle, plutôt qu’une enveloppe commune. Le service est présenté comme focalisé sur la vitesse d’inférence et adapté aux chatbots ou aux applications agentiques qui requièrent des réponses rapides.
OpenRouter agrège plus de 25 modèles gratuits avec routage :free
OpenRouter répertorie plus de 25 modèles gratuits. De nombreux endpoints utilisent le suffixe :free et l’alias openrouter/free achemine automatiquement la requête vers un modèle gratuit disponible avec les capacités demandées, comme l’appel d’outils ou des sorties structurées. Les comptes gratuits disposent actuellement de 50 requêtes par jour et de 20 par minute. Après l’achat d’au moins 10 $ de crédits, la limite quotidienne des modèles gratuits monte à 1 000 requêtes, sans que ces modèles cessent d’être gratuits. L’API reste compatible avec l’interface OpenAI, ce qui évite de refondre une application pour tester d’autres modèles.
Accès gratuit élargi et modèles disponibles sans hébergement
Des accès API gratuits permettent d’apprendre, de prototyper et d’expérimenter sans héberger soi‑même des modèles et sans payer par appel dans les limites prévues. Des modèles tels que NVIDIA Nemotron 3 Ultra, Laguna S 2.1, GPT-OSS-120B et les plus récents Gemini sont cités parmi les options accessibles. Selon un retour d’usage rapporté, ces offres dispensent d’ajouter une carte bancaire pour démarrer des essais. Un témoignage mentionne l’utilisation de Mistral pour des applications LLM et un flux de dictée Spokenly, ainsi qu’un recours à Groq pour une conversion rapide de parole en texte avec des modèles Whisper. Il est rapporté qu’il existe aujourd’hui suffisamment d’inférence gratuite chez ces cinq acteurs pour construire sans frais, tout en rappelant que les limites peuvent évoluer.
Brief IA — L'actualité IA en français
L'essentiel de l'actualité de l'intelligence artificielle, décrypté et expliqué chaque jour.