Un post LinkedIn résume FreeLLMAPI ainsi : « Claude Code presque illimité gratuitement ». C’est accrocheur, mais techniquement imprécis.
Le projet ne débloque pas un quota géant chez Anthropic. Il additionne les offres gratuites de plusieurs fournisseurs, les place derrière un routeur commun et expose des interfaces compatibles avec des outils qui s’attendent à parler à OpenAI, Anthropic, Gemini ou Ollama.
Au 26 septembre 2026, son README annonce environ 7,4 milliards de tokens mensuels théoriques, 34 fournisseurs, 474 familles de modèles et 635 endpoints gratuits. Le mot important est « théoriques » : cette capacité n’existe que si l’utilisateur possède les clés nécessaires, si les free tiers sont encore disponibles et si leurs limites n’ont pas changé.
Ce que FreeLLMAPI fait réellement
Une application cliente envoie une requête au serveur FreeLLMAPI. Le routeur regarde les modèles activés, les clés configurées, les limites de requêtes et de tokens, puis choisit une route disponible.
Lorsqu’un fournisseur répond par une erreur temporaire — par exemple un 429 lié au rate limit, un 5xx ou un timeout — le routeur peut mettre cette route en cooldown et essayer la suivante. Il suit aussi des compteurs par clé et par modèle pour éviter d’envoyer volontairement une requête vers une capacité déjà épuisée.
Ce mécanisme est plus intéressant que le chiffre de 7,4 milliards lui-même. Le produit n’est pas une nouvelle source d’inférence ; c’est une couche d’orchestration au-dessus de sources qui existent déjà.
Claude Code peut l’utiliser. Cela ne veut pas dire que Claude devient gratuit.
FreeLLMAPI expose une implémentation de l’API Messages d’Anthropic sur /v1/messages. Claude Code peut donc pointer vers le serveur FreeLLMAPI avec une URL de base et une clé unifiée.
À ce moment-là, Claude Code reste l’interface de travail : exploration du dépôt, appels d’outils, modifications de fichiers, commandes et boucle agentique. Mais le modèle qui répond derrière peut être Gemini, Qwen, GLM, Mistral ou un autre modèle présent dans la chaîne de routage.
La distinction est importante. Utiliser Claude Code avec FreeLLMAPI n’équivaut pas à obtenir Claude Sonnet ou Opus gratuitement. On garde le client ; on remplace potentiellement le moteur.
Pour certaines tâches, ce découplage est très utile. Un test à générer, une documentation à compléter ou un refactoring mécanique peuvent être exécutés par plusieurs modèles avec des résultats acceptables. Pour une décision d’architecture complexe, un changement de modèle peut produire un comportement sensiblement différent.
Le contexte survit, mais pas la mémoire interne du modèle
Changer de fournisseur au milieu d’une session pose un problème évident : le nouveau modèle doit comprendre ce qui s’est passé avant lui.
FreeLLMAPI utilise des sticky sessions pour essayer de garder une conversation sur le même modèle pendant 30 minutes. Il propose aussi un mécanisme de context handoff qui peut injecter une note compacte lorsqu’un changement de modèle se produit.
La documentation précise que les messages utilisés par ce mécanisme restent en mémoire avec une durée de vie de trois heures et ne sont injectés que lors d’un changement de modèle. Elle précise surtout ce que le système ne peut pas faire : récupérer un état interne caché chez le fournisseur précédent ou des messages qui n’ont jamais transité par le proxy.
Autrement dit, le nouveau modèle reçoit du contexte. Il ne reçoit pas le cerveau du précédent.
Les 7,4 milliards de tokens ne forment pas un compte bancaire
Additionner des free tiers donne un chiffre spectaculaire, mais ces quotas ne sont pas fongibles.
Un fournisseur peut limiter les requêtes par minute, un autre les tokens par jour, un troisième l’accès à certains modèles. Certains quotas nécessitent une clé, d’autres changent régulièrement. Le projet maintient d’ailleurs un catalogue signé de modèles et de limites pour suivre ces évolutions.
Même lorsque plusieurs modèles sont disponibles, ils ne sont pas équivalents. Une capacité de plusieurs millions de tokens sur un modèle rapide et léger ne remplace pas automatiquement quelques centaines de milliers de tokens sur un modèle plus fort en raisonnement ou en code.
Le chiffre de 7,4 milliards décrit donc la somme d’un ensemble de capacités hétérogènes. Ce n’est pas une garantie de débit, de qualité ou de disponibilité continue pour un utilisateur donné.
Côté sécurité, le routeur local ne rend pas les fournisseurs invisibles
Les clés de fournisseurs stockées par FreeLLMAPI sont chiffrées au repos avec AES-256-GCM dans SQLite. Le client n’a besoin que d’une clé unifiée pour parler au routeur.
C’est utile pour éviter de distribuer plusieurs secrets à chaque outil local. Cela ne transforme cependant pas FreeLLMAPI en enclave privée.
Une requête destinée à Gemini part toujours vers Google. Une requête routée vers Groq part vers Groq. Même chose pour les autres fournisseurs activés. Le code, les prompts, les extraits de fichiers et les sorties d’outils envoyés au modèle sont donc soumis aux conditions et politiques du fournisseur qui traite effectivement la requête.
Pour un dépôt personnel ou un prototype, ce compromis peut être acceptable. Pour du code propriétaire, des données clients ou des informations confidentielles, la liste des routes activées doit être traitée comme une décision de sécurité, pas comme un simple réglage de performance.
Le projet lui-même déconseille la production
Le README est explicite : FreeLLMAPI est présenté comme un projet d’expérimentation personnelle et d’apprentissage, pas comme une base d’inférence de production.
Cette prudence n’est pas cosmétique. Les free tiers peuvent disparaître, réduire leurs quotas ou changer leurs conditions. Le projet maintient même une revue fournisseur par fournisseur des conditions d’utilisation : certaines offres sont compatibles avec un proxy personnel, d’autres sont ambiguës, et certaines sont explicitement limitées à l’évaluation ou au prototypage.
Une application vendue à des clients ne devrait donc pas construire son SLA sur l’idée que trente-quatre offres gratuites resteront éternellement identiques.
Là où l’outil devient vraiment utile
Le cas d’usage le plus crédible n’est pas « remplacer tous les abonnements IA ». C’est disposer d’une couche de secours et d’expérimentation pour les outils de développement.
Un développeur peut garder son modèle principal pour les tâches sensibles, puis utiliser une chaîne gratuite pour les tests, la documentation, les migrations répétitives, le boilerplate ou certaines étapes de revue. Le même routeur peut aussi connecter des modèles locaux via des endpoints compatibles OpenAI.
Ce modèle de travail change la question. On ne demande plus seulement « quel LLM utiliser ? », mais « quelle tâche mérite quel niveau de modèle, de coût et de confidentialité ? ».
FreeLLMAPI ne rend pas Claude gratuit. Il montre plutôt à quoi ressemble un environnement où le client de développement, le routeur et le modèle deviennent trois couches séparées.
Et c’est probablement la partie la plus durable du projet : pas les 7,4 milliards de tokens, mais l’idée qu’un agent de code puisse continuer à travailler sans être attaché à un seul fournisseur.
