Article
Livrer un produit IA en 4 semaines avec un LLM à poids ouverts
· 9 min de lecture · Maxence Foulon
Phi-4 tient un prototype. Llama 4 Scout tient un contexte long. Apache 2.0 tient un contrat. Aucun des trois ne tient un lundi matin tout seul. Le tri se fait dans cet ordre : licence, langue, coût, puis qualité sur vos questions — pas sur un classement public.
« Quel est le meilleur modèle ? » n'est pas une question de produit
En août 2026, le tableau change toutes les semaines. Qwen sort une génération. DeepSeek une autre. Meta n'a pas publié de nouveau Llama open-weight depuis Llama 4 (avril 2025) ; Muse Glimmer est Apache 2.0, plus petit, plus récent. Un article qui fige « Llama 3.1 405B » comme verdict de production est déjà un article d'archive.
Le choix dépend de ce que vous construisez, avec quel GPU, sous quelle licence, en quelle langue. Un prototype sur une carte grand public n'est pas une prod multilingue. Un RAG sur des contrats n'est pas un chat support. Inverser — prendre le modèle du classement, puis chercher le métier — fait perdre des semaines le jour où le juridique lit la licence.
On dit « open source ». Souvent c'est faux. Poids téléchargeables, oui. Licence OSI (Apache, MIT), pas toujours. Llama est open-weight sous licence Community. Certains Qwen récents redeviennent « community » avec des seuils de CA. Dire open source à un client, puis découvrir une clause MAU, c'est un incident de cadrage. Pas un détail.
Le modèle n'est pas le produit. Un 70B sans comptes, sans refus, sans journal, sans dépôt, c'est un notebook plus cher. Launch tient en quatre semaines parce que le parcours est écrit avant le checkpoint.
Quel poids ouvert, selon le profil — pas selon le tweet
Prototype rapide, un GPU, valider un geste : un dense 7B à 14B. Phi-4 (MIT, Microsoft), un petit Qwen Apache 2.0, un compact Mistral. Ils chargent, ils suffisent pour vingt questions d'or. Ils ne suffisent pas à « l'IA partout ».
Production, ratio qualité/coût, français : un MoE dont seule une partie s'active par requête. Mistral Small 4 (Apache 2.0, MoE) est souvent le bon compromis matériel. Mixtral existe encore ; ce n'est plus le premier nom à citer. Vérifiez la fiche du checkpoint, pas le souvenir de 2024.
Contexte très long — corpus, contrats, code : Llama 4 Scout (MoE, fenêtre jusqu'à 10 M de tokens, licence Community) ou un Qwen 3.5 / 3.6 Apache avec large contexte. Le goulot n'est plus la fenêtre. C'est le retrieval et le prix des tokens. Un Scout mal cadré coûte plus cher qu'un 14B bien borné.
Code, raisonnement, agents : Qwen (les checkpoints Apache 3.5/3.6, pas forcément le « Max » à licence custom) et DeepSeek (souvent MIT sur les poids V3/V4 — relire le fichier LICENSE du dépôt, ça bouge). Validation humaine avant d'exécuter du code généré. Toujours.
Recherche, pédagogie, histoire : BLOOM. Pas un choix de production en 2026. Le citer dans un comparatif « pour être complet » sans le dire, c'est mentir aux GPU.
gpt-oss (OpenAI, Apache 2.0, 20B disponible chez de nombreux hébergeurs) : utile si vous voulez de l'open-weight sans Meta ni Alibaba. Ce n'est pas GPT-5 en local. C'est un poids, une licence claire, un écosystème d'inférence. On le teste sur le métier. On ne l'achète pas sur le nom.
Six questions, dans cet ordre, avant d'intégrer
La licence autorise-t-elle cet usage commercial, à cette échelle, dans cette géographie ? Seuils MAU, clauses « Built with… », interdiction d'entraîner un autre modèle sur les sorties, restrictions UE. Le juridique lit avant que l'ingénierie committe.
Le modèle tient-il le français de votre métier ? Un MMLU anglais ne dit rien d'un tarif PrestaShop ou d'un devis. Vingt à trente questions d'or, écrites avec quelqu'un du métier, avec le refus attendu. Le classement public change. Vos questions, non.
La fenêtre et le retrieval couvrent-ils le cas ? Un RAG documentaire mal découpé ne se répare pas avec 10 M de tokens. D'abord les chunks et les sources. Ensuite le modèle.
Quel est le coût d'inférence réel ? GPU, quantization, concurrence, pas la slide « tokens / M ». Un MoE n'active qu'une partie des paramètres : le coût suit l'actif, la VRAM suit le total. Les confondre fait acheter trop de cartes, ou trop peu.
L'écosystème d'inférence est-il mûr ? vLLM (batching, cache KV) est le défaut prod 2026. TGI reste dans l'orbite Hugging Face. llama.cpp pour le léger, le CPU, le test. Un checkpoint sans recette vLLM devient un projet de recherche.
Qui porte gouvernance et sécurité ? Comptes, logs, corpus, incident. Sans ça, le self-host n'est pas plus « souverain » qu'une API : il est juste plus silencieux le jour où ça fuit.
La licence tranche plus souvent que le benchmark
Apache 2.0 : Gemma 4, Mistral Large 3 / Small 4, Qwen 3.5 et 3.6 open-weight, Muse Glimmer (Meta, 30B, août 2026). MIT : Phi, une partie de DeepSeek. Vous distribuez, vous modifiez, vous vendez, avec notice. Relisez quand même : une « série » n'a pas une seule licence. Qwen 2.x n'était pas Apache. Qwen 3.8 Max, lui, a repris des seuils de CA et de MAU. Le nom Qwen ne suffit pas.
Llama Community (3.x et 4) : usage commercial sous 700 millions d'utilisateurs actifs mensuels — le seuil se lit au mois précédant la date de sortie de cette version, sur les produits du licencié et de ses affiliés, pas seulement le chat. Au-delà, demande à Meta, à sa seule discrétion. Attribution « Built with Llama ». Dérivés à préfixer Llama. Interdiction d'entraîner un modèle non-Llama sur les sorties. Ce n'est pas de l'open source OSI. Pour une PME française, le seuil 700 M ne scie presque jamais. Les clauses d'usage acceptable et, pour Llama 4 multimodal, les restrictions visant les sociétés établies dans l'UE, si. Un avocat lit Scout/Maverick avant que vous les serviez en vision depuis l'UE.
Mistral Medium et certains « community » chinois (Kimi, MiniMax) ajoutent des portes CA / MAU. Un Launch à 18 000 € n'atteint pas ces portes. Un produit que vous revendez en marque blanche, si. Écrivez le modèle économique avant le checkpoint.
BLOOM / RAIL : restrictions d'usage « responsable ». Peu adapté à un produit commercial classique. On le laisse à l'amphi.
Ces licences bougent d'une mineure à l'autre. On les relit à chaque bump majeur. On ne les relit pas « au kick-off, une fois ».
Déployer : self-host, cloud, quantization — après le parcours
Self-host : les prompts restent chez vous. Vous achetez la dispo, les GPU, les mises à jour de poids. Cloud managé (poids ouverts chez un inféreur) : plus vite en ligne, dépendance, question de transit. Ni l'un ni l'autre n'est « la souveraineté ». La souveraineté, c'est le dépôt, les comptes, le corpus, le bouton pour couper.
vLLM pour la charge. llama.cpp pour le coin de bureau. TGI si vous êtes déjà dans leur pile. Quantization 4 bits (GPTQ, AWQ, ou le format que le dépôt recommande aujourd'hui) : moins de VRAM, souvent tenable sur du métier. Jamais en prod sans comparer avant/après sur le jeu d'or. Une perte invisible sur MMLU est un tarif faux sur une fiche.
Sharding quand ça ne tient plus sur une carte. MoE pour payer l'actif, pas le total. Rien de tout ça ne remplace un rythme d'index et une évaluation relançable. Un Llama 4 Scout mal évalué hallucine plus cher.
Où ça s'ouvre : RAG, support, code — un parcours, pas trois
RAG documentaire : chunks lisibles, citations, refus, modèle assez petit pour le rerank, assez bon pour la phrase finale. Le piège reste le même : le POC sur dix PDF. La prod, c'est le tarif d'hier. L'article RAG est à côté. On ne le refait pas ici.
Support : le prompt et le refus avant le fine-tune. La latence et le coût par session pèsent plus qu'un point de benchmark. Un modèle « support » qui n'écarte jamais accélère les mauvaises réponses.
Code et agents : Qwen / DeepSeek tiennent souvent. Une étape humaine avant exécution. Un agent qui commit tout seul n'est pas de l'automatisation. C'est une signature volée, version git.
Un seul parcours pour un premier Launch. Trois architectures sur la slide, c'est trois produits. On les note. On n'en code pas trois en quatre semaines.
D'où ça vient. Ce que ça ne remplace pas.
Les familles citées : dépôts Hugging Face / GitHub des éditeurs, licences lues en août 2026, HELM (Stanford CRFM) pour rappeler qu'un score isolé ne tranche pas, vLLM comme défaut d'inférence prod. LMSYS, c'est l'Arena de chat, pas Hugging Face. Les confondre, c'est le SEO automatique.
Les chiffres de leaderboard périment. Les licences aussi. Cet article ne remplace pas un audit de votre cas : canal, corpus, français métier, GPU, juriste. Un « meilleur en 2026 » peut être un checkpoint mort en février 2027.
Selvren n'est pas « on a choisi Llama ». C'est un expert métier, deux corpus, le droit de dire non, sur la fiche. Le modèle est un moyen. Le raconter comme un comparatif GPU, c'est rater le produit.
Internaliser l'inférence, ou livrer le produit
Un POC qui traîne trois mois n'est pas un problème de Qwen. C'est un problème d'exécution : pas de parcours, pas de jeu d'or, pas de dépôt. Recruter pour « s'occuper des GPU » sans écrire le geste, c'est 42 600 € de plus pour le même notebook.
Si le juridique bloque sur Llama, changez de poids, pas de métier. Si la direction veut un produit en semaines, un MoE Apache et un Launch tiennent mieux qu'une équipe qui compare des Arenas.
Le prestataire qui promet le modèle le plus impressionnant vend une démo. Celui qui pose le canal, la licence, l'éval, le code jour 1, vend un produit. Quatre semaines, un parcours. Pas trois leaderboards.
Où vérifier avant de figer un checkpoint
Licences : fichier LICENSE du dépôt exact (Llama 4 Community, Apache du tag Qwen 3.6, MIT DeepSeek du tag, pas « la famille »). Seuil Llama : 700 M MAU au mois précédant la release, affiliés inclus. Attribution et préfixe de nom : lire l'accord, pas un résumé de blog.
Éval : HELM, crfm.stanford.edu/helm — pour ne pas prendre un unique MMLU. Inférence : documentation vLLM du modèle. Matériel : card du checkpoint (total vs actif pour un MoE).
Relu le 30 août 2026. Les poids bougent plus vite que cette page. On relit le dépôt le jour où on le pince dans Launch.
Questions fréquentes
Quel LLM open source choisir en 2026 pour un produit en production ?
D'abord la licence (Apache 2.0 / MIT vs licence Community Llama), puis le français sur vos prompts métier, puis le coût d'inférence réel. Un 7B–14B (Phi-4, petit Qwen, Mistral compact) pour prototyper. Un MoE (Mistral Small, Llama 4 Scout, Qwen 3.5/3.6) pour la prod. DeepSeek en MIT si vous assumez le GPU. Le classement public ne tranche pas.
Llama 4 est-il vraiment open source ?
Non au sens OSI. C'est de l'open-weight sous Llama Community License : usage commercial possible sous 700 millions d'utilisateurs actifs mensuels (seuil au mois précédant la sortie de la version), mention « Built with Llama », interdiction d'entraîner un modèle concurrent sur les sorties. Les capacités multimodales de Llama 4 ont des restrictions supplémentaires pour les sociétés établies dans l'UE. Relisez la licence. Ce n'est pas Apache 2.0.
Peut-on livrer un produit IA en 4 semaines avec un modèle à poids ouverts ?
Oui si le parcours est étroit : un canal, un corpus assumé, un refus, des comptes, un dépôt. Non si « on choisit d'abord le 70B puis on verra le métier ». Le modèle se choisit après la surface. Launch livre le produit, pas le leaderboard.