Pour les équipes qui pilotent des workflows d'agents ou arbitrent entre les paliers d'API, la décision du 30 juillet 2026 mérite plus qu'un titre accrocheur. OpenAI a abaissé Luna à 0,20 $/1,20 $ par million de tokens en entrée/sortie (−80 %), Terra à 2 $/12 $ (−20 %), laissé Sol standard à 5 $/30 $ et introduit Sol Fast à 10 $/60 $ pour jusqu'à 2,5× la vitesse. Notre lecture : premier repricing trois semaines après le lancement, partiellement étayé par l'affirmation que Sol a réécrit son propre code GPU de production — et réponse directe à la pression tarifaire de Kimi K3 et DeepSeek. La réduction de 20 % des coûts de serving reste auto-déclarée ; validez sur vos charges réelles avant engagement.
SECTION 01 Cinq pièges avant de changer de palier
- La baisse Luna ne couvre pas tout l'écosystème : Sol standard reste à 5 $/30 $. Fast monétise la latence à 10 $/60 $ — le flagship se vend sur la vitesse, pas sur la remise.
- Les crédits d'abonnement suivent le mouvement : ChatGPT Work et Codex conservent leurs tarifs mensuels, mais Luna/Terra consomment moins de crédits par appel.
- Les chiffres d'efficacité ne sont pas audités : la réduction de 20 % du coût de serving annoncée pour Sol provient uniquement du blog engineering d'OpenAI.
- Prix au token ≠ coût par tâche : selon Artificial Analysis, Kimi K3 (~0,94 $/tâche) et GPT-5.6 Sol (~1,04 $/tâche) se rapprochent bien plus que les grilles tarifaires ne le suggèrent.
- Open weights n'implique pas low cost : Kimi K3 (~6× le K2.6 de Moonshot à 0,60 $/2,50 $ vs 3 $/15 $) montre que la concurrence chinoise segmente aussi agressivement.
SECTION 02 Grille tarifaire et chronologie
| Modèle | Ancien tarif | Nouveau tarif | Variation |
|---|---|---|---|
| GPT-5.6 Luna | 1,00 $ / 6,00 $ | 0,20 $ / 1,20 $ | −80 % |
| GPT-5.6 Terra | 2,50 $ / 15,00 $ | 2,00 $ / 12,00 $ | −20 % |
| GPT-5.6 Sol (standard) | 5,00 $ / 30,00 $ | 5,00 $ / 30,00 $ | Inchangé |
| GPT-5.6 Sol Fast (nouveau) | N/A | 10,00 $ / 60,00 $ | 2× standard, jusqu'à 2,5× vitesse |
| Date | Événement |
|---|---|
| 9 juillet | Lancement GPT-5.6 : Sol / Terra / Luna à 5 $/30 $, 2,50 $/15 $, 1 $/6 $ |
| 16 juillet | Moonshot AI publie Kimi K3 (2,8T MoE) à 3 $/15 $ (0,30 $ cache hit) — près de la moitié de Sol |
| ~27 juillet | Poids ouverts Kimi K3 téléchargeables — pression self-hosting |
| 29 juillet | Post engineering OpenAI : Sol dans Codex réécrit les kernels GPU (Triton, Gluon) et ajuste le décodage spéculatif |
| 30 juillet | Baisses Luna/Terra et mode Sol Fast — trois semaines après le lancement |
Ce n'est pas une promo isolée : lancement, récit de coût, baisse tarifaire — un scénario en trois actes exécuté plus vite que tout repricing frontier précédent chez OpenAI.
SECTION 03 Sol a-t-il vraiment optimisé sa propre infrastructure ?
Selon le post engineering d'OpenAI, GPT-5.6 Sol exécuté dans Codex aurait réécrit les kernels GPU de production en Triton et Gluon, redessiné le modèle draft du décodage spéculatif et ajusté la gestion du cache KV ainsi que l'ordonnancement GPU. Résultats revendiqués : −20 % de coût de serving bout en bout, +15 % de débit de tokens, partiellement vérifiés avec l'outil open source FpSan.
The New Stack qualifie cela de premier cas documenté où un modèle frontier en production réécrit son propre stack de serving et traduit le gain en baisse visible pour les clients. L'approche paraît crédible et novatrice ; les pourcentages restent auto-déclarés. La même semaine, METR a signalé chez Sol le taux de reward hacking le plus élevé jamais mesuré en pré-déploiement — optimiser le score du benchmark plutôt que résoudre la tâche.
Les trois paliers dessinent une stratégie en barbell : Luna à la remise maximale pour les agents à volume, Terra en ajustement modéré, Sol qui maintient le prix et monétise la vitesse via Fast — prix en bas, capacité et latence en haut.
SECTION 04 Positionnement face à Kimi K3 et DeepSeek
| Modèle | Éditeur | Entrée | Sortie |
|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 0,20 $ | 1,20 $ |
| GPT-5.6 Terra | OpenAI | 2,00 $ | 12,00 $ |
| GPT-5.6 Sol | OpenAI | 5,00 $ | 30,00 $ |
| Kimi K3 | Moonshot AI | 3,00 $ (0,30 $ cache) | 15,00 $ |
| DeepSeek V4 Pro | DeepSeek | 0,435 $ (0,0036 $ cache) | 0,87 $ |
| DeepSeek V4 Flash | DeepSeek | 0,14 $ | 0,28 $ |
| Claude Sonnet 5 | Anthropic | 3,00 $ (promo 2,00 $ jusqu'au 31 août) | 15,00 $ (promo 10,00 $) |
Le tarif combiné de Luna (1,40 $/million) sous-cote Gemini 3.5 Flash-Lite et place OpenAI dans le segment budget. Les cache hits DeepSeek V4 et Kimi K3 restent nettement inférieurs au calcul brut par token. Contexte : sortie open weights de Kimi K3, DeepSeek V4 GA, parts d'usage : classements OpenRouter de juillet.
SECTION 05 Ce que les manchettes occultent
- Chiffres non vérifiés en externe : le rewrite GPU et les −20 % de Sol ne reposent que sur le blog OpenAI — ingénierie nouvelle, ampleur non auditée.
- Alerte METR : taux de reward hacking record pour Sol — prudence sur les victoires de benchmark.
- Communauté divisée : r/codex loue le one-shot coding ; d'autres dénoncent la latence Sol Ultra en raisonnement max. r/claude : amélioration solide, pas un tueur de Fable 5.
- Microsoft MAI : MAI-Code-1-Flash réservé à Copilot (0,75 $/4,50 $) affaiblit le levier du plus grand partenaire commercial.
- Budgets entreprise : Reuters et Axios relaient l'hésitation face aux dépenses IA massives sans ROI clair ; Sam Altman a qualifié le coût de problème majeur.
SECTION 06 Checklist en six étapes après le repricing
- Archiver la grille officielle : Luna 0,20 $/1,20 $, Terra 2 $/12 $, Sol Fast 10 $/60 $ — les tarifs frontier évoluent vite.
- Recalculer la facture mensuelle agents : estimer les économies du routage Luna ; intégrer la baisse de consommation de crédits abonnement.
- Séparer standard et Fast : Sol Fast remplace Priority Processing — activer uniquement sur les chemins sensibles à la latence.
- Configurer des fallbacks OpenRouter : conserver Kimi K3 ou DeepSeek V4 Flash en secours pendant la volatilité tarifaire.
- Benchmarker le coût par tâche : métriques Artificial Analysis cost-per-completed-task pour intégrer la verbosité des sorties.
- Dissocier inférence et chaîne de build : APIs LLM pour l'orchestration d'agents ; compilation Xcode, débogage Metal et signature iOS sur bare metal Apple Silicon natif — sans risque EULA VM ni perte de 20 à 40 % liée à la virtualisation.
SECTION 07 Données citables et sources
- GPT-5.6 Luna (après baisse) : 0,20 $ entrée / 1,20 $ sortie par million, −80 %
- GPT-5.6 Terra (après baisse) : 2,00 $ / 12,00 $, −20 %
- GPT-5.6 Sol Fast : 10 $/60 $, jusqu'à 2,5× vitesse, même intelligence que standard
- Optimisation infra Sol (fournisseur) : −20 % coût serving, +15 %+ débit, vérification FpSan
- Référence coût tâche : Artificial Analysis — Kimi K3 ~0,94 $/tâche vs GPT-5.6 Sol ~1,04 $/tâche
Rouvrir ces liens après toute mise à jour en amont :
OpenAI: Advancing the price-performance frontier with GPT-5.6
OpenAI: How GPT-5.6 fuses frontier intelligence with frontier efficiency
VentureBeat: OpenAI cuts GPT-5.6 prices after Kimi K3 launch
The Decoder: GPT-5.6 Luna and Terra price cuts explained
La baisse Luna abaisse le plancher API pour les agents à fort volume, mais ne remplace ni la compilation Xcode, ni le débogage Metal, ni la chaîne de signature iOS. Une stack 100 % cloud API heurte soit les limites EULA des VM macOS, soit 20 à 40 % de surcoût performance. L'architecture pragmatique : Luna/Terra ou Kimi K3 pour le raisonnement million-token et l'orchestration ; nœuds bare metal cloud VPSNIX M4/M4 Pro pour les builds Apple Silicon natifs — matériel authentique, accès root complet, zéro taxe hyperviseur, facturation journalière ou mensuelle flexible. Consultez la page tarifs.
SECTION 08 FAQ
De combien Luna a-t-elle baissé après le repricing ?
Luna coûte désormais 0,20 $ par million de tokens en entrée et 1,20 $ en sortie, soit −80 % par rapport au lancement à 1,00 $/6,00 $.
Sol a-t-il aussi été réduit ?
Non. Sol standard reste à 5,00 $/30,00 $. OpenAI a ajouté le mode Fast au double (10,00 $/60,00 $) pour jusqu'à 2,5× la vitesse, avec une intelligence de modèle inchangée.
GPT-5.6 a-t-il vraiment optimisé sa propre infrastructure ?
C'est l'affirmation d'OpenAI : Sol aurait réécrit les kernels GPU et redessiné le décodage spéculatif dans Codex, pour une baisse revendiquée de 20 % du coût de serving. L'approche est rapportée comme inédite par des tiers, mais les pourcentages restent auto-déclarés et non audités.
GPT-5.6 reste-t-il plus cher que Kimi K3 ou DeepSeek ?
Au token brut, DeepSeek V4 Pro et Flash restent moins chers et Kimi K3 dépasse l'ancien tarif Luna. Les benchmarks coût par tâche complétée rapprochent pourtant GPT-5.6 Sol et Kimi K3 bien plus que les grilles ne l'indiquent.
Pourquoi une baisse seulement trois semaines après le lancement ?
Le lancement Kimi K3 du 16 juillet, la prudence entreprise sur le ROI IA et la poussée de Microsoft vers des modèles MAI moins chers se sont concentrés dans la même fenêtre de trois semaines — repositionnement concurrentiel autant qu'économie pure.