Cet article présente une prévision statistiquement rigoureuse du vainqueur de la Coupe du Monde FIFA 2026 basée sur les données de phase de groupes après la Journée 2. Il sera mis à jour après chaque tour à mesure que de nouveaux résultats arriveront.
1. Le bon modèle pour la bonne question
La question est simple : étant donné les buts marqués jusqu’à présent, quelle équipe est la plus susceptible de gagner la Coupe du Monde FIFA 2026 ? y répondre nécessite un modèle statistique clair. Nous utilisons deux outils complémentaires : un modèle Bayésien de Poisson pour estimer le véritable taux de marque de chaque équipe, et le polynôme de différence progressive de Newton pour caractériser comment ce taux évolue match après match. Les deux outils servent des objectifs différents, et les garder séparés est la clé pour obtenir la bonne réponse.
2. Les buts comme un processus de Poisson
Les buts marqués par une équipe de football lors d’un match unique sont bien modélisés comme une variable aléatoire de Poisson. Chaque équipe possède un taux de marque vrai sous‑jacent λ (buts par match), et le nombre de buts marqués lors d’un match est tiré de manière indépendante de cette distribution. Si l’équipe k joue m matchs et marque G buts au total, la vraisemblance des données est :
Le paramètre λ est inconnu. Nous n’observons pas le vrai taux de marque — seulement les résultats. Estimer λ à partir de données limitées est exactement ce pour quoi l’inférence Bayésienne a été conçue.
3. Inférence Bayésienne : le modèle Gamma–Poisson
Nous exprimons notre incertitude concernant λ comme une distribution de probabilité — la loi a priori — et la mettons à jour avec les données observées pour obtenir la loi a posteriori. La loi a priori conjuguee naturelle pour une vraisemblance de Poisson est la distribution Gamma :
où α₀ est le paramètre de forme et β₀ le paramètre de taux, donnant une moyenne a priori de α₀/β₀. Nous fixons α₀ = 3, β₀ = 2, obtenant une moyenne a priori de 1,5 buts par match — cohérente avec les moyennes historiques de buts en phase de groupes de la Coupe du Monde pour toutes les équipes.
3.1 La loi a posteriori
Après observation de G buts totaux en m matchs, la loi a posteriori est disponible analytiquement :
La moyenne a posteriori — notre meilleure estimation ponctuelle du vrai taux de marque — est :
Cela rapproche la moyenne d’échantillon brute G/m de la moyenne a priori (1,5) lorsque les données sont rares, et converge vers la moyenne d’échantillon lorsque m → ∞. Après seulement deux matchs, cette regularisation empêche une sur‑réaction aux petits échantillons — une équipe qui a marqué 7 buts lors de son premier match n’est pas automatiquement projetée à marquer 7 buts à chaque match.
3.2 Intervalles de credibilite
L’intervalle de credibilite à 95 % pour λ provient de la relation chi‑carré / Gamma. Si λ ~ Gamma(α, β), alors 2βλ ~ χ²(2α), donc :
Ces intervalles seront larges après deux matchs — un reflet honnête de l’incertitude réelle à ce stade du tournoi.
3.3 La règle de mise à jour Bayésienne
La structure conjuguee signifie que l’incorporation d’un nouveau résultat de match ne nécessite aucun recalcul à partir de zéro. Si la loi a posteriori actuelle de l’équipe k est Gamma(α, β) et qu’elle marque g buts au match suivant :
La loi a posteriori après la Journée 2 est la loi a priori entrant dans la Journée 3. Une addition par paramètre. Voilà toute la mise à jour.
4. Differences progressives de Newton : forme, pas prévision
Le polynôme de différence progressive de Newton est un outil d’interpolation classique. Étant donné les buts cumulatifs observés G(0) = 0, G(1), G(2), il construit le polynôme unique de degré 2 passant exactement par les trois points :
où les différences progressives sont :
Ce que ce polynôme représente : une description exacte de la trajectoire de marque d’une équipe dans la plage observée (matches 0 à 2).
Ce que ce polynôme ne représente pas : une prévision fiable pour le match 7 ou le match 21. Une polynôme de degré 2 extrapolé loin au‑delà de sa plage d’ajustement diverge rapidement. Évaluer P(21) produit des nombres dans les centaines ou les milliers — y compris des valeurs négatives — qui n’ont aucun sens physique. C’est un danger bien connu de l’extrapolation polynomiale, pas une fonctionnalité.
Le rôle correct des différences progressives de Newton dans cette analyse est celui d’un indicateur de forme, complétant l’estimation bayésienne du taux de marque :
- Δ² < 0 : a marqué moins de buts au match 2 qu’au match 1. La forme décélère. L’estimation ponctuelle λ̂ peut être biaisée à la hausse par rapport à la forme actuelle.
- Δ² = 0 : production identique dans les deux matchs. L’estimation du taux reflète une performance constante.
- Δ² > 0 : a marqué plus au match 2 qu’au match 1. La forme s’accélère. Valeur de pondération positive.
5. Résultats après la Journée 2
5.1 Données brutes
Buts marqués par match pour les équipes les mieux classées. Les buts du match 1 pour l’Allemagne sont confirmés ; pour toutes les autres équipes, les chiffres du match 1 sont estimés à partir du total GF.
| Équipe | G(1) | G(2) | Total GF | Δ¹ | Δ² | Forme |
|---|---|---|---|---|---|---|
| 🇩🇪 Germany | 7 | 2 | 9 | 7 | -5 | ↓ decelerating |
| 🇳🇴 Norway | 4 | 3 | 7 | 4 | -1 | ↓ decelerating |
| 🇨🇦 Canada | 4 | 3 | 7 | 4 | -1 | ↓ decelerating |
| 🇳🇱 Netherlands | 4 | 3 | 7 | 4 | -1 | ↓ decelerating |
| 🏴 England | 4 | — | 4 | 4 | — | ? (1 match) |
| 🇫🇷 France | 3 | 3 | 6 | 3 | +0 | → consistent |
| 🇯🇵 Japan | 3 | 3 | 6 | 3 | +0 | → consistent |
| 🇺🇸 USA | 4 | 2 | 6 | 4 | -2 | ↓ decelerating |
| 🇸🇪 Sweden | 5 | 1 | 6 | 5 | -4 | ↓ decelerating |
| 🇨🇴 Colombia | 3 | — | 3 | 3 | — | ? (1 match) |
| 🇦🇷 Argentina | 3 | 2 | 5 | 3 | -1 | ↓ decelerating |
| 🇲🇽 Mexico | 3 | 0 | 3 | 3 | -3 | ↓ decelerating |
5.2 Estimations a posteriori
Loi a priori : Gamma(3, 2), moyenne = 1,5. Moyenne a posteriori = (α₀ + GF) / (β₀ + m). Équipes classées par la moyenne a posteriori λ̂.
| Rang | Équipe | m | GF | Loi a posteriori | λ̂ | IC 95 % | Forme (Δ²) |
|---|---|---|---|---|---|---|---|
| #1 | 🇩🇪 Germany | 2 | 9 | Gamma(12, 4) | 3.000 | [1.55, 4.92] | -5 ↓ decelerating |
| #2 | 🇳🇴 Norway | 2 | 7 | Gamma(10, 4) | 2.500 | [1.20, 4.27] | -1 ↓ decelerating |
| #3 | 🇨🇦 Canada | 2 | 7 | Gamma(10, 4) | 2.500 | [1.20, 4.27] | -1 ↓ decelerating |
| #4 | 🇳🇱 Netherlands | 2 | 7 | Gamma(10, 4) | 2.500 | [1.20, 4.27] | -1 ↓ decelerating |
| #5 | 🏴 England | 1 | 4 | Gamma(7, 3) | 2.333 | [0.93, 4.35] | — ? (1 match) |
| #6 | 🇫🇷 France | 2 | 6 | Gamma(9, 4) | 2.250 | [1.03, 3.94] | +0 → consistent |
| #7 | 🇯🇵 Japan | 2 | 6 | Gamma(9, 4) | 2.250 | [1.03, 3.94] | +0 → consistent |
| #8 | 🇺🇸 USA | 2 | 6 | Gamma(9, 4) | 2.250 | [1.03, 3.94] | -2 ↓ decelerating |
| #9 | 🇸🇪 Sweden | 2 | 6 | Gamma(9, 4) | 2.250 | [1.03, 3.94] | -4 ↓ decelerating |
| #10 | 🇨🇴 Colombia | 1 | 3 | Gamma(6, 3) | 2.000 | [0.73, 3.89] | — ? (1 match) |
| #11 | 🇦🇷 Argentina | 2 | 5 | Gamma(8, 4) | 2.000 | [0.86, 3.61] | -1 ↓ decelerating |
| #12 | 🇲🇽 Mexico | 2 | 3 | Gamma(6, 4) | 1.500 | [0.55, 2.92] | -3 ↓ decelerating |
Observation clé : L’Allemagne mène avec λ̂ = 3,000, mais son intervalle de credibilite à 95 % [1,55 ; 4,92] se chevauche entièrement avec celui de la France [1,03 ; 3,94] et du Japon. Après deux matchs, le modèle signale correctement qu’aucune équipe ne peut être statistiquement séparée du groupe. De plus, Δ² = −5 pour l’Allemagne est la décélération la plus forte du jeu de données — son premier match exceptionnel (7 buts) peut ne pas refléter son taux durable.
6. Exemple détaillé : mise à jour pour la Journée 3
La loi a posteriori actuelle de l’Allemagne est Gamma(12, 4) (paramètre de forme = 3 + 9 = 12, paramètre de taux = 2 + 2 = 4, moyenne = 3,00). Après leur troisième match de groupe :
| Buts au match 3 | Nouvelle loi a posteriori | Nouveau λ̂ | Nouvel intervalle de credibilite à 95 % |
|---|---|---|---|
| 0 | Gamma(12, 5) | 2.400 | [1.24, 3.94] |
| 1 | Gamma(13, 5) | 2.600 | [1.38, 4.19] |
| 2 | Gamma(14, 5) | 2.800 | [1.53, 4.45] |
| 3 | Gamma(15, 5) | 3.000 | [1.68, 4.70] |
| 4 | Gamma(16, 5) | 3.200 | [1.83, 4.95] |
| 5 | Gamma(17, 5) | 3.400 | [1.98, 5.20] |
Si l’Allemagne ne marque pas au match 3, son estimation chute à 2,400 — en dessous de la Norvège, du Canada et des Pays‑Bas. Si elle marque à nouveau 5, elle monte à 3,400. Le troisième résultat est de loin le point de données le plus informatif pour l’Allemagne, compte tenu de l’extrême variance entre les matchs 1 et 2.
7. Verdict — édition Journée 2
- Allemagne (#1, λ̂ = 3,00) mène sur le taux de marque mais porte le risque de forme le plus élevé (Δ² = −5). Son estimation changera radicalement au match 3.
- Norvège, Canada, Pays‑Bas (#2, λ̂ = 2,50) forment un groupe de marqueurs élevés cohérents avec une décélération légère.
- France et Japon (#5, λ̂ = 2,25) affichent le signal de forme le plus net du jeu de données : Δ² = 0, parfaitement cohérents sur les deux matchs. Leur estimation ponctuelle est plus basse mais l’incertitude est plus petite relative à leur taux.
- Suède (#5, λ̂ = 2,25) montre la deuxième décélération la plus forte (Δ² = −4) : 5 buts au match 1, 1 au match 2. Risque élevé d’une nouvelle chute.
Conclusion statistique : aucune équipe ne peut être distinguée des autres avec confiance à ce stade. Tous les intervalles de credibilite se chevauchent. C’est la bonne réponse après deux matchs — quiconque prétend une certitude fait du sur‑apprentissage du bruit. Le modèle sera mis à jour après la Journée 3 en utilisant la règle de mise à jour en forme fermée ci‑dessus ; les intervalles se resserreront, et le classement deviendra plus informatif.
Note méthodologique : modèle Bayésien Gamma–Poisson conjugue, loi a priori Gamma(3, 2) reflétant la moyenne historique de buts par match en phase de groupes de la Coupe du Monde (1,5 buts/match). Intervalles de credibilite a posteriori via la relation chi‑carré/Gamma (approximation de Wilson–Hilferty). Le polynôme de différence progressive de Newton est utilisé uniquement comme indicateur de forme intra‑échantillon — pas pour l’extrapolation. Données : FIFA World Cup 2026, Journée 2, juin 2026.
