Skip to content

Intervalles de confiance

On interroge une population d'une certaine taille sur une question (booléenne), et on comptabilise le pourcentage de "Oui" en réponse au sondage.

Si on veut modéliser cette situation avec où chaque individu suis une Loi de Bernoulli. Si on utilise un seul , alors on revient à "uniformiser" les opinions des individus. C'est la méthode la plus utilisée, car la plus pratique. On cherche donc à trouver de manière précise, robuste et avec le moins de biais possible.

Mais il y a un problème : prenons deux échantillons et . Les estimateurs de p obtenues sont 0.33 et 0.45 (sur une même question). Comment prendre en compte les différences sur nos 2 estimations ?

  1. et sont séparés, pourquoi ? Y-aurait il un problème de biais ou de représentativité de l'échantillon ?
  2. Es ce qu'une moyenne est cohérente ?

Les différences d'estimations donnent certaines information sur l'assurance/la qualité d'une étude, quantifier la solidité statistique de l'étude (choix de l'échantillon, de la loi, etc...).

À partir d'estimations ponctuelles de notre experience, on va chercher à en quantifier son incertitude. Pour cela, nous allons utiliser des estimations ensemblistes afin d'assurer une certaine garantie statistique sur notre experience.

Estimation d'intervalle

On réalise l'estimation d'un paramètre , à partir de données générés selon les variables aléatoires

Définition

Soient et des statistiques de nos variables aléatoires pour un paramètre . Supposons que .

On appelle:

  1. une estimation d'intervalle

  2. un estimateur d'intervalle

    Une intervalle de confiance de seuil pour un paramètre est un estimateur d'intervalle tel que

Remarque

On se servira des estimateurs d'intervalle pour les résultats mathématiques qu'ils nous permettent d'avoir, mais nous utiliserons les estimations d'intervalles pour les valeurs numériques.

Remarque

  • Le seuil doit être assez élevé ().
  • On cherche un encadrement de (fixé), les bornes de l'intervalle sont aléatoires.
  • ne dépend pas de .
  • En général, on construit l'intervalle de confiance pour à l'aide d'un bon estimateur de . Il a la forme

rt

Intervalles de confiance pour la loi normal

Soit iid . On suppose connu, et on cherche à estimer à l'aide d'une intervalle de confiance

Soit un estimateur de . Résultats pour , indépendantes.

À ne pas confondre avec le TCL

Soit . On sait que .

Note

Globalement, toutes les v.a. que nous étudierons (ou presque) se rapprocheront de lois réduites.

À partir de , on va obtenir un encadrement de , selon un seuil de confiance . En suis les étapes suivantes :

  • Fixons .
  • On sait que qui vérifient
  • On transforme notre intervalle pour faire apparaître et . Sachant que , on a: (connu et tabulé)
  • Par équivalences, et (par construction)

**Donc l'intervalle est une intervalle de confiance pour , de seuil .

Application Numérique

nous donne une estimation pour .

Avec un échantillon de taille 100, et , une estimation de s'écrit :

On a, à présent, pour tout seuil , des valeurs associés et qui nous donnent une intervalle de confiance pour le paramètre (*à partir des tabulations de .

Example

Avec notre intervalle précédente, si , alors et .

Alors

Si , alors et .

Alors

Plus est proche de 1, plus l'intervalle sera large (compromis entre la "précision" de notre estimation (taille réduite de ) et la probabilité que soit dedans (l'amplitude du seuil ))

Résumé

Nous sommes parties d'une estimation ponctuelles, et nous avons une probabilité que notre paramètre soit dans une intervalle, afin d'obtenir une garantie sur notre experience statistique


On a construit une intervalle de confiance pour , sachant . En réalité, il n'y a pas de raison de connaitre sigma si on ne connait pas mu.

En partant de l'exemple précédent, si on considère que est inconnu, on peut se servir de la variance empirique via l'estimateur (ou pour la version non-biaisé). Au lieu de , on va utiliser

D'après le théorème de fisher, suit une loi de Student à degrés de liberté : . On admet ce résultat. Cette loi est elle aussi tabulée.

Ainsi, pour un seuil de confiance , on peut trouver une grandeur telle que t de l'exemple précédent, si on considère que  est inconnu, on peut se servir de la variance empirique via l'est Dans d'autres termes, on peut trouver un encadrement "tabulé" de qui pourra être traduit en une intervalle de confiance pour (sans connaitre )

Example

En reprenant l'analyse précédente ,

Donc

Par conséquent, on a une formule de l'intervalle de confiance pour , avec inconnu, et de seuil .

Remarque

Le théorème de Fisher ne s'appliquent uniquement qu'à une intervalle de confiance sur , pour des lois normales iid

Intervalles de confiance pour la loi de Bernoulli

On part d'une experience de sondage d'un échantillon de individus sur une question avec deux réponses (oui et non). On note la variable aléatoire qui associe à l'individu à la question 1 si "oui" et 0 si "non".

Hypothèse : on associe à tout les individus et que les sont mutuellement indépendants.

Objectif : Obtenir une estimation ensembliste sur

Démarche :

  1. On trouve un (bon) estimateur de : ( et rend vers 0)

  2. On applique le Théorème Centrale Limite comme avec les lois normales :

Ici, l'idée est de s’affranchir des lois dépendant des paramètres (ici : p) pour retomber sur des lois "universelles" (ici, loi normales)

  1. On construit un encadrement comme pour la loi normal : on se fixe un seuil tel que . Par équivalence, Donc

-> Problème : on a toujours besoin de pour estimer ... Ce qui est contre intuitif.

-> Solution : on majore/approxime .

  1. On approxime par ou on le majore, sachant que . . Ces deux majorations nous permettent de remplacer dans l'intervalle de confiance, donc de ne plus dépendre de p.
Example

On a 36 individus, sondé, et les résultats du sondage donnent . On veut construire une intervalle de confiance pour .

Pour une intervalle "approximé" :

Pour une intervalle de confiance "absolue" :

Observations : Les intervalles absolues sont toujours plus larges que celles approximées.

Important

Quelques valeurs notables:

  • Pour , on a et
  • Pour , on a et

On a construit deux types d'intervalles de confiance pour p, paramètre de la loi de Bernoulli, et . Pour l'intervalle approximative, la largeur dépend de la taille de alors que l'intervalle absolue majore par donc indépendant de p.

Dans les deux cas, on retrouve une idée d'une intervalle . Avec l'intervalle approximative, . Avec l'intervalle absolue, .

Question : On veut maintenant obtenir une intervalle de confiance pour p avec une largeur de ±3%. (sondage ou appareil de mesure, peu importe). Quelle est la taille de l'échantillon qui permet d'obtenir cette largeur ? Solution 1 : demander à toute la population. Cependant, cette option est peu réaliste. On cherche donc, à seuil fixé , si on a une largeur imposée %, on isole n et .

Example

Pour comme précédemment : pour . Pour .

Remarque

Le développement effectuée dans le cadre de l'intervalle de confiance pour le paramètre de la loi de Bernoulli s'applique aussi à d'autres types de lois. Il suffit d'appliquer la construction étape par étape.

Released under the GPL-3.0 License.