19. Evaluating Empirical Probability
Summary
Résumé
This lecture from Allan Di Donato's Critical Thinking course examines how to evaluate empirical probability, the first of several videos on certainty and probability in inductive reasoning.
Ce cours d’Allan Di Donato examine comment évaluer la probabilité empirique ; c’est la première de plusieurs vidéos consacrées à la certitude et à la probabilité dans le raisonnement inductif.
What Empirical Probability Means
Ce qu’est la probabilité empirique
Empirical probability is the examination of empirical evidence to determine the probable conclusion in an inductive situation. Empirical means derived from or relying upon experience or observation. Probability is the likelihood that something is the case: a claim supported by evidence strong enough to establish a presumption, but not necessarily proof. To evaluate an inductive argument built on empirical data, Di Donato proposes four considerations: extension, the nature of the situation, the manner of procedure, and our background knowledge.
La probabilité empirique consiste à examiner des preuves empiriques pour déterminer la conclusion probable dans une situation inductive. Empirique signifie tiré de l’expérience ou de l’observation, ou fondé sur elles. La probabilité est la vraisemblance qu’une chose soit le cas : une affirmation appuyée par des preuves assez fortes pour établir une présomption, mais pas nécessairement une démonstration. Pour évaluer un argument inductif bâti sur des données empiriques, Di Donato propose quatre considérations : l’étendue, la nature de la situation, la manière de procéder et nos connaissances de fond.
Extension and the Nature of the Situation
L’étendue et la nature de la situation
Extension asks how many cases are examined, that is, how broad the sample is. The more cases, the stronger the induction. A presidential approval rating based on 20,000 people is far more reliable than one based on 20.
L’étendue demande combien de cas ont été examinés, c’est-à-dire quelle est l’ampleur de l’échantillon. Plus il y a de cas, plus l’induction est forte. Une cote de popularité présidentielle établie sur 20 000 personnes est bien plus fiable que celle qui repose sur 20.
The nature of the situation asks how representative the evidence is, that is, how closely the testing environment mirrors the real world. If the 20,000 polled were all Republicans, or if the urban/rural split did not match the actual population, the results would be skewed.
La nature de la situation demande à quel point les preuves sont représentatives, c’est-à-dire dans quelle mesure les conditions de l’enquête reflètent le monde réel. Si les 20 000 sondés étaient tous républicains, ou si la répartition ville/campagne ne correspondait pas à la population réelle, les résultats seraient faussés.
These two factors work together. To estimate daily red-meat consumption by the average American, polling every citizen would be the most accurate (a possible complete induction) but is impractical; a sample is less accurate in principle yet far more workable. Who you sample also matters: people leaving a butcher shop would lead to an overestimate, residents of San Francisco to an underestimate, while a random selection from across the country offers the best chance of a true cross-section.
Ces deux facteurs jouent ensemble. Pour estimer la consommation quotidienne de viande rouge de l’Américain moyen, interroger chaque citoyen serait le plus exact (une induction complète possible) mais irréalisable ; un échantillon est en principe moins exact, mais bien plus praticable. Le choix des sondés compte aussi : interroger les gens à la sortie d’une boucherie conduirait à une surestimation, des habitants de San Francisco à une sous-estimation, tandis qu’une sélection aléatoire à l’échelle du pays offre les meilleures chances d’obtenir un échantillon véritablement représentatif.
Sample Size, Bias, and Margin of Error
Taille de l’échantillon, biais et marge d’erreur
Larger samples yield better inductions, but acquiring data gets harder. Of 200, 1,500, or 20,000 people, 1,500 is the practical "sweet spot." Whatever the size, the goal is to avoid a biased sample, one that fails to represent the target in some relevant way. The difficulty is that you do not always know in advance which features are relevant (educational level might matter for studying cat burglars; handedness or hair color probably would not). Bias is best avoided through a random sample, in which every member of the population has an equal chance of being selected, and a varied sample, which contains variety among its members.
Les grands échantillons donnent de meilleures inductions, mais recueillir les données devient plus difficile. Entre 200, 1 500 et 20 000 personnes, 1 500 constitue l’optimum pratique. Quelle que soit la taille, l’objectif est d’éviter un échantillon biaisé, c’est-à-dire qui ne représente pas la cible sous un rapport pertinent. La difficulté est qu’on ne sait pas toujours d’avance quels traits sont pertinents (le niveau d’instruction pourrait compter pour étudier les cambrioleurs, la latéralité ou la couleur des cheveux sans doute pas). On évite au mieux le biais par un échantillon aléatoire, où chaque membre de la population a une chance égale d’être retenu, et par un échantillon varié, qui comporte de la diversité parmi ses membres.
Because selection is random, no sample is guaranteed to be perfectly representative. The range of random variation between samples is the margin of error: larger samples produce a smaller margin. The related idea of confidence level is the probability that the margin of error is accurate. As sample size grows, the margin of error shrinks, but with diminishing returns. The decline is steep up to about 1,200–1,500, after which the curve flattens and the margin is already below the 3% mark. Pushing much below 3% is generally not worth the added cost and effort.
Parce que la sélection est aléatoire, aucun échantillon n’est garanti parfaitement représentatif. L’amplitude de la variation aléatoire d’un échantillon à l’autre est la marge d’erreur : plus l’échantillon est grand, plus la marge est faible. La notion voisine de niveau de confiance désigne la probabilité que la marge d’erreur soit exacte. À mesure que l’échantillon grandit, la marge d’erreur diminue, mais avec des rendements décroissants. La baisse est marquée jusqu’à environ 1 200–1 500, après quoi la courbe s’aplatit et la marge est déjà passée sous la barre des 3 %. Descendre nettement en dessous de 3 % ne vaut généralement pas le surcroît de coût et d’efforts.
Manner of Procedure and Background Knowledge
Manière de procéder et connaissances de fond
Manner of procedure asks how the evidence was gathered and examined: How many similarities and differences were studied? Were all explanations and all the data considered? Was there a control group? In a polling scenario, were all respondents asked the same question, was the wording neutral, and were all responses counted equally?
La manière de procéder demande comment les preuves ont été recueillies et examinées : combien de ressemblances et de différences ont été étudiées ? Toutes les explications et toutes les données ont-elles été prises en compte ? Y avait-il un groupe témoin ? Dans un sondage : tous les répondants ont-ils reçu la même question, la formulation était-elle neutre, toutes les réponses ont-elles été comptées à égalité ?
New data must also be weighed against our background knowledge. Does it contradict what we believe, or does it enable a better explanation than before? The historical example is the observed redshift of distant stars: it conflicted with the steady-state model of the universe and ultimately led scientists to adopt the expanding-universe model.
Les données nouvelles doivent aussi être soupesées à l’aune de nos connaissances de fond. Contredisent-elles ce que nous croyons, ou permettent-elles une meilleure explication qu’auparavant ? L’exemple historique est le décalage vers le rouge observé sur les étoiles lointaines : il entrait en conflit avec le modèle d’un univers stationnaire et a finalement conduit les scientifiques à adopter le modèle d’un univers en expansion.
Applied to red meat and colon cancer, the four study designs each carry trade-offs. A random sample of the general population rarely captures enough cancer cases; a sample of meat-eaters lacks a non-meat-eating control; a sample of cancer patients can overestimate the link because we ignore the many meat-eaters who never get cancer; and a long-term observational study of meat-eaters captures future cases but omits non-eaters unless designed in.
Appliqués à la viande rouge et au cancer colorectal, les quatre protocoles d’étude comportent chacun des compromis. Un échantillon aléatoire de la population générale contient rarement assez de cas de cancer ; un échantillon de mangeurs de viande n’offre pas de groupe témoin non consommateur ; un échantillon de patients atteints de cancer peut surestimer le lien, car on néglige les nombreux mangeurs de viande qui ne développent jamais de cancer ; et une étude d’observation de longue durée portant sur des mangeurs de viande capte les cas à venir mais laisse de côté les non-consommateurs, sauf si le protocole les inclut.
Correlation Is Not Causation
Corrélation n’est pas causalité
Even when an observational study reveals an apparent pattern, correlation is not causation. A correlation has many possible explanations: a shared deficiency could drive both the craving and the risk, or confounding lifestyle factors (less fiber, less exercise, other unhealthy foods) could be the real cause. Establishing causation requires more than observation; it requires the experimental method (and Mill's methods), topics for later videos.
Même lorsqu’une étude d’observation révèle un schéma apparent, corrélation n’est pas causalité. Une corrélation admet de nombreuses explications possibles : une carence commune pourrait alimenter à la fois l’envie et le risque, ou des facteurs de mode de vie confondants (moins de fibres, moins d’exercice, d’autres aliments malsains) pourraient être la véritable cause. Établir une causalité exige davantage que l’observation : il y faut la méthode expérimentale (et les méthodes de Mill), sujets des vidéos suivantes.
Related Fallacies
Les sophismes associés
Di Donato closes with fallacies tied to empirical reasoning:
Di Donato termine par les sophismes liés au raisonnement empirique :
- Biased generalization: a sample large enough yet still unrepresentative of the target.
- Hasty generalization: an overconfident conclusion drawn from too small a sample ("these 10 movies are poorly written, so most movies are" is weaker than concluding "some are").
- Anecdotal evidence: a hasty generalization built on one or two persuasive stories; effectively a sample of one or two.
- Self-selection fallacy: overestimating a conclusion from a self-selected sample (e.g., a website or call-in poll) that over-represents the strongly motivated.
- Slanted question: wording chosen to elicit a particular response (asking about "protection from dangerous second-hand smoke" versus "infringing on a citizen's right to smoke").
- Weak analogy: an argument by analogy that breaks down on too many points.
- Vague generalities: statements too vague to be meaningful, where the group or attribute is so loosely defined that membership cannot be judged; remedied by a sampling frame or precising definition.
- La généralisation biaisée : un échantillon assez grand, mais qui reste non représentatif de la cible.
- La généralisation hâtive : une conclusion trop assurée tirée d’un échantillon trop petit (« ces 10 films sont mal écrits, donc la plupart des films le sont » est plus faible que conclure que « certains le sont »).
- La preuve anecdotique : une généralisation hâtive bâtie sur une ou deux histoires convaincantes ; en somme un échantillon d’un ou deux cas.
- Le sophisme d’auto-sélection : surestimer une conclusion tirée d’un échantillon auto-sélectionné (un sondage en ligne ou par téléphone, par exemple) qui sur-représente les plus motivés.
- La question orientée : une formulation choisie pour susciter une réponse déterminée (interroger sur la « protection contre le tabagisme passif dangereux » ou sur l’« atteinte au droit du citoyen à fumer »).
- L’analogie faible : un argument par analogie qui se rompt sur trop de points.
- Les généralités vagues : des énoncés trop vagues pour avoir un sens, où le groupe ou l’attribut est défini si lâchement qu’on ne peut juger de l’appartenance ; on y remédie par une base de sondage ou une définition précisante.
The next video turns from inductive probability to certainty, comparing inductive certainty with other kinds.
La vidéo suivante passe de la probabilité inductive à la certitude, en comparant la certitude inductive à d’autres formes de certitude.