Comment les chiffres qui se détachent sont choisis

La page d’une commune peut montrer les chiffres où elle s’écarte le plus des autres, avec ses communes voisines et 2014 à côté de chacun. Voici comment ils sont choisis et d’où vient chaque nombre. Aucun modèle de langage n’en écrit un mot.

Ce qui se détache

Une commune de 5 000 habitants ou plus se détache quand elle figure parmi les 1 % les plus hauts ou les plus bas de ces communes pour une mesure. Une unité se détache quand son évolution depuis 2014 s’écarte d’au moins 3 écarts-types de l’évolution moyenne de son niveau, pour un niveau d’au moins 10 unités et une mesure que le recensement de 2014 posait de la même façon. Une commune ou une province se détache aussi quand son écart au chiffre de sa province ou de sa région s’éloigne d’au moins 3 écarts-types de l’écart moyen sous ce même parent, quand celui-ci compte au moins 8 unités. Les évolutions et les écarts ne comptent que pour les communes de 2 000 habitants ou plus, où quelques ménages ne peuvent pas faire basculer une part à eux seuls.

Chaque mesure est un taux, une part ou une moyenne, car un simple effectif ferait ressortir un grand lieu parce qu’il est grand. Une commune rapprochée de 2014 par la table de correspondance n’a pas d’évolution à comparer, car son chiffre de 2014 couvre un autre territoire. Les 300 chiffres qui se détachent le plus sont gardés, 3 au plus pour un même lieu. Seuls ceux des communes sont publiés, car c’est sur la page d’une commune qu’ils apparaissent.

Ce qui est écarté

Une erreur possible dans les données est écartée. Les langues parlées, lues et écrites, le niveau d’études et l’analphabétisme évoluent lentement. Quand l’un d’eux bascule dans un lieu dont la population a bougé de moins de 10 %, et qu’aucune voisine n’a bougé dans le même sens d’au moins la moitié, le chiffre est peut-être une erreur dans les données. C’est aussi le cas de chaque chiffre d’un enregistrement qui ne peut pas être juste, comme plus de 8 personnes par pièce ou un ménage de plus de 15 personnes.

L’est aussi une commune dont un chiffre ne concorde pas entre les deux recensements. Pour une langue locale, c’est une part qui a bougé de plus de 30 points entre 2014 et 2024, dans un sens ou dans l’autre. Pour l’eau courante, l’électricité, le réseau public d’assainissement, les toilettes et la cuisine, c’est une part qui a baissé de plus de 30 points. Dans les deux cas, l’écart doit dépasser la variation de la population elle-même, en pourcentage. Les deux chiffres sont ceux du HCP, tels que publiés. Les deux recensements ne concordent pas, donc la commune n’est comparée à aucune voisine, et elle n’a pas de section ici.

Les parts d’hommes et de femmes sont écartées aussi, car plusieurs communes du Sud comptent des populations particulières. Quand une liste de termes privés est en place, un chiffre dont la phrase en emploie un est retenu.

Ce qui accompagne chaque chiffre

Les autres chiffres de la commune. Les chiffres d’une commune qui se détachent sont montrés ensemble, et la fiche de chacun dans l’API cite les autres.

Ses communes voisines. Deux communes sont voisines quand leurs limites dans OpenStreetMap partagent un segment. À côté de chaque chiffre figurent la médiane du même chiffre dans ces communes, et celle qui s’écarte le plus du chiffre de la commune. Une voisine de moins de 2 000 habitants est laissée de côté, comme une voisine dont un chiffre ne concorde pas entre les deux recensements. Pour une évolution depuis 2014, c’est leur évolution qui est comparée, et une voisine rapprochée de 2014 par la table de correspondance est laissée de côté.

2014 et le Maroc. Quand le recensement de 2014 posait la question de la même façon, la page donne le chiffre de la commune en 2014 et l’évolution de celui du Maroc, en points entiers pour une part. Pas pour une commune rapprochée par la table de correspondance.

Aucun modèle

Chaque phrase est une phrase fixe, en anglais et en français, où les nombres viennent se placer, et chaque nombre est celui du HCP ou en est calculé. pnpm insights construit tout à partir du jeu de données, sans modèle ni appel réseau, et le même jeu de données donne toujours les mêmes fichiers.

La version précédente

Une version précédente demandait à un modèle de langage de proposer des raisons possibles pour chaque chiffre, et à un second modèle de les contester. Le pilote de 2026 qui a choisi ses modèles est publié comme une étude, avec son préenregistrement, ses notes et ses résultats, dans insights/pilot/. Le passage complet qui a suivi a laissé près de la moitié des chiffres sans raison qui tienne, et la solidité d’une raison ne pouvait pas être notée de façon fiable. Cette version montre donc les chiffres avec leur contexte.

Où tout se trouve

Le pipeline est dans insights/, et ce qu’il publie est dans data/v1/insights/.