Quels sont les articles centraux de l'organisation de Wikipédia ?
Question d'origine :
Bonjour,
J'aimerai me renseigner sur la manière dont est organisé le savoir sur Wikipédia. C'est à dire si on crée un graphe de tous les articles Wikipédia et de leurs connexions entre eux, quel sont les articles centraux (il me semble que ce sont les notions philosophiques), quels sont les catégories d'articles les plus représentées, et qu'est ce que cela dit sur nous, sur la manière dont nous organisons le savoir.
Merci beaucoup cher guichet :)
Réponse du Guichet
Les bases de données en ligne comme WikiRank montrent que les articles les plus centraux du Wikipedia anglophone sont généralement des pays, des événements historiques et des institutions, indépendamment des critères de classement appliqués. Pour autant, votre intuition était bonne puisqu'un bien connu révèle que la plupart des chaînes de liens finissent par converger comme par magie vers l’article "Philosophy" !
Bonjour,
Votre question porte sur l'architecture de la plus grande encyclopédie au monde, Wikpedia et ses 60 millions d'articles écrits dans plus de 300 langues ! Vous vous intéressez plus spécifiquement aux liens hypertextes qui permettent de naviguer d'un article à l'autre, et souhaiteriez repérer les articles "centraux", à savoir ceux vers lesquels les millions d'articles convergent le plus. Vous supposez que l'architecture de l'encyclopédie est structurée autour de notions philosophiques et que des concepts très généraux occupent une place centrale dans la manière dont Wikipédia organise le savoir.
Les barrières linguistiques et culturelles, et la quantité de données qu'il faudrait traiter pour obtenir une vision exhaustive, empêchent de porter un diagnostic global sur l'ensemble des pages du site. À défaut, vous conviendrez qu’une étude focalisée uniquement sur les pages anglophones fournit déjà une grille de lecture convaincante pour en comprendre l'organisation.
Ainsi, le site Wikirank, réalisé par le Laboratoire d'algorithmes Web de l'Université de Milan est surement l'outil le mieux dimensionné pour répondre à votre question. Les chercheurs Paolo Boldi, Flavio Furia et Sebastiano Vigna, ont participé à sa création. Ils en racontent l'histoire dans Ten Years of Open Wikipedia Ranking (2025), expliquant les objectifs ayant présidé à sa création tout en fournissant des premières conclusions intéressantes (nous y reviendrons).
The Open Wikipedia Ranking is a ten-year effort to generate entirely reproducible ranking data for the English version of Wikipedia for research purposes. The dataset is made of two parts: a reproducible construction of Wikipedia graphs, and four reproducible rankings of such graphs based on some popular centrality measures (indegree, harmonic centrality, and PageRank) and aggregated page views. The dataset has been archived on Zenodo with DOI 10.5281/zenodo.14810970.
The goal of this effort is to provide open-source software for each step of the construction, starting from a standard Wikipedia dump (downloaded in April each year) and page views for the previous year. Our goal is that every derived element of the dataset (graphs,rankings, and page views) can be reproduced locally by everybody.
The recent ACM survey on reproducibility [8] highlighted several problems in the current scientific literature. The main motivation for the Open Wikipedia Ranking is to provide an open, reproducible foundation for ranking research.
A few papers (e.g., [6, 7, 11, 13]) have used initial data from the Open Wikipedia Ranking: after ten years of gathering, the dataset is mature for general consumption, and medium-term trends can by now be observed.
(...)
Le classement « Open Wikipedia Ranking » est un projet mené depuis dix ans visant à générer des données de classement entièrement reproductibles pour la version anglaise de Wikipédia à des fins de recherche. L'ensemble de données se compose de deux parties : une construction reproductible des graphes de Wikipédia, et quatre classements reproductibles de ces graphes basés sur certaines mesures de centralité courantes (degré d'entrée, centralité harmonique et PageRank) ainsi que sur le nombre cumulé de pages vues. L'ensemble de données a été archivé sur Zenodo sous le DOI 10.5281/zenodo.14810970.
L'objectif de ce projet est de fournir des logiciels open source pour chaque étape de la construction, à partir d'un dump standard de Wikipédia (téléchargé chaque année en avril) et des consultations de pages de l'année précédente. Notre objectif est que chaque élément dérivé de l’ensemble de données (graphes, classements et nombre de pages vues) puisse être reproduit localement par tout un chacun.
La récente enquête de l’ACM sur la reproductibilité [8] a mis en évidence plusieurs problèmes dans la littérature scientifique actuelle. La principale motivation du classement Open Wikipedia Ranking est de fournir une base ouverte et reproductible pour la recherche sur les classements.
Quelques articles (par exemple [6, 7, 11, 13]) ont utilisé les données initiales de l’Open Wikipedia Ranking : après dix ans de collecte, le jeu de données est suffisamment mûr pour être utilisé par tous, et des tendances à moyen terme peuvent désormais être observées.
Traduit avec DeepL.com (version gratuite)
Source : Ten Years of Open Wikipedia Ranking Paolo Boldi, Flavio Furia et Sebastiano Vigna, Université de Milan (2025)
Utilisant les mises à jour hebdomadaires de Wikidata, le site propose des classements des pages anglophones de Wikipedia triées selon plusieurs concepts clés : le classement par "centralité harmonique", le "Indegree", le "Page Rank" et enfin le classement par nombre de vues. Ils répondent à des critères bien différents, éclairant chacun à leur manière les modes d'organisation du savoir humain de l'encyclopédie, tout comme les pratiques numériques et les centres d'intérêts de ses millions d'utilisateurs. Leur page "A propos" nous explique comment chacun de ces classements a été conçu :
Centralité harmonique
Le classement par défaut que nous vous affichons est basé sur la centralité harmonique . Si vous le souhaitez, vous pouvez consulter sa définition sur Wikipédia. Mais nous pouvons vous l'expliquer simplement.
Supposons que votre page soit FooBar. Votre score de centralité harmonique correspond, pour commencer, au nombre de pages contenant un lien vers FooBar. On les appelle pages à la distance 1. Supposons qu'il y ait 50 de ces pages : votre score est maintenant de 50.
Il y aura également des pages contenant un lien vers des pages qui contiennent elles-mêmes un lien vers FooBar. Mais elles ne sont pas à la distance 1. On les appelle pages à la distance 2. Supposons qu'il y en ait 80 : elles sont moins importantes qu'avant ; on leur attribue un demi-point. Vous obtenez donc 40 points supplémentaires et votre score est maintenant de 90.
On peut continuer : il y aura aussi des pages contenant un lien vers des pages qui contiennent un lien vers des pages qui contiennent un lien vers FooBar, mais elles ne sont pas à une distance de un ou deux. On les appelle des pages à distance trois. Supposons qu'il y ait 100 pages de ce type : comme vous pouvez le deviner, nous leur attribuerons un tiers de point. Vous obtenez donc 33,333… points de plus et votre score est maintenant de 123,333….
Vous faites cela pour chaque site qui peut accéder à FooBar. Il suffit de suivre les liens pour obtenir votre score de centralité harmonique. Nous disposons d'un logiciel capable d'approximer la centralité harmonique pour des graphes de très grande taille.
Indegree et PageRank
Puisque nous aimons avoir le choix, nous vous laissons explorer d'autres classements. Le classement par degré entrant signifie simplement que votre score correspond au nombre de pages contenant un lien vers votre site : plus vous avez de liens, meilleur est votre classement. C'est comme interrompre le calcul de la centralité harmonique dès le départ.
Le PageRank est une mesure de centralité bien connue qui comptabilise le nombre de chemins possibles pour accéder à votre site depuis n'importe quel autre site web. La définition du PageRank apparaît dans le premier article consacré à Google. Il a été calculé à l'aide de la bibliothèque LAW .
Vous trouverez une discussion très détaillée et accessible de tous ces indices dans cet article .
Pages vues
C'est simple : le nombre de pages vues au cours de l'année écoulée. Suivez les tendances du moment !
Page traduite avec l'outil de traduction intégré Google.
Source : How does it work? - The Open Wikipedia Ranking 2026 - Laboratory for Web Algorithmics of the Università degli Studi di Milan.
Nous vous laissons donc choisir le classement qui vous sied le mieux ou qui vous semble le plus pertinent. Mais selon nous le concept de centralité harmonique et son calcul de référencement en degrés ou en cercles, pourrait offir une réponse intéressante. Pour affiner davantage, sachez que le site permet de filtrer la recherche par domaine et d'obtenir les listes ultimes (au regard des 4 critères susmentionnés) dans des catégories extrêment variées : Villes, chanteurs et chanteuses Pop, romans, films, séries, humains etc.
Voici donc la liste des articles les plus centraux du Wikipedia anglophone en 2026 selon Wikirank :
0. World War II
2. World War I
6. Köppen climate classification
7. France
8. China
10. London
11. Germany
12. COVID-19 pandemic1
13. India
14. Canada
15. Europe
16. Latin
17. Australia
18. Soviet Union
19. European Union
20. Italy
22. Islam
23. United Nations
24. Middle Ages
25. Protestantism
26. UNESCO
28. Japan
29. English language
30. Russia
31. Christianity
32. Los Angeles
33. Philippines
34. Paris
35. Netherlands
36. Spain
37. Washington, D.C.
38. North America
39. Cold War
40. England
41. Basketball
43. Nazi Germany
44. California
45. Mexico
46. Great Depression
47. British Empire
48. Chicago
49. Roman Empire
Les conclusions que l'on peut tirer sont multiples. D'abord, il semblerait que nous puissions réfuter l'affirmation selon laquelle les concepts généraux d'ordre philosophique constitueraient la colonne vertébrale de Wikipedia. Ces classements révèlent que la centralité harmonique de l'encyclopédie s'opère plutôt autour d'événements historiques, de pays et de villes, d'organisations internationales, ou encore des grands monothéismes. Le classement Indegree, (calculé en fonction du nombre de page contenant un lien vers une autre page de référence), s'articule autour des mêmes notions auxquelles s'ajoutent toutefois des éléments de biologie et de génétique, de sport ou de références de culture populaire (comme le magazine Billboard ou la base de données musicale Allmusic). Les pages les plus vues de l'années sont quand à elles tributaires des événements et des grandes tendances du monde, à l'exception de la page d'accueil du site, qui reste, et de loin, la page la plus consultée de l'encyclopédie.
Ces conclusions sont partagées par les chercheurs Paolo Boldi, Flavio Furia et Sebastiano Vigna :
As it can be seen from Figures 1 and 2, the most central pages of Wikipedia are predominantly those that are related to countries, and historical events. There are some interesting exceptions, like “Association football” (i.e., soccer) which is ranked first since 2022, according to indegree, and third since 2020, according to harmonic centrality. Unsurprisingly, the page-views ranking is much more unstable among the years, as it is largely affected by events and trends, that might arise and fall off relatively fast. Also in this case there are exceptions, e.g., the Wikipedia “Main Page”, which is always the most viewed page.
(...)
Comme le montrent les figures 1 et 2, les pages les plus centrales de Wikipédia sont principalement celles qui concernent les pays et les événements historiques. Il existe toutefois quelques exceptions intéressantes, comme « Association football » (c'est-à-dire le football), qui occupe la première place depuis 2022 selon l'indice d'entrée (indegree) et la troisième place depuis 2020 selon la centralité harmonique. Sans surprise, le classement en nombre de pages vues est beaucoup plus instable d’une année à l’autre, car il est largement influencé par des événements et des tendances qui peuvent apparaître et disparaître relativement rapidement. Là encore, il existe des exceptions, comme la « Page d’accueil » de Wikipédia, qui reste toujours la page la plus consultée.
Traduit avec DeepL.com (version gratuite)
Source : How does it work? - The Open Wikipedia Ranking 2026 - Laboratory for Web Algorithmics of the Università degli Studi di Milan.
Néanmoins, votre intuition sur la philosophie n'est pas sans rappeler un phénomène curieux qui mérite d'être évoqué. Dans un article intitulé All Paths Lead to Philosophy, Dmitriy Brezhnev, Stephen Trushiem et Vikas Yendluri (2013) abordent le "Philosophy game" de Wikipédia, un jeu bien connu qui présume qu'en cliquant systématiquement sur le premier lien hypertexte du corps du texte d'un article (en excluant les liens entre parenthèses, en italique, dans les infobox ou les notes), et en répétant l’opération sur chaque nouvelle page, on aboutit à un moment ou à un autre sur l'article Philosophy (nous avons essayé, cela fonctionne).
Mais attention aux erreurs d'interprétation. Il ne faut pas comprendre ici que la plupart des pages pointent vers "Philsophy", mais que des chaînes successives de liens finissent par y mener via tout un tas d'articles intermédiaires. Il faut dire que le premier lien qui apparait dans un article est souvent très généraliste. Suivant les règles de l'abstraction, nous finissons par remonter jusqu'aux structures les plus élémentaires de la pensée et du langage. "Philosophy" est donc un point de convergence incontournable dans un parcours contraint de clics, mais il ne génère pas assez de liens entrant (Indegree) et il faut souvent beaucoup de clics pour y parvenir, l'écartant de fait des plus hautes places sur Wikirank.
Si les précédentes recherches indiquaient que 95% des pages menaient par ce biais à la page Philosophy, l'étude All Paths Lead to Philosophy tempère donnant le chiffre de 76%. Voici un graphe qui illustre ce procédé à partir de pages de départ très différentes :

Source : Getting to Philosophy graph of Wikipedia articles by Pine
Pour plus de statistiques, nous vous invitons à vous référer à la page Wikipédia : Statistiques. Les pages les plus liées du Wikipédia francophone sont par exemple répertoriées. Les statistiques de Wikimedia fournissent aussi toutes sortes de données sur l'encyclopédie en ligne.
Un ingénieur informatique du nom de Kanishk Sachdev s'est lui aussi amusé à mettre en graphe l'ensemble du Wikipedia anglophone. Il relate son expérience et donne ses conclusions sur son site internet : Weekend Project: Turning Wikipedia Into a Giant Network Graph.
Pour aller plus loin :
WikiLinkGraphs: A complete, longitudinal and multi-language dataset of the Wikipedia link networks de Cristian Consonni, David Laniado et Alberto Montresor (2019).
Connecting every bit of knowledge: The structure of Wikipedia's First Link Network de Mark Ibrahim, Christopher M. Danforth, Peter Sheridan Dodds (2017)
The most influential philosophers in Wikipedia: a multicultural analysis de Guillaume Rollin & José Lages (2025)
Bonne journée.
DANS NOS COLLECTIONS :
Ça pourrait vous intéresser :
Où trouver des descriptions d'images de tableaux et...
Tout comprendre (ou presque) sur l’intelligence artificielle.
Tout comprendre (ou presque) sur l’intelligence artificielle.