Skoro źródła stanowią fundament weryfikowalności Wikipedii, zasadne jest pytanie: które witryny internetowe mają największe znaczenie w strukturze jej odwołań źródłowych? W tym celu przeprowadzono analizę przypisów zamieszczonych w dziesiątkach milionów artykułów Wikipedii w różnych językach.

Analizę oparto na danych według stanu na lipiec 2026 roku. Zbiór obejmował ponad 400 milionów przypisów (referencji bibliograficznych) zamieszczonych w około 68 milionach artykułów z ponad 300 wersji językowych Wikipedii.

Ranking uwzględnia nie tylko częstotliwość występowania poszczególnych witryn internetowych w przypisach Wikipedii, lecz także popularność artykułów, w których te przypisy się pojawiają. Popularność artykułów jest mierzona na podstawie łącznej liczby odsłon z poprzednich 12 miesięcy.

Obejrzyj pełny film:

Definicja witryny internetowej

W tej analizie witryna internetowa oznacza zidentyfikowany serwis internetowy, a nie wyłącznie pojedynczą nazwę hosta czy domeny internetowej. Przykładowo serwisy działające pod adresami news.google.com oraz books.google.com są rozpatrywane oddzielnie od wyszukiwarki dostępnej pod adresem google.com, mimo że wszystkie należą do tej samej domeny rejestrowalnej google.com. Inny przykład: witryny ue.poznan.pl oraz poznan.pl rozpatrywane są osobno.

Warto dodać, że z analizy wykluczono odwołania prowadzące do stron w domenie wikipedia.org, ponieważ artykuły Wikipedii co do zasady nie są uznawane za odpowiednie źródła informacji dla innych artykułów Wikipedii.

Artykuły Wikipedii uwzględnione w obliczeniach

Niech 𝒜ref oznacza zbiór artykułów Wikipedii zawierających co najmniej jedną referencję:

Aref={aARa>0}

Artykuły niezawierające żadnych referencji nie są uwzględniane we wzorze. Dzięki temu całkowita liczba referencji w każdym analizowanym artykule jest większa od zera, a mianownik występujący we wzorze jest zawsze określony.

Ważenie odsłonami

Każda witryna jest oceniana za pomocą wskaźnika PWRS (z ang. Pageview-Weighted Reference Score), czyli wyniku referencji ważonego liczbą odsłon. Dla witryny w wynik jest obliczany według następującego wzoru:

PWRS(w)=aAref(PaRa,wRa)

gdzie:

  • w – analizowana witryna internetowa;
  • a – pojedynczy artykuł Wikipedii;
  • 𝒜 – zbiór wszystkich artykułów Wikipedii objętych analizą;
  • 𝒜ref – zbiór artykułów zawierających co najmniej jedną referencję;
  • Pa – łączna liczba odsłon artykułu a w ciągu poprzednich 12 miesięcy;
  • Ra – całkowita liczba referencji znajdujących się w artykule a;
  • Ra,w – liczba referencji znajdujących się w artykule a, które prowadzą do witryny w;
  • PWRS(w) – końcowy wynik Pageview-Weighted Reference Score przypisany witrynie w.

Uczciwa popularność: filtrowanie i korekta danych o odsłonach

W obliczeniach uwzględniono wyłącznie odsłony sklasyfikowane w danych Wikimedia jako pochodzące od użytkowników (agent = user), zgodnie z przyjętą przez Wikimedia definicją odsłony strony, której celem jest oddzielenie ruchu użytkowników od rozpoznanego ruchu automatycznego (botów, np. robotów internetowych). Klasyfikacja ta nie eliminuje jednak wszystkich przypadków ruchu anomalnego lub nieodzwierciedlającego rzeczywistego zainteresowania czytelników. Przykładem jest nietypowo wysoka popularność artykułu o Kleopatrze, wiązana z domyślną sugestią wyszukiwania głosowego w urządzeniach korzystających z Asystenta Google, opisana w serwisie Inverse. Wikimedia Foundation również wskazała, że wyjątkowo wysoka liczba odsłon tego artykułu nie odzwierciedlała rzeczywistego zainteresowania czytelników, dlatego przy tworzeniu zestawienia najpopularniejszych artykułów z 2024 roku stosowała dodatkową kontrolę obejmującą między innymi udział odsłon z komputerów oraz liczbę odsłon bez informacji o stronie odsyłającej. Z tego względu w niniejszej analizie zastosowano dodatkowe procedury służące identyfikowaniu anomalnie wysokich wartości oraz ich korekcie, polegającej zazwyczaj na obniżeniu liczby odsłon. Podejście to jest zbliżone koncepcyjnie do mechanizmu „uczciwej popularności” stosowanego w serwisie WikiRank od 2020 roku. W konsekwencji wartość Pa we wzorze PWRS oznacza skorygowaną łączną liczbę odsłon artykułu a, sklasyfikowanych jako pochodzące od użytkowników, do której następnie zastosowano pierwiastek kwadratowy.

Sposób interpretacji wyniku

Dla każdego artykułu Wikipedii liczba referencji prowadzących do określonej witryny jest mnożona przez pierwiastek kwadratowy z liczby odsłon tego artykułu, a następnie dzielona przez całkowitą liczbę referencji znajdujących się w artykule. Tak obliczone wartości są następnie sumowane dla wszystkich artykułów spełniających warunki analizy.

Uwzględnienie liczby odsłon sprawia, że przypisy znajdujące się w popularniejszych artykułach otrzymują większą wagę. Zastosowanie pierwiastka kwadratowego ogranicza natomiast nieproporcjonalnie duży wpływ artykułów o wyjątkowo wysokiej liczbie odsłon.

Dzielenie przez całkowitą liczbę referencji w artykule pozwala również uwzględnić widoczność poszczególnych źródeł. Referencja występująca w artykule zawierającym niewiele przypisów otrzymuje większą wagę niż taka sama referencja znajdująca się w bardzo obszernej liście przypisów.

Otrzymany ranking mierzy znaczenie i widoczność witryn w ekosystemie referencji Wikipedii zgodnie z przedstawionym modelem. Nie należy go interpretować jako bezpośredniej oceny prawdziwości, wiarygodności ani jakości redakcyjnej poszczególnych witryn.

Top 25 witryn internetowych

W każdej wersji językowej Wikipedii obliczono wartości wskaźnika PWRS dla poszczególnych witryn internetowych. W poniższych sekcjach przedstawiono rankingi 25 witryn o najwyższych wartościach PWRS dla każdej z 28 wybranych wersji językowych. Do analizy włączono wersje, które według stanu na lipiec 2026 roku liczyły co najmniej 500 tysięcy artykułów i osiągały wskaźnik głębokości edycyjnej wynoszący co najmniej 10 (aktualne statystyki są dostępne na stronie meta.wikimedia.org).

Wielojęzyczna Wikipedia (67,9 miliona artykułów)

  1. web.archive.org
  2. doi.org
  3. books.google.com
  4. worldcat.org
  5. nih.gov
  6. archive.org
  7. nytimes.com
  8. geonames.org
  9. catalogueoflife.org
  10. wikidata.org
  11. bbc.co.uk
  12. nasa.gov
  13. youtube.com
  14. adsabs.harvard.edu
  15. semanticscholar.org
  16. theguardian.com
  17. insee.fr
  18. census.gov
  19. deadline.com
  20. billboard.com
  21. variety.com
  22. imdb.com
  23. jstor.org
  24. newspapers.com
  25. webcitation.org

Rozszerzoną wersję więlojęzycznego rankingu przedstawia ten filmik.

Angielska Wikipedia (7,2 miliona artykułów)

  1. web.archive.org
  2. doi.org
  3. books.google.com
  4. worldcat.org
  5. nih.gov
  6. archive.org
  7. nytimes.com
  8. semanticscholar.org
  9. adsabs.harvard.edu
  10. bbc.co.uk
  11. theguardian.com
  12. newspapers.com
  13. billboard.com
  14. youtube.com
  15. jstor.org
  16. deadline.com
  17. variety.com
  18. census.gov
  19. indiatimes.com
  20. allmusic.com
  21. latimes.com
  22. hollywoodreporter.com
  23. bbc.com
  24. washingtonpost.com
  25. espn.com

Niemiecka Wikipedia (3,1 miliona artykułów)

  1. web.archive.org
  2. redirecter.toolforge.org
  3. doi.org
  4. books.google.de
  5. zdb-katalog.de
  6. spiegel.de
  7. nih.gov
  8. youtube.com
  9. imdb.com
  10. sueddeutsche.de
  11. welt.de
  12. faz.net
  13. archive.li
  14. zeit.de
  15. nytimes.com
  16. offiziellecharts.de
  17. orf.at
  18. filmdienst.de
  19. archive.today
  20. archive.org
  21. europa.eu
  22. theguardian.com
  23. digitale-sammlungen.de
  24. hitparade.ch
  25. bayern.de

Francuska Wikipedia (2,8 miliona artykułów)

  1. insee.fr
  2. web.archive.org
  3. doi.org
  4. issn.org
  5. lemonde.fr
  6. bnf.fr
  7. wikiwix.com
  8. books.google.com
  9. books.google.fr
  10. lefigaro.fr
  11. nih.gov
  12. googleusercontent.com
  13. lequipe.fr
  14. culture.gouv.fr
  15. worldcat.org
  16. legifrance.gouv.fr
  17. imdb.com
  18. liberation.fr
  19. leparisien.fr
  20. allocine.fr
  21. youtube.com
  22. nasa.gov
  23. ouest-france.fr
  24. francetvinfo.fr
  25. nytimes.com

Szwedzka Wikipedia (2,6 miliona artykułów)

  1. catalogueoflife.org
  2. web.archive.org
  3. geonames.org
  4. kb.se
  5. nasa.gov
  6. iucnredlist.org
  7. ne.se
  8. smhi.se
  9. runeberg.org
  10. dn.se
  11. aftonbladet.se
  12. worldcat.org
  13. viewfinderpanoramas.org
  14. svt.se
  15. kit.edu
  16. doi.org
  17. dyntaxa.se
  18. www.istat.it
  19. scb.se
  20. svd.se
  21. expressen.se
  22. kew.org
  23. imdb.com
  24. sverigesradio.se
  25. archive.is

Niderlandzka Wikipedia (2,2 miliona artykułów)

  1. web.archive.org
  2. marinespecies.org
  3. nos.nl
  4. nhm.ac.uk
  5. iucnredlist.org
  6. doi.org
  7. cbs.nl
  8. kb.nl
  9. ad.nl
  10. volkskrant.nl
  11. nu.nl
  12. nieuwsblad.be
  13. nrc.nl
  14. tamu.edu
  15. nih.gov
  16. archive.today
  17. hln.be
  18. youtube.com
  19. archive.org
  20. www.istat.it
  21. amnh.org
  22. standaard.be
  23. vrt.be
  24. trouw.nl
  25. gbif.fr

Hiszpańska Wikipedia (2,1 miliona artykułów)

  1. web.archive.org
  2. doi.org
  3. issn.org
  4. archive.org
  5. nih.gov
  6. elpais.com
  7. books.google.com
  8. youtube.com
  9. books.google.es
  10. nytimes.com
  11. archive.today
  12. infobae.com
  13. worldcat.org
  14. deadline.com
  15. imdb.com
  16. elmundo.es
  17. worldpostalcodes.org
  18. abc.es
  19. bbc.co.uk
  20. billboard.com
  21. variety.com
  22. lanacion.com.ar
  23. census.gov
  24. marca.com
  25. theguardian.com

Rosyjska Wikipedia (2,1 miliona artykułów)

  1. web.archive.org
  2. webcitation.org
  3. worldcat.org
  4. gks.ru
  5. doi.org
  6. archive.org
  7. wikidata.org
  8. ru.wikisource.org
  9. archive.today
  10. youtube.com
  11. nih.gov
  12. books.google.com
  13. kommersant.ru
  14. rosstat.gov.ru
  15. nytimes.com
  16. ria.ru
  17. books.google.ru
  18. deadline.com
  19. imdb.com
  20. lenta.ru
  21. tass.ru
  22. narod.ru
  23. bbc.com
  24. variety.com
  25. bbc.co.uk

Włoska Wikipedia (2,0 miliona artykułów)

  1. web.archive.org
  2. archive.org
  3. doi.org
  4. repubblica.it
  5. books.google.it
  6. nih.gov
  7. treccani.it
  8. gazzetta.it
  9. corriere.it
  10. books.google.com
  11. archive.is
  12. youtube.com
  13. www.istat.it
  14. oadoi.org
  15. nytimes.com
  16. insee.fr
  17. allmusic.com
  18. worldcat.org
  19. deadline.com
  20. imdb.com
  21. antoniogenna.net
  22. ansa.it
  23. variety.com
  24. sky.it
  25. sbn.it

Polska Wikipedia (1,7 miliona artykułów)

  1. web.archive.org
  2. worldcat.org
  3. sejm.gov.pl
  4. archive.is
  5. doi.org
  6. stat.gov.pl
  7. nih.gov
  8. pwn.pl
  9. dane.gov.pl
  10. wyborcza.pl
  11. archive.ph
  12. onet.pl
  13. wp.pl
  14. discogs.com
  15. wirtualnemedia.pl
  16. youtube.com
  17. imdb.com
  18. allmusic.com
  19. filmpolski.pl
  20. pkw.gov.pl
  21. nauka-polska.pl
  22. interia.pl
  23. books.google.pl
  24. archive.org
  25. filmweb.pl

Chińska Wikipedia (1,5 miliona artykułów)

  1. web.archive.org
  2. archive.org
  3. nih.gov
  4. worldcat.org
  5. doi.org
  6. books.google.com
  7. sina.com.cn
  8. youtube.com
  9. archive.today
  10. ltn.com.tw
  11. natalie.mu
  12. hk01.com
  13. census.gov
  14. qq.com
  15. sohu.com
  16. zh.wikisource.org
  17. people.com.cn
  18. nationalmap.gov
  19. xinhuanet.com
  20. udn.com
  21. nytimes.com
  22. webcitation.org
  23. geoportail.gouv.fr
  24. cna.com.tw
  25. mca.gov.cn

Japońska Wikipedia (1,5 miliona artykułów)

  1. web.archive.org
  2. natalie.mu
  3. doi.org
  4. oricon.co.jp
  5. ndl.go.jp
  6. x.com
  7. nikkansports.com
  8. youtube.com
  9. sponichi.co.jp
  10. asahi.com
  11. nih.gov
  12. worldcat.org
  13. nikkei.com
  14. kotobank.jp
  15. nii.ac.jp
  16. nhk.or.jp
  17. sankei.com
  18. twitter.com
  19. mainichi.jp
  20. eiga.com
  21. prtimes.jp
  22. sanspo.com
  23. ameblo.jp
  24. realsound.jp
  25. yomiuri.co.jp

Ukraińska Wikipedia (1,4 miliona artykułów)

  1. web.archive.org
  2. webcitation.org
  3. doi.org
  4. rada.gov.ua
  5. nih.gov
  6. worldcat.org
  7. stat.gov.pl
  8. insee.fr
  9. archive.org
  10. census.gov
  11. youtube.com
  12. books.google.com
  13. president.gov.ua
  14. ukrcensus.gov.ua
  15. pravda.com.ua
  16. archive.today
  17. deadline.com
  18. suspilne.media
  19. rbc.ua
  20. imdb.com
  21. history.org.ua
  22. gks.ru
  23. bbc.com
  24. nytimes.com
  25. loc.gov

Arabska Wikipedia (1,3 miliona artykułów)

  1. web.archive.org
  2. wikidata.org
  3. archive.org
  4. doi.org
  5. worldcat.org
  6. nih.gov
  7. books.google.com
  8. issn.org
  9. openlibrary.org
  10. elcinema.com
  11. imdb.com
  12. geonames.org
  13. census.gov
  14. nytimes.com
  15. bbc.co.uk
  16. shamela.ws
  17. minorplanetcenter.net
  18. aljazeera.net
  19. loc.gov
  20. theguardian.com
  21. bbc.com
  22. britannica.com
  23. webcitation.org
  24. youtube.com
  25. wikidata-externalid-url.toolforge.org

Wietnamska Wikipedia (1,3 miliona artykułów)

  1. web.archive.org
  2. theplantlist.org
  3. doi.org
  4. archive.org
  5. catalogueoflife.org
  6. books.google.com
  7. tamu.edu
  8. nih.gov
  9. worldcat.org
  10. vnexpress.net
  11. tuoitre.vn
  12. archive.today
  13. bbc.co.uk
  14. marinespecies.org
  15. thanhnien.vn
  16. chinhphu.vn
  17. amnh.org
  18. thuvienphapluat.vn
  19. census.gov
  20. vietnamnet.vn
  21. nytimes.com
  22. dantri.com.vn
  23. nhm.ac.uk
  24. youtube.com
  25. adsabs.harvard.edu

Portugalska Wikipedia (1,2 miliona artykułów)

  1. web.archive.org
  2. globo.com
  3. uol.com.br
  4. doi.org
  5. worldcat.org
  6. nih.gov
  7. books.google.com
  8. ibge.gov.br
  9. insee.fr
  10. books.google.com.br
  11. nytimes.com
  12. terra.com.br
  13. archive.org
  14. abril.com.br
  15. www.istat.it
  16. estadao.com.br
  17. bbc.co.uk
  18. census.gov
  19. billboard.com
  20. webcitation.org
  21. archive.is
  22. deadline.com
  23. theguardian.com
  24. sapo.pt
  25. adsabs.harvard.edu

Perska Wikipedia (1,1 miliona artykułów)

  1. web.archive.org
  2. doi.org
  3. nih.gov
  4. archive.org
  5. books.google.com
  6. bbc.com
  7. worldcat.org
  8. isna.ir
  9. bbc.co.uk
  10. mehrnews.com
  11. irna.ir
  12. amar.org.ir
  13. nytimes.com
  14. radiofarda.com
  15. webcitation.org
  16. archive.today
  17. iranicaonline.org
  18. hamshahrionline.ir
  19. sci.org.ir
  20. iranshahrpedia.com
  21. khabaronline.ir
  22. theguardian.com
  23. deadline.com
  24. boxofficemojo.com
  25. tasnimnews.com

Czeczeńska Wikipedia (866 tysięcy artykułów)

  1. web.archive.org
  2. gmcrosstata.ru
  3. worldcat.org
  4. wikidata.org
  5. insee.fr
  6. tuik.gov.tr
  7. nasa.gov
  8. czso.cz
  9. census.gov
  10. geonames.org
  11. trasa.ru
  12. ine.es
  13. www.istat.it
  14. e-local.gob.mx
  15. ibge.gov.br
  16. minorplanetcenter.net
  17. doi.org
  18. mind.ua
  19. stat.gov.pl
  20. webcitation.org
  21. gks.ru
  22. amar.org.ir
  23. nsi.bg
  24. inegi.org.mx
  25. unam.mx

Katalońska Wikipedia (796 tysięcy artykułów)

  1. web.archive.org
  2. insee.fr
  3. books.google.cat
  4. doi.org
  5. gencat.cat
  6. worldcat.org
  7. nih.gov
  8. enciclopedia.cat
  9. census.gov
  10. archive.today
  11. elpais.com
  12. fishbase.org
  13. lavanguardia.com
  14. nytimes.com
  15. archive.org
  16. ara.cat
  17. termcat.cat
  18. ccma.cat
  19. vilaweb.cat
  20. britannica.com
  21. bbc.co.uk
  22. adsabs.harvard.edu
  23. imdb.com
  24. iec.cat
  25. esadir.cat

Indonezyjska Wikipedia (783 tysiące artykułów)

  1. web.archive.org
  2. doi.org
  3. archive.org
  4. books.google.com
  5. worldcat.org
  6. nih.gov
  7. kompas.com
  8. detik.com
  9. bps.go.id
  10. books.google.co.id
  11. tribunnews.com
  12. liputan6.com
  13. tempo.co
  14. kemdikbud.go.id
  15. naver.com
  16. bbc.co.uk
  17. antaranews.com
  18. youtube.com
  19. adsabs.harvard.edu
  20. nytimes.com
  21. kemendagri.go.id
  22. kapanlagi.com
  23. cnnindonesia.com
  24. archive.today
  25. google.co.id

Koreańska Wikipedia (752 tysiące artykułów)

  1. web.archive.org
  2. naver.com
  3. doi.org
  4. nih.gov
  5. archive.org
  6. worldcat.org
  7. books.google.com
  8. adsabs.harvard.edu
  9. chosun.com
  10. law.go.kr
  11. semanticscholar.org
  12. yna.co.kr
  13. daum.net
  14. ko.wikisource.org
  15. donga.com
  16. hani.co.kr
  17. nytimes.com
  18. youtube.com
  19. archive.today
  20. khan.co.kr
  21. history.go.kr
  22. aks.ac.kr
  23. census.gov
  24. bbc.co.uk
  25. mt.co.kr

Serbska Wikipedia (706 tysięcy artykułów)

  1. inegi.org.mx
  2. web.archive.org
  3. geonames.org
  4. stat.gov.rs
  5. doi.org
  6. missouri.edu
  7. nih.gov
  8. archive.org
  9. www.istat.it
  10. books.google.com
  11. worldcat.org
  12. rts.rs
  13. webcitation.org
  14. novosti.rs
  15. iucnredlist.org
  16. insee.fr
  17. politika.rs
  18. blic.rs
  19. kia.hu
  20. u-strasbg.fr
  21. b92.net
  22. britannica.com
  23. nb.rs
  24. dzs.hr
  25. youtube.com

Turecka Wikipedia (689 tysięcy artykułów)

  1. web.archive.org
  2. doi.org
  3. tuik.gov.tr
  4. archive.org
  5. books.google.com
  6. worldcat.org
  7. hurriyet.com.tr
  8. nih.gov
  9. mevzuat.gov.tr
  10. webcitation.org
  11. milliyet.com.tr
  12. itis.gov
  13. gbif.org
  14. archive.today
  15. youtube.com
  16. yerelnet.org.tr
  17. tbmm.gov.tr
  18. bbc.co.uk
  19. nytimes.com
  20. dergipark.org.tr
  21. bbc.com
  22. sabah.com.tr
  23. aa.com.tr
  24. haberturk.com
  25. books.google.com.tr

Norweska Wikipedia (Bokmål) (686 tysięcy artykułów)

  1. web.archive.org
  2. nb.no
  3. wikidata.org
  4. nrk.no
  5. snl.no
  6. doi.org
  7. vg.no
  8. census.gov
  9. worldcat.org
  10. wikidata-externalid-url.toolforge.org
  11. aftenposten.no
  12. imdb.com
  13. dagbladet.no
  14. ssb.no
  15. artsdatabanken.no
  16. olympics.com
  17. britannica.com
  18. nve.no
  19. olympedia.org
  20. transfermarkt.com
  21. regjeringen.no
  22. tv2.no
  23. sports-reference.com
  24. bnf.fr
  25. nih.gov

Wikipedia w języku urdu (641 tysięcy artykułów)

  1. web.archive.org
  2. nasa.gov
  3. espncricinfo.com
  4. books.google.com
  5. archive.org
  6. imdb.com
  7. cricketarchive.com
  8. minorplanetcenter.net
  9. d-nb.info
  10. geonames.org
  11. doi.org
  12. bnf.fr
  13. worldcat.org
  14. dawn.com
  15. census.gov
  16. nkp.cz
  17. openstreetmap.org
  18. indiatimes.com
  19. britannica.com
  20. snaccooperative.org
  21. wikidata.org
  22. nih.gov
  23. bbc.co.uk
  24. findagrave.com
  25. shamela.ws

Fińska Wikipedia (621 tysięcy artykułów)

  1. web.archive.org
  2. yle.fi
  3. hs.fi
  4. britannica.com
  5. is.fi
  6. iltalehti.fi
  7. maanmittauslaitos.fi
  8. wikidata.org
  9. worldcat.org
  10. eliteprospects.com
  11. doi.org
  12. iucnredlist.org
  13. nih.gov
  14. ifpi.fi
  15. citypopulation.de
  16. mtvuutiset.fi
  17. kansalliskirjasto.fi
  18. books.google.fi
  19. allmusic.com
  20. syke.fi
  21. kansallisbiografia.fi
  22. bbc.co.uk
  23. bbc.com
  24. nytimes.com
  25. helsinki.fi

Czeska Wikipedia (594 tysiące artykułów)

  1. web.archive.org
  2. worldcat.org
  3. idnes.cz
  4. doi.org
  5. archive.org
  6. csu.gov.cz
  7. ceskatelevize.cz
  8. nih.gov
  9. novinky.cz
  10. czso.cz
  11. denik.cz
  12. rozhlas.cz
  13. cas.cz
  14. volby.cz
  15. aktualne.cz
  16. psp.cz
  17. lidovky.cz
  18. irozhlas.cz
  19. pamatkovykatalog.cz
  20. seznamzpravy.cz
  21. youtube.com
  22. books.google.cz
  23. books.google.com
  24. iucnredlist.org
  25. muni.cz

Węgierska Wikipedia (571 tysięcy artykułów)

  1. web.archive.org
  2. valasztas.hu
  3. doi.org
  4. oszk.hu
  5. archive.org
  6. nasa.gov
  7. iszdb.hu
  8. nih.gov
  9. nemzetisport.hu
  10. index.hu
  11. www.istat.it
  12. ksh.hu
  13. familysearch.org
  14. destatis.de
  15. origo.hu
  16. youtube.com
  17. imdb.com
  18. worldcat.org
  19. census.gov
  20. hvg.hu
  21. arcanum.com
  22. pim.hu
  23. 24.hu
  24. bnf.fr
  25. bbc.co.uk

Rumuńska Wikipedia (545 tysięcy artykułów)

  1. web.archive.org
  2. wikidata.org
  3. doi.org
  4. toutes-les-villes.com
  5. citypopulation.de
  6. nih.gov
  7. europa.eu
  8. books.google.com
  9. worldcat.org
  10. nasa.gov
  11. minorplanetcenter.net
  12. ukrcensus.gov.ua
  13. geopf.fr
  14. www.istat.it
  15. catalogueoflife.org
  16. bnf.fr
  17. adevarul.ro
  18. recensamantromania.ro
  19. archive.org
  20. imdb.com
  21. destatis.de
  22. d-nb.info
  23. wikidata-externalid-url.toolforge.org
  24. nytimes.com
  25. bbc.co.uk

Dyskusja i ograniczenia

Interpretacja pojęcia „źródło informacji”

Obecność adresu określonej witryny w przypisie Wikipedii nie zawsze oznacza, że witryna ta jest pierwotnym twórcą lub wydawcą informacji. W niektórych przypadkach pełni ona przede wszystkim funkcję techniczną, pośredniczącą, archiwizującą albo ułatwiającą odnalezienie właściwego dokumentu. Przykładem jest doi.org, czyli infrastruktura służąca do rozwiązywania trwałych identyfikatorów DOI. Adres DOI identyfikuje określony obiekt, na przykład publikację naukową, a następnie przekierowuje użytkownika do aktualnej lokalizacji tego obiektu lub jego opisu. Witryna doi.org jest zatem często pośrednikiem prowadzącym do strony wydawcy, repozytorium albo bazy danych, a nie właściwym wydawcą cytowanej publikacji. Ustalenie, do jakich witryn prowadzą poszczególne identyfikatory DOI, wymagałoby rozwiązania identyfikatorów i prześledzenia przekierowań na poziomie pojedynczych referencji, co może stanowić przedmiot osobnego badania. Więcej informacji o działaniu DOI znajduje się na stronie DOI Foundation.

Podobną funkcję pełni hdl.handle.net, który jest serwerem pośredniczącym systemu Handle. Odczytuje on trwały identyfikator, odnajduje przypisany do niego adres i przekierowuje użytkownika do docelowego zasobu. W takim przypadku liczba referencji przypisana do hdl.handle.net opisuje raczej znaczenie infrastruktury identyfikacyjnej niż znaczenie konkretnego dostawcy treści. Sposób działania tego mechanizmu opisano w dokumentacji Handle.Net.

Jeszcze bardziej technicznym przykładem jest redirecter.toolforge.org. Serwis ten przyjmuje docelowy adres w parametrze url i wykonuje przekierowanie do wskazanej lokalizacji. Sam nie jest więc źródłem treści, lecz narzędziem pośredniczącym. Identyfikacja właściwej witryny wymagałaby odczytania parametru przekierowania albo prześledzenia odpowiedzi serwera. Funkcję narzędzia można sprawdzić bezpośrednio na stronie redirecter.toolforge.org.

Serwisy archiwizujące

Odrębną kategorię stanowią archiwa internetowe, takie jak web.archive.org, webcitation.org czy ghostarchive.org. Nie są one zazwyczaj pierwotnymi wydawcami cytowanych informacji, lecz przechowują kopie stron pochodzących z innych witryn i umożliwiają dostęp do ich treści z określonego momentu. Wayback Machine (web.archive.org) pozwala przeglądać zachowane wersje stron internetowych z różnych okresów. Adres archiwalny wskazuje zatem zarówno usługę archiwizującą, jak i pierwotną witrynę, z której pochodzi zapisana treść. Podobną rolę pełnią WebCite i Ghostarchive, które przechowują kopie stron w celu zapewnienia późniejszego dostępu do treści mogących ulec zmianie albo usunięciu.

Zaklasyfikowanie archiwum jako źródła nie musi być jednak błędem. W przypadku informacji historycznych zachowana kopia strony może być jedyną dostępną podstawą weryfikacji twierdzenia. Należy mimo to rozróżnić witrynę udostępniającą kopię archiwalną od witryny, która pierwotnie opublikowała daną treść.

Katalogi i platformy dostępu

Wątpliwości interpretacyjne dotyczą również katalogów bibliograficznych i platform dostępu do publikacji. Przykładowo worldcat.org jest globalnym katalogiem zbiorów bibliotecznych, który pomaga odnaleźć książkę lub inny dokument oraz ustalić, w których bibliotekach jest on dostępny. W zależności od kontekstu właściwym źródłem informacji może być rekord bibliograficzny WorldCat albo opisywana przez niego publikacja. Charakter WorldCat jako katalogu i narzędzia wyszukiwania zasobów przedstawia OCLC.

books.google.com. Google Books umożliwia wyszukiwanie, przeglądanie i w niektórych przypadkach odczytywanie zeskanowanych książek, jednak źródłem treści pozostaje zazwyczaj konkretna książka wraz z jej autorem i wydawcą. Google Books może więc pełnić jednocześnie funkcję platformy dostępu, wyszukiwarki, repozytorium kopii cyfrowych oraz źródła danych bibliograficznych. Zakres jego funkcji opisano w dokumentacji Google Books.

Dobór odnośników uwzględnianych w rankingu

Powyższe przykłady wskazują, że wybór odnośników uwzględnianych w rankingu jest decyzją metodologiczną. Możliwe jest pozostawienie wszystkich witryn występujących bezpośrednio w adresach referencji, wykluczenie usług o charakterze wyłącznie technicznym albo przypisanie odnośników do witryn, do których ostatecznie prowadzą przekierowania. Każde z tych rozwiązań odpowiada na nieco inne pytanie badawcze.

Uwzględnienie serwisów pośredniczących pozwala mierzyć ich znaczenie w infrastrukturze przypisów Wikipedii. Ich wykluczenie lub przypisanie referencji do witryn docelowych pozwoliłoby natomiast lepiej opisać pochodzenie treści. Wymagałoby to jednak dodatkowej analizy adresów, parametrów przekierowań, łańcuchów odpowiedzi HTTP, identyfikatorów trwałych oraz adresów pierwotnych zapisanych w odnośnikach archiwalnych.

Niektóre witryny mogą również pełnić kilka funkcji jednocześnie. Katalog bibliograficzny może być źródłem informacji o wydaniu książki, archiwum może być źródłem informacji o historycznym stanie strony, a repozytorium może zarówno przechowywać dokument, jak i udostępniać jego metadane. Automatyczny podział wszystkich witryn na „źródła” i „pośredników” nie zawsze będzie więc możliwy bez analizy kontekstu konkretnego przypisu.

Ograniczenia wskaźnika PWRS

Wskaźnik PWRS stanowi tylko jeden z możliwych sposobów pomiaru znaczenia witryn internetowych w przypisach Wikipedii. Wynik opisuje znaczenie witryny w świetle przyjętego modelu, lecz nie jest bezpośrednią miarą wiarygodności, jakości naukowej, znaczenia społecznego ani wartości poznawczej publikowanych treści. Popularność artykułu nie jest równoznaczna z jego znaczeniem naukowym lub encyklopedycznym. Artykuły dotyczące rozrywki, kultury popularnej, sportu albo bieżących wydarzeń mogą uzyskiwać znacznie więcej odsłon niż artykuły poświęcone zagadnieniom podstawowym dla nauki, historii lub edukacji. W rezultacie w rankingu określonej wersji językowej wyższe miejsca mogą zajmować witryny związane z tematyką szczególnie popularną wśród jej czytelników. Z tego powodu we wzorze PWRS zastosowano pierwiastek kwadratowy z liczby odsłon. Transformacja ta zmniejsza różnice pomiędzy artykułami o umiarkowanej i wyjątkowo wysokiej popularności, zachowując jednocześnie większą wagę referencji występujących w częściej czytanych artykułach. Pierwiastek ogranicza wpływ skrajnie popularnych artykułów, ale nie usuwa go całkowicie.

Wybór pierwiastka kwadratowego jest jedną z możliwych decyzji modelowych. Alternatywne podejścia mogłyby wykorzystywać między innymi logarytm liczby odsłon, ograniczenie wartości skrajnych, skalę percentylową, jednakową wagę wszystkich artykułów albo normalizację wyników według kategorii tematycznych. Możliwe byłoby również uwzględnienie innych miar, takich jak liczba różnych artykułów odwołujących się do witryny, liczba wersji językowych, w których witryna występuje, trwałość odnośników lub zróżnicowanie tematyczne cytujących artykułów.

Dalsze badania mogłyby zatem obejmować analizę wrażliwości rankingu na różne sposoby ważenia odsłon, klasyfikację witryn według pełnionej funkcji oraz przypisanie odnośników pośrednich i archiwalnych do pierwotnych dostawców treści. Pozwoliłoby to porównać znaczenie witryn jako bezpośrednich źródeł informacji z ich znaczeniem jako elementów technicznej infrastruktury dostępu do wiedzy.

Możliwość szerszego porównania różnych sposobów oceny istotności źródeł zapewnia serwis BestRef, w którym zastosowano kilka modeli obliczeniowych. Serwis udostępnia oceny kilku milionów witryn internetowych, wyznaczone odrębnie dla każdej z ponad 300 wersji językowych Wikipedii.

Więcei informacji na temat analizy źródeł informacji Wikipedii można znaleźć w publikacjach naukowych: