Surface web
Het surface web (ook wel het clearnet, visible web of indexed web genoemd) is het gedeelte van het world wide web dat publiekelijk toegankelijk is en door zoekmachines wordt geïndexeerd. Zoekmachines gebruiken webcrawlers (ook wel spiders genoemd) om webpagina's systematisch te doorzoeken door hyperlinks te volgen en de gevonden informatie te indexeren.[1] Het surface web vormt de tegenhanger van het deep web, dat niet-geïndexeerde webinhoud bevat, en staat los van het dark web, dat speciale software vereist voor toegang.
Kenmerken
Het surface web bestaat uit webpagina's die aan de volgende criteria voldoen:
- Publiekelijk toegankelijk zonder authenticatie
- Indexeerbaar door zoekmachines
- Bereikbaar via standaard webbrowsers
- Toegankelijk via directe URL's
- Niet geblokkeerd voor webcrawlers via robots.txt of andere methoden
Omvang
Het precieze aandeel van het surface web ten opzichte van het totale internet is moeilijk vast te stellen. Vroege schattingen door Bergman (2001) suggereerden dat het surface web minder dan 1% van alle webinhoud vormde, waarbij het deep web 400 tot 550 keer groter werd geschat.[2] Recentere schattingen variëren, maar experts zijn het er algemeen over eens dat het surface web slechts een klein percentage van het totale internet vormt, waarbij het grootste deel bestaat uit niet-geïndexeerde content zoals databases, privébestanden en pagina's achter inlogschermen.[3] Het exacte aantal pagina's op het surface web verandert voortdurend door het dynamische karakter van het internet.
Technische aspecten
Pagina's op het surface web gebruiken standaardprotocollen zoals HTTP en HTTPS en zijn gebouwd met technologieën als HTML, CSS en JavaScript. De indexeerbaarheid wordt mede bepaald door het robots.txt-bestand, waarin website-eigenaren kunnen aangeven welke delen door crawlers mogen worden bezocht.[4]
Voorbeelden
Tot het surface web behoren onder meer:
- Openbare websites van bedrijven en organisaties
- Nieuwswebsites en blogs
- Openbare delen van sociale media
- Wiki's zoals Wikipedia
- Publieke overheidsinformatie
- Academische publicaties in open access
Externe links
- ↑ Baeza-Yates, Ricardo (2011). Modern Information Retrieval: The Concepts and Technology behind Search. Addison-Wesley, pp. 365-395. ISBN 978-0-321-41691-9.
- ↑ Bergman, Michael K. (2001). White Paper: The Deep Web: Surfacing Hidden Value. The Journal of Electronic Publishing 7. DOI: 10.3998/3336451.0007.104.
- ↑ Onifade, Olufade F.W. (2020). Relevance of the Deep Web to Academic Research. International Journal of Natural and Applied Sciences: 45-52.
- ↑ Introduction to robots.txt. Google Search Central. Geraadpleegd op 15 januari 2024.
Content Disclaimer
Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.
- The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
- There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
- It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
- Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
- Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.