close

Paletli

Gezinmeye atla Aramaya atla

Bir tarayıcı ( web tarayıcısı , örümcek veya robot olarak da adlandırılır ) , genellikle bir arama motoru adına bir ağın (veya veritabanının ) içeriğini metodik ve otomatik bir şekilde analiz eden bir yazılımdır . Spesifik olarak, bir tarayıcı, genellikle bir veya daha fazla web sayfasında bulunan tüm belgelerin bir metin kopyasını alarak, daha sonra bunların aranmasına ve görselleştirilmesine izin veren bir dizin oluşturan bir tür bottur (işlemleri otomatikleştiren program veya komut dosyası ). .

Web'de tarayıcıların son derece yaygın bir kullanımı vardır ; arama motoru tarafından sağlanan ziyaret edilecek URL'lerin bir listesine dayanır (bu, başlangıçta kullanıcılar tarafından önerilen adreslere veya programcıların kendileri tarafından önceden derlenmiş bir listeye dayanır). Bir URL'yi ayrıştırırken, belgedeki tüm köprüleri tanımlar ve bunları ziyaret edilecek URL'ler listesine ekler. İşlem manuel olarak veya belirli sayıda bağlantı takip edildikten sonra sonlandırılabilir.

Ayrıca, İnternette aktif olan tarayıcılar , sitenin kök dizinine yerleştirilen " robots.txt " dosyasında belirtilenler tarafından ele alınma hakkına sahiptir . Bu dosya içerisinde hangi sayfaların ayrıştırılmaması gerektiğini belirtebilirsiniz. Tarayıcı, tavsiyeye uyma hakkına sahiptir, ancak yükümlülüğe sahip değildir.

21 Şubat 2008 itibariyle güncellenen ana arama motorlarının örümceklerinin adları
paletli Arama motoru
Googlebot Google
Hızlı Hızlı - Alltheweb
Yum Inktomi - Yahoo!
Mobilet AltaVista
Merkator AltaVista
Jeeves'e sorun Jeeves'e sorun
Teoma ajanı teoma
Ia arşivleyici Alexa - İnternet Arşivi
Yahoo! Yum yahoo
Romilda Facebook
ÖrdekÖrdekBot ÖrdekÖrdekGit

Web tarayıcısı örnekleri

Aşağıda genel amaçlı genel tarayıcı mimarilerinin bir listesi bulunmaktadır:

  • Bucean (Eichmann, 1994) ilk halka açık tarayıcıydı. İki programa dayanır: birincisi, " spider" isteği ilişkisel bir veritabanında tutar ve ikincisi " ", sayfaları web'den indiren bir ASCIImite tarayıcısıdır .www
  • WebCrawler (Pinkerton, 1994), bir web dalının ilk metinsel reklam dizinini oluşturmak için kullanıldı. Sayfaları indirmek için lib-WWW'ye ve genişlik öncelikli grafik yöntemiyle keşif için URL'leri ayrıştırmak ve sıralamak için başka bir programa dayanıyordu. Ayrıca, koşullu sorguyla metin bağlantısı benzerliklerine dayalı olarak bağlantıları izleyen gerçek zamanlı bir tarayıcı içerir.
  • TennSpider (McBryan, 1994), basit bir belge başlıkları ve URL dizini oluşturmak için kullanılan bir tarayıcıydı. grep Dizin, Unix komutu kullanılarak aranabilir .
  • Google Crawler (Brin ve Page, 1998) biraz ayrıntılı olarak açıklanmıştır, ancak referans yalnızca bu mimarinin C ++ ve Python'a dayanan önceki bir sürümüne yöneliktir . Metin seçimi, metni tam olarak indekslemek ve ayrıca URL'leri çıkarmak için yapıldığından, tarayıcı indeksleme işlemine entegre edildi. Bir URL sunucusu, çeşitli tarama işlemleri tarafından getirilecek URL listeleri gönderir. Ayrıştırma sırasında bulunan URL'ler, URL'nin daha önce görülüp görülmediğini kontrol eden bir URL sunucusuna gönderilir. Değilse, URL, URL sunucusu sorgusuna eklenir.
  • VnzOwna (da Silva ve diğerleri , 1999) merkezi bir programlayıcı ve dağıtılmış toplayıcı serisi olarak kullanılır. Koleksiyoncular, indirilen web sayfalarını ayrıştırır ve keşfedilen URL'leri, sırayı toplayıcılara atayan zamanlayıcıya gönderir. Zamanlayıcı, web sunucularının aşırı yüklenmesini önlemek için sırasız bir politikayla genişlik öncelikli aramayı güçlendirir. Tarayıcı Perl ile yazılmıştır .
  • Mercator (Heydon ve Najork, 1999; Najork ve Heydon, 2001) Java ile yazılmış dağıtılmış modüler bir web tarayıcısıdır . Modülerliği, değiştirilebilir "protokol modülleri" ve "süreç şablonları"nın kullanılmasından kaynaklanmaktadır. Protokol modülleri, web sayfalarını (ör: HTTP) elde etmek için ilişkilendirilir ve süreç modülleri, web sayfalarını işlemekle ilişkilendirilir. Standart formlar, sayfaların metnini indekslemek veya web'den istatistik toplamak için kullanılabilir.
  • WebFountain (Edwards ve diğerleri , 2001) Mercator benzeri bir tarayıcıdır ancak C++ ile yazılmıştır . Özelliği, bir dizi "karınca-makine"yi koordine eden "denetleyici makinede" yatmaktadır. Sayfaların tekrar tekrar boşaltılmasından sonra, her sayfa için bir değişim faktörü hesaplanır ve güncellemeyi en üst düzeye çıkarmak için denklem sistemini çözmek için doğrusal olmayan bir programlama yöntemi kullanılmalıdır. Yazarlar, ilk birkaç bölümde bu tarama sırasını kullanmanızı ve ardından tüm sayfaların aynı sıklıkta ziyaret edildiği tekdüze sırayı değiştirmenizi önerir.
  • PolyBot [Shkapenyuk ve Suel, 2002], bir yönetici, bir veya daha fazla indirici ve bir veya daha fazla DNS algılayıcıdan oluşan, C++ ve Python ile yazılmış bir tarayıcıdır . Toplanan URL'ler diske eklenir ve daha sonra toplu modda aranmaları için işlenir. Düzenleme, hem üçüncü seviye hem de ikinci seviye etki alanlarını (örneğin üçüncü seviye: www.aaa.com, www2.aaa.com) dikkate alır çünkü üçüncü seviye etki alanları genellikle aynı web sunucusu tarafından barındırılır.
  • WebRACE (Zeinalipour-Yazti ve Dikaiakos, 2002), Java'da geliştirilmiş ve eRACE adı verilen daha genel bir sistemin parçası olarak kullanılan bir tarama ve önbelleğe alma modülüdür. Webrace'de öne çıkan en önemli özellik, birçok tarayıcının bir dizi URL çekirdeği ile aramaya başlamasına rağmen, WebRACE'in sürekli olarak formdan yeni URL'ler almasıdır.
  • Ubicrawler (Boldi ve diğerleri , 2004) Java ile yazılmış bir tarayıcıdır. Bir dizi özdeş 'aracıdan' oluşur ve atama işlevi, ana bilgisayar adı karması kullanılarak hesaplanır. Çakışma yoktur, bu, bir tarayıcı aracısı çökene kadar hiçbir sayfanın iki kez dizine eklenmeyeceği anlamına gelir; yüksek ölçeklenebilirlik sağlar ve arızalara karşı toleranslıdır.
  • FAST Crawler (Risvik ve Michelsen, 2002), Fast Search & Transfer tarafından kullanılan bir tarayıcıdır .
  • Terrier Arama Motoru adlı Açık Kaynak projesiyle işbirliği yapan özel bir tarayıcı olan Labrador .
  • Spinn3r , Tailrank.com'un ruhunu oluşturmak için kullanılan bir tarayıcıdır. Spinn3r Java tabanlıdır ve mimarinin çoğu Açık Kaynaklıdır.
  • HotCrawler , C ve PHP ile yazılmıştır .

Açık kaynak tarayıcı

  • DataparkSearch , GNU Genel Kamu Lisansı altında dağıtılan bir tarayıcı ve arama motorudur .
  • Ebot , Erlang'da yazılmış ve GNU Genel Kamu Lisansı altında dağıtılan ölçeklenebilir ve dağıtılmış bir tarayıcıdır .
  • Wget , C ile yazılmış ve GNU Genel Kamu Lisansı altında dağıtılan bir komut satırı tarayıcısıdır . Genellikle yansıtma ve FTP siteleri için kullanılır .
  • Heritrix , web'in büyük bir bölümünün periyodik ekran görüntülerini arşivlemek için tasarlanmış en yüksek kaliteli web arşiv tarayıcısıdırJava ile yazılmıştır.
  • Htdig , indeksleme motorunda bir web tarayıcısı içerir.
  • HTTrack , çevrimdışı danışma için bir web sitesinin bir kopyasını oluşturmak için bir web tarayıcısı kullanır. C dilinde yazılmış ve GNU GPL lisansı altında dağıtılmıştır .
  • JSpider , GNU GPL lisansı altında dağıtılan, son derece özelleştirilebilir bir web örümceğidir.
  • Methabot , C ile yazılmış ve ISC lisansı altında dağıtılan , hızı optimize edilmiş, komut satırı web tarayıcısıdır . Bir yapılandırma sistemi, bir sistem modülü ve yerel dosya sistemi , HTTP veya FTP aracılığıyla hedeflerin taranması için destek içerir.
  • Nutch , Apache lisansı altında Java ile yazılmış bir tarayıcıdır . Lucene ile oluşturulan metin dizini ile birlikte kullanılabilir .
  • WebVac , Stanford WebBase Projesi tarafından kullanılan bir tarayıcıdır .
  • WebSPHINX (Miller ve Bharat, 1998), web sayfalarının çoklu sorgusunu ve HTML ayrıştırmasını uygulayan bir Java kitaplığından, indirilen verileri çıkarmak ve bir arama motoru temel metnini uygulamak için başlangıç ​​adreslerini ayarlamak için bir grafik kullanıcı arabiriminden oluşur.
  • WIRE - Web Bilgi Alma Ortamı (Baeza-Yates ve Castillo, 2002), indirilen web sayfalarını kataloglamak için çeşitli yönergeler ve indirilen sayfalarda istatistik ve raporlar oluşturmak için bir modül içeren, C++ ile yazılmış ve GPL lisansı altında dağıtılan bir web tarayıcısıdır. , web karakterizasyonu için kullanılır.
  • LWP :: RobotUA (Langheinrich, 2004), Perl5 lisansı altında dağıtılan bir Perl sınıfıdır.
  • Web Tarayıcı , C# ile yazılmış .NET için açık kaynaklı web tarayıcısıdır .
  • Sherlock Holmes , hem yerel olarak hem de ağ üzerinde metinsel verileri (metin dosyaları, web sayfaları, vb.) toplar ve dizine ekler. Holmes, Çek web portalı Centrum tarafından ticari olarak desteklenmekte ve kullanılmaktadır. aynı zamanda Onet.pl web sitesi tarafından da kullanılır.
  • YaCy , p2p ağlarının (GPL lisansı altında) ilkeleri üzerine kurulmuş, özgürce dağıtılan bir arama motorudur .
  • Rüya , Genişlik öncelikli arama, giriş seviyesi tarayıcıya dayalı yüksek performanslı bir açık kaynaktır. İngilizce ve Japonca web sitelerini mümkün olan en iyi şekilde yönetmek için kullanılır. GPL kapsamında lisanslanmıştır ve tamamen Python dilinde yazılmıştır .
  • Universal Information Crawler , kullanımı hızlı bir web tarayıcısıdır. Verileri kaydedin ve analiz edin.
  • Agent Kernel , tarama sırasında verileri planlamak, işlemek ve depolamak için bir Java çerçevesidir.
  • Python ile yazılmış açık kaynaklı, genişletilebilir, çok işlevli bir web tarayıcısı olan Squzer .
  • Arachnode.NET , e-postalar, dosyalar, köprüler, resimler ve web sayfaları dahil olmak üzere İnternet içeriğini indirmek, indekslemek ve kaydetmek için rastgele açık kaynaklı bir web tarayıcısıdır. Arachnode.net, SQL Server 2005 kullanılarak C# ile yazılmıştır ve GPL altında lisanslanmıştır.
  • BBragnet , PHP ile yazılmış açık kaynaklı bir web tarayıcısıdır ( Linux sunucuları için).

Eleştiriler

Web Tarayıcı terimi aynı zamanda tartışmalı çevrimdışı tarayıcıları belirtmek için de kullanılır , örneğin: PageNest (eski adıyla WebStripper ), MSIECrawler , Offline Explorer vb. Bu programlar, tüm bir web sitesinin içeriğini kullanıcının bilgisayarının sabit diskine indirmek için tasarlanmıştır . Örneğin, Memory Alpha , siteye agresif bir şekilde eriştikleri ve sitenin diğer kullanıcılar tarafından kullanımını büyük ölçüde yavaşlattığı [1] ve suçluların engellenme riski [2] olduğu için bunların kullanımını yasaklar .

Notlar

  1. ^ Memory Alpha: Database indirme , memory- alpha.org'da . Erişim tarihi: 28 Aralık 2010 .
  2. ^ Memory Alpha robots.txt dosyasına bakın

İlgili öğeler

Diğer projeler

Dış bağlantılar

  • PolyBot , cis.poly.edu üzerinde . Erişim tarihi: 5 Nisan 2008 ( 30 Nisan 2008 tarihindeki orijinal kaynaktan arşivlendi ) .
  • WebRACE , grid.ucy.ac.cy'de . Erişim tarihi: 5 Nisan 2008 ( 28 Aralık 2007 tarihinde orijinalinden arşivlendi ) .
  • Ubicrawler , law.dsi.unimi.it üzerinde . Erişim tarihi: 5 Nisan 2008 ( 10 Nisan 2008'de orijinalinden arşivlendi ) .
  • Labrador , ir.dcs.gla.ac.uk adresinde . Erişim tarihi: 5 Nisan 2008 ( 31 Aralık 2007 tarihindeki orijinal kaynaktan arşivlendi ) .
  • Spinn3r , spinn3r.com'da . 13 Mart 2018 tarihinde kaynağından arşivlendi .
  • Htdig , htdig.org'da . Erişim tarihi: 5 Nisan 2008 ( 8 Nisan 2008 tarihinde orijinalinden arşivlendi ) .