Si funksionon
Rruga e plotë nga URL-ja që jep deri te raporti: marrja, analiza, dhe çfarë ndodh me të dhënat.
1 · Ti jep një URL
Për një skanim një-faqësh, kjo është gjithçka që duhet. Për një crawl të plotë sajti, duhet së pari të provosh se hosti është yti — shih verifikimin e pronësisë.
URL-ja validohet para se të preket rrjeti. Lejohen vetëm http dhe https, vetëm portat 80 dhe 443, dhe vetëm adresa publike. Adresat e rrjetit të brendshëm, loopback-u, adresat link-local dhe variantet e maskuara refuzohen — jo si këshillë, por si rregull i zbatuar te tri nivele njëherësh: rrjeti i kontejnerit, kodi i klientit HTTP, dhe filtri i kërkesave brenda shfletuesit.
2 · Kontrollohet nëse lejohemi
Para çdo marrjeje, merret robots.txt i hostit dhe zbatohet.
Parsimi është i plotë: specifikitet User-agent, bashkim grupesh me të njëjtin specifikitet, Allow dhe Disallow me rregullin e rrugës më të gjatë, wildcard-e * dhe $, Crawl-delay, Sitemap.
Trajtimi i statuseve është dështim i mbyllur: 2xx zbatohet, 4xx që nuk është 429 do të thotë se nuk ka robots.txt dhe lejohet gjithçka, ndërsa 429, 5xx, timeout dhe DNS i dështuar ndalojnë marrjen. Nëse nuk dimë çfarë thotë robots.txt-ja e tyre, nuk hamendësojmë atë që na leverdis.
Nëse robots.txt na ndalon, faqja nuk merret. Nuk ka flamur për ta çaktivizuar këtë, dhe nuk ka rrugë tjetër dalëse. Detajet te politika e crawl-it.
3 · Merret faqja
Marrja bëhet me një User-Agent të vetëm dhe të pandryshueshëm, që të identifikon kush jemi dhe ku të na bllokosh:
Mozilla/5.0 (compatible; LessonPeakSeoBot/1.0; +https://seo.lessonpeak.com/roboti)
From: roboti@lessonpeak.comNjë kërkesë në çast për host. Kur robots.txt deklaron Crawl-delay më të madh se minimumi ynë, fiton ai i tyre — nuk negociojmë kurrë poshtë asaj që kërkoi pronari. Çdo 429, 5xx ose timeout e dyfishon pritjen për atë host; një sukses e ul numëruesin një hap, jo në zero.
Kufijtë janë të fiksuar: 8 MiB për faqe, 512 KiB për robots.txt, 5 ridrejtime, 20 sekonda për kërkesë. Tejkalimi i një kufiri është gabim i tipizuar, jo prerje e heshtur — një HTML i prerë në heshtje do të analizohej si "faqja nuk ka </body>", konstatim i rremë me pamje të vërteti.
4 · Analizohet
Faqja e marrë i kalon analizuesve. Secili prej tyre kryen një ose disa kontrolle dhe kthen konstatime.
Shumica e analizuesve punojnë vetëm mbi dokumentin: nuk bëjnë kërkesa të tjera, nuk lexojnë orën, nuk prekin bazën e të dhënave. Kjo do të thotë se për të njëjtën faqe ata japin gjithnjë të njëjtin rezultat — matur mbi një korpus prej 31 faqesh, me rrjetin e çaktivizuar.
Disa të tjerë kanë nevojë për rrjet ose për orën: verifikimi i certifikatës, zinxhiri i ridrejtimeve, gjendja e lidhjeve të jashtme, zgjidhja e DNS-së. Rezultatet e tyre varen nga çasti i matjes, dhe faqja e secilit kontroll e thotë këtë.
Çdo konstatim mban kategorinë e vet — kaluar, informativ, paralajmërim, kritik — dhe një rekomandim.
5 · Çfarë ndodh me të dhënat
Ruhet URL-ja e skanuar, koha e skanimit dhe konstatimet. Raportet e sajteve të palëve të treta nuk indeksohen: gjithë zona e aplikacionit dërgon noindex dhe është e ndaluar te robots.txt ynë.
Faqja e marrë nuk ruhet si arkiv publik dhe nuk ripublikohet.
Nëse je pronar i një sajti dhe do të dish çfarë mbahet për të, ose të kërkosh heqjen, shih faqen e robotit dhe politikën e privatësisë.
Nga u nxor kjo faqe
Çdo pohim më sipër është nxjerrë nga kodi ose nga plani, dhe këtu janë vendet e sakta. Nëse njëri prej tyre nuk përputhet me atë që lexove, faqja është gabim.
workers/seo-crawler/README.md:1workers/seo-crawler/src/kontrata.ts:25workers/seo-crawler/src/shfletuesi/ua.ts:30workers/seo-crawler/src/robots/index.ts:164