Kalo te përmbajtja
SEO Analyzer

Si funksionon

Rruga e plotë nga URL-ja që jep deri te raporti: marrja, analiza, dhe çfarë ndodh me të dhënat.

1 · Ti jep një URL

Për një skanim një-faqësh, kjo është gjithçka që duhet. Për një crawl të plotë sajti, duhet së pari të provosh se hosti është yti — shih verifikimin e pronësisë.

URL-ja validohet para se të preket rrjeti. Lejohen vetëm http dhe https, vetëm portat 80 dhe 443, dhe vetëm adresa publike. Adresat e rrjetit të brendshëm, loopback-u, adresat link-local dhe variantet e maskuara refuzohen — jo si këshillë, por si rregull i zbatuar te tri nivele njëherësh: rrjeti i kontejnerit, kodi i klientit HTTP, dhe filtri i kërkesave brenda shfletuesit.

2 · Kontrollohet nëse lejohemi

Para çdo marrjeje, merret robots.txt i hostit dhe zbatohet.

Parsimi është i plotë: specifikitet User-agent, bashkim grupesh me të njëjtin specifikitet, Allow dhe Disallow me rregullin e rrugës më të gjatë, wildcard-e * dhe $, Crawl-delay, Sitemap.

Trajtimi i statuseve është dështim i mbyllur: 2xx zbatohet, 4xx që nuk është 429 do të thotë se nuk ka robots.txt dhe lejohet gjithçka, ndërsa 429, 5xx, timeout dhe DNS i dështuar ndalojnë marrjen. Nëse nuk dimë çfarë thotë robots.txt-ja e tyre, nuk hamendësojmë atë që na leverdis.

Nëse robots.txt na ndalon, faqja nuk merret. Nuk ka flamur për ta çaktivizuar këtë, dhe nuk ka rrugë tjetër dalëse. Detajet te politika e crawl-it.

3 · Merret faqja

Marrja bëhet me një User-Agent të vetëm dhe të pandryshueshëm, që të identifikon kush jemi dhe ku të na bllokosh:

Mozilla/5.0 (compatible; LessonPeakSeoBot/1.0; +https://seo.lessonpeak.com/roboti)
From: roboti@lessonpeak.com

Një kërkesë në çast për host. Kur robots.txt deklaron Crawl-delay më të madh se minimumi ynë, fiton ai i tyre — nuk negociojmë kurrë poshtë asaj që kërkoi pronari. Çdo 429, 5xx ose timeout e dyfishon pritjen për atë host; një sukses e ul numëruesin një hap, jo në zero.

Kufijtë janë të fiksuar: 8 MiB për faqe, 512 KiB për robots.txt, 5 ridrejtime, 20 sekonda për kërkesë. Tejkalimi i një kufiri është gabim i tipizuar, jo prerje e heshtur — një HTML i prerë në heshtje do të analizohej si "faqja nuk ka </body>", konstatim i rremë me pamje të vërteti.

4 · Analizohet

Faqja e marrë i kalon analizuesve. Secili prej tyre kryen një ose disa kontrolle dhe kthen konstatime.

Shumica e analizuesve punojnë vetëm mbi dokumentin: nuk bëjnë kërkesa të tjera, nuk lexojnë orën, nuk prekin bazën e të dhënave. Kjo do të thotë se për të njëjtën faqe ata japin gjithnjë të njëjtin rezultat — matur mbi një korpus prej 31 faqesh, me rrjetin e çaktivizuar.

Disa të tjerë kanë nevojë për rrjet ose për orën: verifikimi i certifikatës, zinxhiri i ridrejtimeve, gjendja e lidhjeve të jashtme, zgjidhja e DNS-së. Rezultatet e tyre varen nga çasti i matjes, dhe faqja e secilit kontroll e thotë këtë.

Çdo konstatim mban kategorinë e vet — kaluar, informativ, paralajmërim, kritik — dhe një rekomandim.

5 · Çfarë ndodh me të dhënat

Ruhet URL-ja e skanuar, koha e skanimit dhe konstatimet. Raportet e sajteve të palëve të treta nuk indeksohen: gjithë zona e aplikacionit dërgon noindex dhe është e ndaluar te robots.txt ynë.

Faqja e marrë nuk ruhet si arkiv publik dhe nuk ripublikohet.

Nëse je pronar i një sajti dhe do të dish çfarë mbahet për të, ose të kërkosh heqjen, shih faqen e robotit dhe politikën e privatësisë.

Nga u nxor kjo faqe

Çdo pohim më sipër është nxjerrë nga kodi ose nga plani, dhe këtu janë vendet e sakta. Nëse njëri prej tyre nuk përputhet me atë që lexove, faqja është gabim.

  • workers/seo-crawler/README.md:1
  • workers/seo-crawler/src/kontrata.ts:25
  • workers/seo-crawler/src/shfletuesi/ua.ts:30
  • workers/seo-crawler/src/robots/index.ts:164