LessonPeakSeoBot
Faqja te e cila tregon User-Agent-i ynë: kush jemi, si të na bllokosh menjëherë, dhe si të kërkosh heqje të dhënash.
Ke ardhur këtu nga regjistrat e serverit tënd
Ndoshta e ke gjetur këtë lidhje te regjistrat, brenda një rreshti si ky:
Mozilla/5.0 (compatible; LessonPeakSeoBot/1.0; +https://seo.lessonpeak.com/roboti)Ajo lidhje është aty me qëllim. Një robot që nuk të thotë kush është dhe si ta ndalosh nuk ka të drejtë të kërkojë asgjë nga serveri yt.
Çdo kërkesë jona mban gjithashtu kokën From: roboti@lessonpeak.com. Nuk ka User-Agent tjetër, nuk ka rotacion, dhe nuk ka mënyrë që ne të vijmë nën një emër tjetër.
Si të na ndalosh — menjëherë
User-agent: LessonPeakSeoBot
Disallow: /Kjo mjafton. Hyn në fuqi sapo lexojmë robots.txt-në tënde herën tjetër. Nuk duhet të na shkruash, nuk duhet të presësh miratim, dhe nuk ka listë nga e cila të çregjistrohesh.
Për ta ngadalësuar në vend që ta ndalosh:
User-agent: LessonPeakSeoBot
Crawl-delay: 30Një Crawl-delay më i madh se minimumi ynë fiton gjithnjë. Ne nuk negociojmë poshtë asaj që kërkon pronari i faqes.
Një bllokim me User-agent: * na vlen po aq. Nuk kërkojmë përjashtim për vete.
Çfarë respektojmë
- `robots.txt` plotësisht, me parsim të vërtetë: specifikitet
User-agent, rregullin e rrugës më të gjatë, wildcard-e*dhe$,Crawl-delay,Sitemap. - Dështim i mbyllur: nëse
robots.txtkthen 429, 5xx, timeout ose nuk zgjidhet dot DNS-ja, ne nuk e marrim faqen. Nuk hamendësojmë atë që na leverdis. - Një kërkesë në çast për host, me dyfishim të pritjes pas çdo 429 ose 5xx.
- Asnjë përpjekje për t'u fshehur. Pa rotacion identiteti, pa shmangie të mbrojtjeve anti-bot, pa zgjidhje sfidash verifikimi. Kur na bllokon diçka, rezultati raportohet si "e bllokuar".
- Vetëm portat 80 dhe 443, vetëm adresa publike, më së shumti 5 ridrejtime.
Këto nuk janë premtime në një faqe: janë sjellje e zbatuar në kod dhe e mbuluar me teste që dështojnë nëse ndonjëra prishet.
Çfarë marrim dhe çfarë mbajmë
Marrim faqet publike të sajtit tënd për t'i analizuar teknikisht: etiketat, strukturën, kokat e përgjigjes, lidhjet.
Mbajmë URL-të e skanuara, kohën e skanimit dhe konstatimet e analizës. Nuk e ruajmë faqen si arkiv publik dhe nuk e ripublikojmë përmbajtjen tënde.
Raportet për sajtet e palëve të treta nuk indeksohen: zona e aplikacionit dërgon noindex në çdo përgjigje dhe është e ndaluar te robots.txt ynë.
Nuk provojmë të hyjmë në zona të mbrojtura me fjalëkalim, nuk plotësojmë formularë, dhe nuk ekzekutojmë veprime që ndryshojnë gjendjen e sajtit tënd.
Nëse diçka nuk shkon
Shkruaj te roboti@lessonpeak.com.
Rastet për të cilat duam të dëgjojmë:
- Kërkojmë shumë shpejt. Thuaj hostin dhe kohën; ritmi ynë duhet të jetë një kërkesë në çast, dhe nëse nuk ishte, është defekt.
- Nuk respektuam `robots.txt`. Dërgo skedarin dhe URL-në që u mor. Ky do të ishte defekt i rëndë dhe do ta trajtonim si të tillë.
- Do të hiqen të dhënat e sajtit tënd. Thuaj domainin dhe si e provon lidhjen me të — një regjistrim DNS TXT ose një skedar te
/.well-known/, njësoj si te verifikimi i pronësisë. Provën e kërkojmë sepse pa të, kushdo mund të kërkonte heqjen e të dhënave të sajtit të dikujt tjetër.
Për bllokim të thjeshtë nuk ka nevojë të na shkruash fare: dy rreshtat më lart e bëjnë punën.
Nga u nxor kjo faqe
Çdo pohim më sipër është nxjerrë nga kodi ose nga plani, dhe këtu janë vendet e sakta. Nëse njëri prej tyre nuk përputhet me atë që lexove, faqja është gabim.
workers/seo-crawler/src/shfletuesi/ua.ts:18workers/seo-crawler/src/shfletuesi/ua.ts:27workers/seo-crawler/src/shfletuesi/ua.ts:34workers/seo-crawler/src/robots/index.ts:175workers/seo-crawler/README.md:1