Meta
Meta robots dhe noindex
Direktiva që i thotë motorit të mos e indeksojë faqen; mjeti e kap kur është e pranishme dhe e raporton si të rëndësishme.
Çfarë është
<meta name="robots"> mban direktiva për motorët e kërkimit mbi një faqe të vetme. Vlerat më të përdorura janë noindex (mos e vendos këtë faqe në indeks) dhe nofollow (mos ndiq lidhjet e saj).
Kjo etiketë ndryshon nga robots.txt në një pikë thelbësore: robots.txt ndalon marrjen e faqes, ndërsa noindex ndalon indeksimin e saj. Për ta parë noindex-in, motori duhet ta marrë faqen — pra një faqe e bllokuar nga robots.txt mund të indeksohet gjithsesi, sepse direktiva brenda saj nuk lexohet dot kurrë.
E njëjta direktivë jepet edhe me kokën HTTP X-Robots-Tag, e cila punon edhe për skedarë jo-HTML si PDF.
Pse ka rëndësi
noindex është një çelës me dy anë. Kur e do, është i domosdoshëm: faqe hyrjeje, rezultate kërkimi të brendshme, faqe falënderimi pas një formulari, variante filtrimi që prodhojnë mijëra URL pa vlerë.
Kur nuk e do, është katastrofik dhe i heshtur. Skenari klasik: sajti ndërtohet në një mjedis testimi me noindex kudo, publikohet, dhe etiketa mbetet. Faqja punon, duket mirë, dhe thjesht nuk ekziston për kërkimin. Nga brenda nuk duket asgjë; matet vetëm nga mungesa e trafikut.
Skenari i dytë: një plugin ose një rregull shablloni e vendos noindex mbi një kategori të tërë pas një përditësimi. Trafiku bie brenda javësh dhe shkaku është një rresht i vetëm në <head>.
Si rregullohet
Kontrollo çfarë ka faqja sot:
<!-- indeksohet dhe lidhjet ndiqen — kjo është parazgjedhja, s'ka nevojë ta shkruash -->
<meta name="robots" content="index, follow">
<!-- nuk indeksohet, por lidhjet ndiqen -->
<meta name="robots" content="noindex, follow">Ose me kokë HTTP, për PDF dhe skedarë të tjerë:
X-Robots-Tag: noindexHapat:
- Hiq `noindex` nga çdo faqe që do të gjendet. Pas publikimit, kontrollo burimin e disa faqeve reale, jo vetëm të faqes kryesore.
- Mos e kombino `noindex` me bllokim në `robots.txt`. Nëse e bllokon marrjen, direktiva nuk lexohet dhe faqja mund të mbetet në indeks pa përshkrim.
- Për heqje të shpejtë nga indeksi, lër faqen të merret dhe vendos
noindex; bllokorobots.txtvetëm pasi ajo të ketë dalë. - Mos e përdor si mbrojtje.
noindexnuk e fsheh faqen nga kushdo që e di URL-në; për atë duhet autentikim.
Si e mat ky mjet
MetaAnalyzer::analyzeRobots() (services/MetaAnalyzer.php:125) lexon //meta[@name="robots"]/@content dhe kërkon nënvargun noindex. Kur e gjen, shton një paralajmërim me ndikim të lartë që thotë se faqja nuk do të shfaqet në rezultate (:132). Kur nuk e gjen, nuk shton asgjë — mungesa e direktivës është gjendja normale.
Çfarë NUK e mat
Mjeti lexon vetëm etiketën HTML, jo kokën X-Robots-Tag, prandaj një faqe që bllokohet nga koka HTTP raportohet si e indeksueshme. Nuk i njeh as direktivat e tjera (nosnippet, max-snippet, noarchive, unavailable_after), as etiketat që i drejtohen një roboti të veçantë si <meta name="googlebot">. Kontrolli është kërkim nënvargu, jo parsim: një vlerë si index, nofollow e kap saktë nofollow-un vetëm rastësisht, sepse nofollow nuk kontrollohet fare.
Kodi që e kryen matjen
services/MetaAnalyzer.php:125— MetaAnalyzer::analyzeRobotsservices/MetaAnalyzer.php:132— noindex