Përmbajtje
Numri i fjalëve dhe përmbajtja e hollë
Sa fjalë të dukshme ka faqja; nën 300 mjeti e quan përmbajtje të hollë.
Çfarë është
Numri i fjalëve mat sasinë e tekstit të dukshëm në faqe, pasi hiqen skriptet, stilet dhe etiketat.
"Përmbajtje e hollë" është term që përshkruan një faqe që nuk i jep lexuesit atë për të cilën erdhi: pak tekst, asnjë përgjigje konkrete, ose tekst i gjeneruar automatikisht për të mbushur një shabllon. Motorët e kërkimit e trajtojnë si problem cilësie, jo si shkelje.
Numri në vetvete nuk është kriter. Nuk ka asnjë prag zyrtar; 300 dhe 600 janë konvencione të industrisë, të shkruara në kodin e këtij mjeti si pragje praktike.
Pse ka rëndësi
Problemi real nuk është numri — është mungesa e përgjigjes. Kur një faqe ka njëqind fjalë sepse tema kërkon njëqind fjalë (një faqe kontakti, një përkufizim), gjithçka është në rregull. Kur ka njëqind fjalë sepse askush nuk e shkroi kurrë, faqja nuk ka pse të ekzistojë.
Pasoja matet në dy hapa. I pari: faqja nuk del në kërkim sepse nuk përmban gjuhën e nevojshme për t'iu përgjigjur asnjë pyetjeje. I dyti, më i rëndë: qindra faqe të holla në të njëjtin sajt e ulin vlerësimin e përgjithshëm të tij, prandaj dëmtojnë edhe faqet e mira.
Rasti klasik janë faqet e gjeneruara nga filtrat — "laptop + ngjyrë blu + nën 500 euro" — që prodhojnë mijëra URL me nga dy fjali. Zgjidhja atje nuk është shtimi i tekstit, është mosindeksimi i tyre.
Si rregullohet
- Pyet së pari nëse faqja duhet të ekzistojë. Nëse jo, bashkoje me një tjetër ose vendos
noindex. - Nëse duhet, përgjigju pyetjes së plotë. Shkruaj atë që vizitori do të pyeste më pas.
- Mos shto fjalë për të mbushur numrin. Paragrafë hyrës që nuk thonë asgjë e ulin cilësinë, jo e ngrenë.
- Kontrollo nëse teksti është vërtet në HTML. Përmbajtje e ndërtuar krejt me JavaScript pas ngarkimit mund të mos numërohet fare nga mjete si ky.
- Për faqe filtrash dhe rezultatesh të brendshme, përdor
noindexdhe lëri të holla — kjo është zgjidhja e saktë.
Si e mat ky mjet
ContentAnalyzer::checkWordCount() (services/ContentAnalyzer.php:222) merr numrin e fjalëve të nxjerra nga extractText() (:102) dhe e krahason me dy pragje: nën 300 (:226, paralajmërim me ndikim të lartë), 300–599 (:229, informativ), 600 e lart (:232, kaluar).
Një kontroll i dytë, i pavarur, bëhet nga ContentQualityAnalyzer (services/ContentQualityAnalyzer.php:63) me të njëjtin prag 300 dhe zbritje 15 pikësh.
Çfarë NUK e mat
Numërimi mbështetet te një funksion që i njeh vetëm fjalët me shkronja latine bazë. Për tekste në alfabete të tjera rezultati mund të jetë zero edhe kur faqja është plot me tekst; e njëjta dobësi prek pjesërisht shkronjat shqipe ë dhe ç (MASTER_PLAN/audits/61-ANALIZUESIT-INVENTAR.md §4.8).
Matja bëhet mbi HTML-në siç vjen nga serveri. Përmbajtja që ndërtohet me JavaScript pas ngarkimit nuk numërohet. Dhe i njëjti konstatim prodhohet nga dy analizues, pra shfaqet dy herë në raport.
Mospërputhje midis tekstit të analizuesit dhe matjes
| Teksti i analizuesit | Çfarë ndodh | Si u mat | Burimi |
|---|---|---|---|
| Thin content detected — Only 0 words found | Funksioni bazë i numërimit njeh vetëm shkronja latine ASCII; shkronjat shqipe ë dhe ç preken pjesërisht. | Mbi 25-rtl-arabisht.html me rreth 70 fjalë, word_count doli 0 ndërsa readability.words doli 74. — MASTER_PLAN/audits/61-ANALIZUESIT-INVENTAR.md §4.8 | services/ContentAnalyzer.php:183 |
Kodi që e kryen matjen
services/ContentAnalyzer.php:222— ContentAnalyzer::checkWordCountservices/ContentQualityAnalyzer.php:63— Thin Content