בדיקת Robots.txt
טענו וקראו את קובץ robots.txt של כל אתר, בדקו האם כתובת ספציפית חסומה עבור סורק נתון, ואתרו בעיות כמו קובץ חסר או חסימה בטעות של האתר כולו.
על הכלי
הכלי טוען את קובץ robots.txt בשורש הכתובת שהזנתם, וקורא את קבוצות ה-user-agent שלו, כללי Allow ו-Disallow, ערכי crawl-delay, ומפות האתר הרשומות. אם גם תזינו נתיב, הוא בודק את הנתיב הזה בדיוק מול הקובץ באמצעות אותה התאמת כללים שסורק אמיתי משתמש בה: קבוצת ה-user-agent הספציפית ביותר שמתאימה חלה, ובתוך הקבוצה הזו הדפוס הארוך ביותר שמתאים מנצח, כאשר Allow מנצח את Disallow בתיקו מדויק. זה משקף את ההתנהגות המתועדת של סורקי מנועי החיפוש הגדולים, לא קירוב מפושט. רק קובץ robots.txt עצמו נקרא, כך שהוא לא בודק האם שאר האתר בפועל תואם למה שהקובץ מתאר.
שני פרטים אמיתיים וקלים לפספס שכדאי להכיר בכתיבה או בתיקון קובץ robots.txt: נתיבים בכללי Allow ו-Disallow רגישים לאותיות רישיות, כך שכלל שנכתב כ-Disallow: /Private/ לא עושה כלום לחסימת תיקייה אמיתית ב-/private/, הם נחשבים לשני נתיבים שונים לגמרי. וגוגל מציינת במפורש שהיא מעבדת רק את 500 הקילובייט הראשונים של קובץ robots.txt, כל מה שמעבר למגבלה הזו מתעלם ממנו בשקט, בלי אזהרה שמוצגת איפשהו, כך שקובץ גדול במיוחד (שנוצר אוטומטית בפלטפורמות מסוימות עם רשימות כללים ארוכות וחוזרות על עצמן) יכול לגרום לכללים שבסופו להישאר חסרי השפעה בשקט.
גלו עוד כלים חינמיים
בדיקת תגיות מטא
בדקו את הכותרת, תיאור המטא, כתובת קנונית, ותגיות Open Graph ו-Twitter Card של כל עמוד.
בדיקת תגיות Hreflang
בדקו את תגיות ה-hreflang של כל עמוד לאיתור הפניה עצמית חסרה, קודים כפולים, וכתובות שאינן הדדיות.
בדיקת הפניות
עקבו אחרי שרשרת ההפניות המלאה של כתובת URL, קפיצה אחר קפיצה, עם קודי סטטוס ואזהרות ללולאות ולקפיצות לא מאובטחות.