בדיקת גישת סורקי AI
טענו את קובץ robots.txt של כל אתר ובדקו האם GPTBot, ClaudeBot, PerplexityBot וסורקי AI נוספים בשם מותרים, מחולק לפי למה כל אחד מהם משמש בפועל.
על הכלי
הכלי טוען את קובץ robots.txt בשורש הכתובת שהזנתם, ובודק אותו מול רשימה נבחרת של user-agent מתועדים בפומבי של סורקי AI מבית OpenAI, Anthropic, Perplexity, Google, Common Crawl, Meta, ByteDance, Apple, Amazon ו-Cohere. כל סורק נבדק באותו אופן שסורק אמיתי פותר את הקובץ: קבוצה שמזכירה במפורש את ה-user-agent הזה חלה אם קיימת, אחרת חלה קבוצת User-agent: * הכללית, אחרת הכל מותר כברירת מחדל.
הסורקים מחולקים לארבע קבוצות כי "סורק AI" הוא לא דבר אחד שאפשר להתיר או לחסום ביחד. סורקי אימון, כמו GPTBot או ClaudeBot, סורקים עמודים כדי לאמן מודל בסיס, חסימתם לא אומרת דבר על האם האתר עדיין נמצא דרך מוצר הצ'אט של אותה חברה, מכיוון שאימון ואחזור חי הם סורקים נפרדים אצל כל ספק ברשימה הזו. סורקי מענה חי, כמו ChatGPT-User או Perplexity-User, שולפים עמוד בזמן אמת כשמישהו בפועל מבקש מהעוזר לפתוח קישור, חסימת אחד מהם יכולה להפוך עמוד ספציפי ללא נראה עבור אותה בקשה מדויקת. סורקי חיפוש AI, כמו PerplexityBot או OAI-SearchBot, מאנדקסים עמודים מראש עבור תכונת החיפוש מבוסס ה-AI של אותה חברה, ופועלים קרוב הרבה יותר לסורק מנוע חיפוש מסורתי. סורקי בדיקת מודעות, כמו OAI-AdsBot של OpenAI, שולפים דף נחיתה של מודעה כדי לוודא שהוא עומד בדרישות איכות ומדיניות לפני שהמודעה יכולה לרוץ, נושא נפרד מאימון או ממתן מענה.
כמו כל כלל robots.txt, זו קונבנציה וולונטרית: היא אומרת לסורק שמתנהג היטב מה לא לבקש, אך היא לא מונעת טכנית שליפת עמוד על ידי סורק שבוחר להתעלם מהקובץ.
גלו עוד כלים חינמיים
בדיקת Robots.txt
טענו וקראו את קובץ robots.txt של כל אתר, ובדקו האם כתובת ספציפית חסומה עבור סורק נתון.
בדיקת מפת אתר XML
טענו ואמתו כל מפת אתר XML: XML פגום, כתובות לא תקינות או כפולות, וערכי שדה שגויים.
בדיקת סתירות מפת אתר מול Robots.txt
מצאו כתובות URL שרשומות במפת האתר שלכם אך חסומות ב-robots.txt שלכם עצמכם.