דוח | איך robots.txt הפך לבלגן המדיניות של הרשת

עודכן לאחרונה ב- May 9, 2026
דוח | איך robots.txt הפך לבלגן המדיניות של הרשת

תקציר מנהלים

הדוח הקודם שאל שאלה מדיניותית: כמה מהאתרים הכי נצפים בעולם אומרים ל־AI crawlers מה מותר להם ומה אסור להם לעשות?

ההמשך הזה שואל את השאלה התפעולית שעומדת מאחוריה: עד כמה robots.txt באמת אמין כתשתית שעליה המדיניות הזאת אמורה לפעול?

התשובה לא נוחה. robots.txt עדיין עובד כי הוא ציבורי, זול, קריא למכונה, וכבר מוכר ל־crawlers. אבל מבקשים ממנו לעשות הרבה יותר ממה שהוא נועד אליו. ב־2026, אותו קובץ טקסט פשוט עשוי לכלול בקרות סריקה ל־SEO, אינדקסים של sitemap, הרחבות ותיקות למנועי חיפוש, ביטולי הסכמה לאימון AI, אוצר מילים של מדיניות שמוזרק מ־Cloudflare, שמירת זכויות יוצרים, ושפה משפטית שמיועדת לסכסוכים עתידיים.

זה חוב תצורה.

הנתונים שמאחורי הדוח הזה הם אותו crawl של Tranco Top 10,000 ששימש במחקר המקורי על AI crawlers. מתוך 10,000 הדומיינים, 6,638 החזירו robots.txt קריא; עוד 610 החזירו 404, שנחשב לפי הפרוטוקול כהרשאה משתמעת. כך מתקבלים 7,248 אתרים לניתוח החלטות גישה של בוטים ו־6,638 קבצים ממשיים לניתוח מורכבות תצורה.

שישה ממצאים בולטים:

  1. רוב קובצי robots.txt קטנים, אבל הזנב הימני מורכב מאוד. הקובץ החציוני הוא רק 834 בייט ו־31 שורות. אבל 1,005 קבצים הם לפחות 5 KB, 273 הם לפחות 20 KB, ו־28 הם לפחות 100 KB. הקובץ הגדול ביותר במדגם הוא 248 KB.

  2. מאות אתרים מובילים מריצים קבצים שדומים יותר לקונפיגורציית ייצור מאשר להערות מדיניות. לקובץ החציוני יש 9 הנחיות Disallow. אבל ל־707 אתרים יש לפחות 100 כללי Disallow, ל־13 יש לפחות 1,000, ל־240 יש לפחות 50 user agents, ול־110 יש לפחות 100 user agents.

  3. הסטייה מהפרוטוקול אינה תיאורטית. מבין 6,638 הקבצים הקריאים, 685 כוללים Crawl-delay, ‏303 כוללים Host, ‏200 כוללים Clean-param, ‏9 כוללים Request-rate, ‏5 כוללים Visit-time, ו־271 כוללים שפת Content-Signal בסגנון Cloudflare. לא כל אלה חלק מאותו תקן מסודר. זהו פולקלור מצטבר של crawlers.

  4. Googlebot מקבל מעמד מיוחד. 562 דומיינים ניתנים לניתוח חוסמים לפחות crawler חיפוש מסורתי אחד. ב־404 מהמקרים האלה, Googlebot מותר בעוד שלפחות crawler חיפוש אחד אחר נחסם. אפליה כלפי AI crawlers לא הופיעה במערכת אקולוגית ניטרלית; robots.txt כבר קודד היררכיה של מנועי חיפוש.

  5. מדיניות AI הופכת את החוב לגלוי יותר. 1,377 קבצים קריאים כוללים שפת מדיניות AI; ‏719 כוללים שפת זכויות יוצרים, תנאים, רישוי או הרשאה; ו־501 כוללים את שתיהן. הקובץ הפך גם לממשק מכונה וגם למסמך משפטי. זה שימושי, אבל שביר.

  6. הקבצים המסוכנים ביותר אינם תמיד הכי אנטי־AI. אתרי ecommerce, נסיעות, רשתות חברתיות, פיננסים, אקדמיה וחדשות כולם מייצרים קבצים מורכבים מסיבות שונות: שליטה בתקציב סריקה, נתיבים ותיקים, תוכן גולשים, שמירת זכויות, וחריגים ספציפיים לבוטים. כללי AI פשוט נבנים שכבה מעל בסיס שכבר מבולגן.

המסקנה המרכזית: robots.txt נשאר ממשק מדיניות הסריקה החשוב ביותר של האינטרנט הציבורי, אבל הוא תשתית חלשה לממשל AI בסיכון גבוה, אלא אם המערכת האקולוגית תעשה סטנדרטיזציה של זהות crawlers, של אוצר המילים לשימושי AI, ושל יכולת ביקורת למדיניות.


מתודולוגיה

הדוח הזה עושה שימוש חוזר בנתונים מהניתוח המקורי של Thunderbit על מדיניות AI crawler בדומיינים של Tranco Top 10,000.

חומרי הקלט היו:

  • tranco_top10k.csv — רשימת הדומיינים המקורית של Tranco Top 10K.
  • out/fetch_meta.csv — סטטוס של fetch, כמות בייטים, scheme, תוצאת redirect, ומטא־דאטה של שגיאות.
  • out/sites.csv — דומיין, דירוג, קטגוריה, שפה, וסטטוס robots.txt.
  • out/site_meta.csv — שורת ניתוח אחת לכל אתר, כולל סוג תבנית, דגלי חסימת AI, גודל קובץ, ושדות סיכום של מדיניות בוטים.
  • out/bot_status.csv — שורה אחת לכל דומיין ולכל crawler, כולל האם הבוט נחסם והאם קיימת הנחיה ספציפית.
  • raw_robots/ — גופי robots.txt שנשמרו במטמון עבור 6,638 האתרים שהחזירו סטטוס 200.

לצורך ההמשך הזה, כל קובץ robots.txt קריא נסרק כדי לזהות:

  • גודל קובץ ומספר שורות;
  • שורות פעילות שאינן הערות;
  • ספירות של הנחיות User-agent, Disallow, Allow ו־Sitemap;
  • הנחיות ותיקות או שאינן ליבה, כמו Crawl-delay, ‏Host, ‏Clean-param, ‏Request-rate ו־Visit-time;
  • אוצר מילים מתקופת ה־AI כולל Content-Signal, ‏llms.txt, ‏AI, ‏LLM, ‏machine learning, ‏TDM, ו־2019/790;
  • אוצר מילים משפטי כגון copyright, תנאי שימוש, רישוי, הרשאה, ושפת שמירת זכויות;
  • טיפול ב־search crawlers עבור Googlebot, Bingbot, DuckDuckBot, Slurp, Baiduspider, ו־YandexBot.

הדוח גם מגדיר ציון חוב תצורה פשוט לצורכי מיון. הוא משלב גודל קובץ, מספר user agents, מספר Disallow, מספר Allow, מספר הנחיות לא־סטנדרטיות, והערבוב בין שפת מדיניות AI לשפה משפטית. הציון לא נועד למדוד נכונות באופן אוניברסלי. הוא נועד לזהות קבצים שסביר שיהיו קשים לתחזוקה, לבחינה או להבנה.

כל הטבלאות והתרשימים המופקים כלולים בתיק המסירה.


ממצא 1: הקובץ החציוני פשוט; הזנב לא

קובץ robots.txt הטיפוסי ברשת המובילה עדיין קטן.

robots-txt-analysis-may-2026.webp

מתוך 6,638 הקבצים הקריאים:

מדדחציוןP90P95P99מקסימום
גודל קובץ834 בייט6.7 KB15.8 KB76.0 KB248.3 KB
שורות312383321,0084,998
שורות פעילות231982828374,998
הנחיות User-agent12139137823
הנחיות Disallow91031764224,997
הנחיות Allow1173369890

ההתפלגות הזו חשובה כי לעיתים קרובות מדברים על robots.txt כאילו היה הצהרה קטנה:

User-agent: *
Disallow: /private/

המודל המחשבתי הזה פשוט לא נכון לגבי מיעוט משמעותי של האינטרנט עתיר התעבורה.

במערך הנתונים הזה:

robots-txt-complexity-thresholds.webp

סף מורכבותאתרים
robots.txt בגודל 5 KB או יותר1,005
בגודל 20 KB או יותר273
בגודל 100 KB או יותר28
לפחות 50 הנחיות User-agent240
לפחות 100 הנחיות User-agent110
לפחות 100 הנחיות Disallow707
לפחות 1,000 הנחיות Disallow13
לפחות 100 הנחיות Allow40

הקבצים הגדולים והמורכבים ביותר אינם סקרנות אקדמית. הם שייכים לנכסים אמיתיים עם תעבורה גבוהה:

דומייןדירוגקטגוריהבייטיםUser-agentDisallowAllow
linkedin.com17רשת חברתית114,341764,184281
runescape.com5,226לא ידוע113,39314,9970
academia.edu832אקדמיה57,384632,044227
etsy.com286ecommerce51,32031,621120
thepaper.cn9,395חדשות56,86711,4960
opentable.com4,137לא ידוע70,494321,683176
alfabank.ru2,625פיננסים73,15821,566133

הקבצים האלה דומים יותר לטבלאות ניתוב בייצור מאשר לססמאות מדיניות. הם מקודדים שנים של השקות מוצרים, נתיבים ותיקים, דפוסי פרמטרים שנחסמו, חריגים ל־crawlers, ניסויי SEO, החלטות CDN, וכעת גם כללי AI crawler.

הזנב אינו רק סיפור של AI. מתוך 273 הקבצים שבגודל 20 KB ומעלה, 131 כוללים שפת מדיניות AI ו־142 לא. מתוך 707 הקבצים עם לפחות 100 הנחיות Disallow, רק 207 כוללים שפת מדיניות AI. במילים אחרות, AI לא יצר את בעיית הקבצים הגדולים. הוא הגיע אחרי שנים של תפעול אינטרנט רגיל שכבר מילא את הקובץ בכללי נתיבים, הפניות ל־sitemap, וחריגים ל־crawlers.

זה חשוב כי תחזוקה תלויה בצורה, לא רק בכוונה. קובץ קטן עם חסימת AI ישירה יכול להיות קל לביקורת. קובץ ecommerce או travel של 70 KB יכול להיות קשה לביקורת גם אם אין בו מילה על AI. הסיכון הוא לא שכל קובץ גדול שגוי. הסיכון הוא שהמדיניות בפועל תהיה קשה מדי לאימות עבור מי שאחראים עליה.

הסיכון התפעולי פשוט: ככל ש־robots.txt גדל, קשה יותר למוציא לאור, למהנדס פלטפורמה, לעורך דין או לראש SEO לענות על השאלה הבסיסית: מה הקובץ הזה באמת מתיר?

השאלה הזו כבר לא טריוויאלית. לפי כללי ניתוח בסגנון RFC, crawler עשוי להתאים קבוצת user-agent ספציפית במקום User-agent: *; התאמות נתיב ארוכות יותר עשויות לגבור על קצרות יותר; Allow ו־Disallow פועלים ביחסי עדיפות; וכללי מניעה כלליים עלולים ללכוד בטעות crawlers חדשים שלא היו קיימים כשהקובץ נכתב.

עבור קובץ של 30 שורות, בן אדם יכול להבין את זה. עבור קובץ של 4,000 שורות עם עשרות בוטים בשמות מפורשים, אף אחד לא אמור.


ממצא 2: robots.txt נושא יותר מאשר כללי סריקה

הדיון על AI crawlers הפך את robots.txt לגלוי פוליטית, אבל הקובץ עצמו כבר צבר אחריות לא קשורה.

קובץ robots.txt מודרני של אתר מוביל יכול לכלול:

  • בקרת נתיבים ל־crawler;
  • גילוי sitemap;
  • הרחבות ספציפיות למנועי חיפוש;
  • רמזים לקצב סריקה;
  • רמזים לקנוניזציה של host;
  • רמזים לניקוי פרמטרי URL;
  • אוצר מילים של מדיניות שהוזרק על ידי CDN;
  • טקסט של שמירת זכויות יוצרים;
  • ביטולי הסכמה לאימון AI;
  • פרשנות משפטית קריאה לבני אדם.

הנתונים מראים את השכבות האלה בבירור.

אותקבציםחלק מהקבצים הקריאים
Crawl-delay68510.3%
Host3034.6%
Clean-param2003.0%
Content-Signal2714.1%
Request-rate90.1%
Visit-time50.1%
אזכור של llms.txt831.3%
שפת copyright, תנאים, רישוי או הרשאה71910.8%
שפת מדיניות AI1,37720.7%

חלק מההנחיות האלה מוכרות היטב ל־crawlers מסוימים. חלקן מוסכמות ותיקות. חלקן תלויות ספק. וחלקן בכלל אינן הנחיות crawler, אלא שפה משפטית או מוצרית שמוטמעת בהערות.

כך נראה drift של פרוטוקול.

Crawl-delay הוא דוגמה טובה. הרבה מפעילי אתרים מכירים אותו, אבל התמיכה בו בין crawlers מרכזיים אינה אחידה. Host ו־Clean-param נקשרו היסטורית להתנהגות של Yandex. ‏Content-Signal הוא חלק מאוצר המילים של מדיניות AI בעידן Cloudflare. ‏llms.txt הוא פורמט סמוך ומוצע לגילוי מידע, לא תקן שמכובד באופן אוניברסלי. ובכל זאת כל אלה מופיעים באותו סוג של קובץ, לעיתים לצד כללי User-agent ו־Disallow קלאסיים.

גם המספרים מראים כיצד מוסכמות ישנות וחדשות מתקיימות זו לצד זו. ‏Crawl-delay מופיע ב־685 קבצים, יותר מכפול מ־271 הקבצים עם Content-Signal. ‏Host מופיע ב־303 קבצים ו־Clean-param ב־200, בעיקר כהד של מוסכמות עידן החיפוש. ‏llms.txt, למרות הדיון הער סביבו בקהילות חיפוש מבוססות AI, מוזכר רק ב־83 קבצים קריאים. הרשת החיה לא מתכנסת לאוצר מילים אחד. היא מערימה אוצרי מילים.

הבעיה היא לא שכל הרחבה בודדת שגויה. הבעיה היא שהקובץ הפך למכולה לא מנוהלת של כמה מערכות ממשל חופפות.

זה יוצר שלושה סוגי חוב:

  1. חוב סמנטי. crawlers שונים עשויים לפרש את אותו קובץ בצורה שונה.
  2. חוב בעלות. ל־SEO, משפט, תשתית, אבטחה ומוצר יכולים להיות כולם סיבות לערוך את הקובץ, אבל אף צוות יחיד לא בהכרח הבעלים של המדיניות כולה.
  3. חוב ביקורת. אתר יכול לפרסם מדיניות שנראית מכוונת, בעוד שרק parser יכול לקבוע את ההתנהגות האפקטיבית שלה.

AI הופך את זה לחשוב יותר כי ההימור השתנה. כשמתעלמים מרמז ותיק לקצב סריקה, התוצאה עשויה להיות עוד תעבורה. כשביטול הסכמה לאימון AI אינו ברור, התוצאה עלולה להפוך לראיה במחלוקת על זכויות יוצרים או רישוי.


ממצא 3: הקובץ הפך גם לממשק מכונה וגם למסמך משפטי

הדוח המקורי על AI crawlers הראה ש־17.0% מהאתרים הניתנים לניתוח כתבו כללים מפורשים ספציפיים ל־AI. ההמשך הזה בוחן את העומס הטקסטואלי שהמדיניות האלה מוסיפה.

protocol-drift-signals-chart.webp

מבין 6,638 קובצי robots.txt הקריאים:

  • 1,377 כוללים שפת מדיניות AI;
  • 719 כוללים שפת copyright, תנאים, רישוי, זכויות או הרשאה;
  • 271 כוללים Content-Signal;
  • 83 מזכירים llms.txt.

החפיפה היא המקום שבו הסיפור נעשה מעניין יותר:

ai-policy-legal-rights-language-overlap.webp

תבנית טקסטואליתקבצים
שפת מדיניות AI ושפת זכויות/משפט501
שפת מדיניות AI בלי שפת זכויות/משפט876
שפת זכויות/משפט בלי שפת AI218
Content-Signal עם שפת זכויות/משפט242
חסימת AI מפורשת עם שפת זכויות/משפט424

זהו סוג חדש של קובץ.

קובץ robots.txt מסורתי מיועד ל־crawlers. קובץ robots.txt עם פתיח משפטי מיועד לפחות לארבעה קהלים בו־זמנית:

  • מפעילי crawlers, שזקוקים להנחיות קריאות למכונה;
  • ספקי חיפוש ו־AI, שזקוקים לאותות מדיניות;
  • עורכי דין, שרוצים שמירת זכויות מפורשת;
  • מבקרים עתידיים, בתי משפט או עיתונאים, שעשויים לקרוא את ההערות כראיה לכוונה.

העיצוב הרב־קהלי הזה מסביר למה קבצים מסוימים כבר נקראים כמו מסמכי מדיניות. אבל הוא גם מחליש את ההפרדה הנקייה בין מה ש־crawler יכול לנתח לבין מה שעורך דין אנושי רוצה להצהיר.

ה־876 קבצים עם שפת מדיניות AI אבל בלי אוצר מילים משפטי הם בעיקר קבצי מדיניות מכונה: שמות בוטים, בלוקי Disallow, ושפה תבניתית. ה־501 קבצים עם שפת AI וגם משפטית שונים. הם מנסים להיות גם הוראות ל־crawler וגם שמירת זכויות באותו זמן. ה־218 קבצים עם שפה משפטית בלי אוצר מילים של AI מראים שהדפוס הזה לא התחיל עם LLMs; כבר קודם נעשה שימוש ב־robots.txt כמקום לציין תנאים, גבולות הרשאה, ותביעות זכויות.

למשל, הערה יכולה לטעון ש־machine learning אסור, בעוד שבלוק ההנחיות בפועל חוסם רק תת־קבוצה של user agents מוכרים. אתר עשוי לטעון לזכויות באופן גורף אבל למנות רק כמה crawlers. תבנית של CDN עשויה להזריק אוצר מילים שקשור ל־AI לתוך קובץ שהמפעיל שלו לא ניסח ידנית את השפה המשפטית שבו. אתר עשוי לכתוב כלל רחב User-agent: * שחוסם בטעות crawlers עתידיים.

מנקודת מבט של ממשל, robots.txt נעשה מושך דווקא כי הוא ציבורי וקריא למכונה. אבל ככל שהוא נושא יותר מדיניות, כך המגבלות שלו משמעותיות יותר:

  • אין שכבת אימות שמוכיחה שמדיניות מסוימת נבדקה על ידי בעל הזכויות ולא הועברה בירושה מהתשתית.
  • אין היסטוריית גרסאות מקורית.
  • אין שדה מובנה לשימוש המיועד, כמו אימון, retrieval, אינדוקס חיפוש, סיכום, caching, או הערכת מודל.
  • אין רישום אוניברסלי של זהויות AI crawlers.
  • אין מנגנון אכיפה.

זה לא הופך את הקובץ לחסר תועלת. זה הופך אותו לשביר.

הפרשנות הטובה יותר היא ש־robots.txt הופך לשכבת הודעה: הצהרה ציבורית וניתנת לבחינה של העדפה וכוונה. הוא לא, בפני עצמו, מערכת ניהול זכויות מלאה.


ממצא 4: החיפוש כבר היה לא שוויוני לפני שה־AI הגיע

אחת המסקנות החזקות בדוח המקורי הייתה שמוציאים לאור רבים מבדילים בין crawlers של אימון AI לבין crawlers של חיפוש. הם חוסמים את CCBot, ‏GPTBot או Google-Extended תוך שמירה על נראות בחיפוש של Google.

ההמשך הזה מוסיף נקודה אחרת: גם crawlers מסורתיים של חיפוש אינם מקבלים יחס שווה.

בדקנו שישה crawlers של חיפוש:

  • Googlebot;
  • Bingbot;
  • DuckDuckBot;
  • Slurp;
  • Baiduspider;
  • YandexBot.

מתוך 7,248 האתרים הניתנים לניתוח:

טיפול ב־search crawlersאתרים
חוסם לפחות crawler חיפוש אחד562
מאפשר Googlebot אבל חוסם לפחות crawler חיפוש אחר אחד404
חוסם את כל ששת ה־search crawlers שנבדקו152

ספירות הבוטים החסומים אינן מתפלגות באופן שווה:

search-crawler-hierarchy.webp

crawler חיפושאתרים שחוסמים אותו
Baiduspider424
YandexBot393
Slurp255
DuckDuckBot231
Bingbot204
Googlebot158

Googlebot הוא ה־crawler שהכי פחות נחסם בסט הזה. ‏Baiduspider ו־YandexBot נחסמים הרבה יותר לעיתים, וברוב המקרים האלה Googlebot נשאר מותר. מבין 404 האתרים שמאפשרים Googlebot אבל חוסמים crawler חיפוש אחר, 269 חוסמים Baiduspider ו־240 חוסמים YandexBot.

הדוגמאות הן של אתרים בולטים:

דומייןcrawlers של חיפוש שנחסמים בזמן ש־Googlebot מותר
facebook.comBaiduspider, YandexBot
apple.comBaiduspider
twitter.comDuckDuckBot, Slurp, Baiduspider, YandexBot
netflix.comDuckDuckBot, Slurp
x.comDuckDuckBot, Slurp, Baiduspider, YandexBot
tiktok.comBaiduspider
baidu.comBingbot, DuckDuckBot, Slurp, YandexBot
washingtonpost.comYandexBot
wsj.comYandexBot
bilibili.comDuckDuckBot, Slurp, YandexBot
temu.comSlurp
t-mobile.comBaiduspider, YandexBot

זה חשוב לדיון על AI כי הוא מראה ש־robots.txt לא היה פרוטוקול ניטרלי של גישה אוניברסלית גם לפני ש־LLM crawlers הגיעו. לאינטרנט הציבורי כבר הייתה היררכיה:

  • Googlebot נשמר לעיתים קרובות כי תעבורת החיפוש של Google יקרה מכדי להסתכן בה.
  • crawlers אזוריים או של מתחרים קלים יותר לחסימה.
  • יש אתרים שמתייחסים לגישה של search crawlers כהחלטה לפי שוק או לפי ספק.

AI crawlers נכנסו למערכת אקולוגית שבה גישה דיפרנציאלית כבר הייתה הנורמה.

זה עושה את מעבר המדיניות לקל יותר להבנה. מוציא לאור שכותב "חסום את Google-Extended, אפשר Googlebot" לא ממציא צורת אפליה חדשה. הוא מחיל דפוס ישן על סוג חדש של crawler: לשמור על הפצה, להגביל חילוץ.

השאלה הפתוחה היא האם הדפוס הישן הזה מתרחב בהצלחה. עם חיפוש, היו רק קומץ crawlers בעלי משמעות כלכלית. עם AI, זהות ה־crawler מפוצלת בין ספקי מודלים, בוטי retrieval, ברוקרי נתונים, crawlers אקדמיים, agents של דפדפן סינתטי, ו־fetchers ברמת התשתית. מספר ה־user agents הממוספרים ימשיך לגדול אלא אם המערכת האקולוגית תתכנס סביב קבוצה קטנה יותר של אותות מבוססי־מטרה.

כך חוב תצורה מצטבר.


ממצא 5: המורכבות משתנה לפי סקטור, אבל לא כמו שיעורי החסימה של AI

הדוח המקורי הראה פער מגזרי גדול בחסימת AI: חדשות חוסמות בשיעורים גבוהים; טלקום, ממשל ו־SaaS חוסמים בשיעורים נמוכים.

מורכבות תצורה חותכת את הרשת אחרת.

בקרב קטגוריות נבחרות שבהן יש מספיק קובצי robots.txt קריאים להשוואה שימושית:

קטגוריהnבייטים חציונייםבייטים P90Disallow חציוניDisallow P90User-agent חציוניUser-agent P90
ecommerce2151,73810,38837164349
travel632,07427,36841779534
חדשות6471,5347,03919114668
פיננסים1211,0028,33717132223
אקדמיה2538393,9591475111
ממשל1511,2273,263134614
SaaS36848512,606456110
dev tools1192739,255358110

P90 Disallow by category chart here<<<<<<<<<<<<<<<<<<<<<<<<<

חדשות הן מורכבות פוליטית כי הן כותבות כללי AI מפורשים וטקסט משפטי. אבל ecommerce ו־travel מורכבים תפעולית כי יש להם קטלוגים גדולים, ניווט רב־שכבתי, דפי תוצאות חיפוש, פילטרים, נתיבי חשבונות משתמש, ו־URLs עם פרמטרים.

ההבחנה הזו חשובה.

Travel הוא המקרה הברור ביותר. יש בו רק 63 קבצים קריאים בחתך הקטגוריה הזה, אבל ה־P90 של robots.txt הוא 27.4 KB וספירת ה־P90 של Disallow היא 779, הרבה מעל חדשות. זה לא אומר שלאתרי travel יש מדיניות AI מפותחת יותר. זה אומר שלאתרי travel יש יותר משטחים שמפעילי crawlers עלולים לבזבז עליהם תקציב: חיפושי תאריכים, דפי זמינות, דפדוף בביקורות, תהליכי הזמנה, צירופי פילטרים, ונתיבי מלאי מקומיים.

SaaS הוא סוג אחר של הפתעה. הקובץ החציוני שלו הוא רק 485 בייט, אבל קובץ ה־P90 קופץ ל־12.6 KB. רוב אתרי ה־SaaS פתוחים וקלילים; קבוצה קטנה יותר נושאת קבצי בקרה ארוכים של נתיבים, לעיתים כי תיעוד, אזורי התחברות, מסלולי אפליקציה ודפי שיווק חיים תחת אותו דומיין.

חדשות יושבות באמצע מבחינה תפעולית אבל קרובות לראש מבחינה פוליטית. ספירת ה־P90 של User-agent היא 68, גבוהה יותר מאשר ecommerce, travel, פיננסים, אקדמיה, ממשל, SaaS ו־dev tools בטבלה הזו. זה סימן למדיניות ספציפית לבוטים, לא רק להיגיינת נתיבים.

קובץ ה־robots.txt של מוציא לאור עשוי להיות מורכב בגלל מדיניות זכויות. קובץ של marketplace עשוי להיות מורכב בגלל ניהול תקציב סריקה. קובץ של אוניברסיטה עשוי להיות מורכב כי אלפי נתיבים ותיקים הצטברו תחת דומיין אחד. קובץ של פלטפורמה חברתית עשוי להיות מורכב כי עליה לחשוף חלק מהמשטחים ולהסתיר אחרים בהיקף עצום.

מדיניות AI נוחתת על כל זה מלמעלה. היא לא מחליפה את הסיבות הקיימות לכך שקובץ הוא מורכב.

זה עוזר להסביר למה ממשל AI בעידן robots.txt לא יכול להיפתר באמצעות block list אוניברסלי. לקבצים הבסיסיים יש עבודות שונות:

  • אתרי ecommerce מנהלים נתיבים כפולים ומשטחי מלאי;
  • אתרי travel מנהלים רשימות, לוחות שנה, ביקורות ודפי חיפוש דינמיים;
  • אתרי חדשות מנהלים זכויות יוצרים, ארכיונים ועמדת רישוי;
  • אתרי SaaS ו־dev tools לעיתים דווקא רוצים נראות ב־AI;
  • ממשלות לעיתים צריכות גישה ציבורית אך עדיין יש להן מערכות רגישות שיש להוציא;
  • פלטפורמות חברתיות מנהלות תוכן גולשים, משטחי פרופיל ודאגות נגד ניצול לרעה.

אותו כלל ל־AI crawler אומר דברים שונים בכל סביבה.


ממצא 6: מדד חוב תצורה מזהה סיכון לביקורת, לא כישלון מוסרי

הניתוח הזה יצר ציון חוב תצורה פשוט כדי לזהות קובצי robots.txt שסביר שיהיו קשים לבחינה.

הציון משקלל:

  • גודל קובץ;
  • מספר הנחיות User-agent;
  • מספר הנחיות Disallow;
  • מספר הנחיות Allow;
  • מספר הנחיות שאינן ליבה;
  • נוכחות של שפת מדיניות AI;
  • שילוב של חסימת AI מפורשת ושפה משפטית או של copyright.

זה לא ציון נכונות. קובץ מורכב מאוד יכול להיות מכוון לחלוטין. קובץ פשוט מאוד עדיין יכול להיות שגוי. המטרה היא מיון: אם קובץ גדול, עמוס מדיניות, ספציפי לבוטים, ומלא חריגים, הוא ראוי למשמעת ביקורת חזקה יותר.

configuration-debt-review-queue.webp

התפלגות הציון תלולה. הקובץ הקריא החציוני מקבל 1.74. ה־P90 הוא 13.29, ה־P95 הוא 15.00, וה־P99 הוא 27.57. רק 366 קבצים מקבלים לפחות 15, ‏80 מקבלים לפחות 25, ו־41 מקבלים לפחות 30. זו רשימת הביקורת המעשית: לא כל אתר צריך פרויקט ממשל, אבל הזנב העליון כן.

גם מבט הקטגוריות מראה למה תווית אחת של "חוסם AI" היא שטוחה מדי:

קטגוריהציון חציוניציון P90
travel4.9228.94
search2.9724.23
רשת חברתית2.2515.00
חדשות4.9114.92
פיננסים1.6712.61
SaaS0.9811.85
ecommerce3.8810.87
ממשל1.576.38

Travel ו־search מציגות את ציוני ה־P90 הגבוהים ביותר כי מיעוט מהקבצים נעשה גדול מאוד ועמוס חוקים. חדשות מציגות את אחד הציונים החציוניים הגבוהים ביותר כי שפת מדיניות וטיפול ספציפי לבוטים נפוצים יותר בכל הקטגוריה. ל־ecommerce יש מספר Disallow חציוני גבוה, אבל ציון החוב ב־P90 נמוך מזה של travel כי המורכבות מרוכזת יותר בכללי נתיבים מאשר באותות מדיניות/משפט מעורבים.

הקבצים בעלי הציון הגבוה ביותר במערך הנתונים הזה כוללים:

דומייןלמה הוא מקבל ציון גבוה
linkedin.comקובץ גדול מאוד, אלפי כללי נתיבים, הרבה user agents בשמותיהם, שפת מדיניות AI מפורשת
lnkd.inאותה מעטפת מדיניות כמו תשתית קישורי הקיצור של LinkedIn
fragrantica.comמאות בלוקים של user-agent בשמות מפורשים ועוד שפת מדיניות AI
sovcombank.ruמאות בלוקים של user-agent ושפה משפטית/מדיניות
academia.eduמטריצת allow/disallow גדולה ומדיניות חסימת AI מפורשת
opentable.comסט גדול של כללי נתיבים, הרבה הנחיות sitemap, ומשטח מדיניות שקשור ל־AI
etsy.comקובץ שליטה בנתיבים ל־ecommerce עם יותר מ־1,600 כללי Disallow
runescape.comכמעט 5,000 הנחיות Disallow תחת קבוצת user-agent אחת

לא צריך ללעוג לקבצים האלה על כך שהם מורכבים. מורכבות משקפת לעיתים קרובות צרכים עסקיים אמיתיים. אבל הם מדגימים למה מדיניות robots.txt ראויה לאותה משמעת הנדסית כמו תצורת ייצור אחרת:

  • הבעלות צריכה להיות מפורשת;
  • שינויים צריכים לעבור סקירה;
  • מקטעים שנוצרו אוטומטית צריכים להיות מסומנים;
  • הערות משפטיות צריכות להיות מופרדות מהוראות מכונה כשאפשר;
  • מקרי בדיקה צריכים לאמת גישת בוטים צפויה עבור crawlers קריטיים;
  • היסטוריית גרסאות צריכה להישמר;
  • שמות בוטים ותיקים צריכים לצאת משימוש או להיות מתועדים;
  • אימון AI, אחזור AI, אינדוקס חיפוש וארכוב צריכים להיחשב מטרות נפרדות.

הנקודה האחרונה היא החשובה ביותר. התחביר הנוכחי הוא קודם כול user-agent: הוא מבקש ממפעילי אתרים למנות בוטים. הצורך בעידן ה־AI הוא קודם כול מטרה: הוא מבקש ממפעילי אתרים לומר אילו שימושים מותרים.

אלה לא אותם דברים.

הפער הזה הוא הסיבה לכך שרשימות חסימה ארוכות יותר לא יתיישנו יפה. מוציא לאור יכול להוסיף היום GPTBot, ‏ClaudeBot, ‏CCBot, ‏Google-Extended, ‏Bytespider, ‏Applebot-Extended, ו־PerplexityBot, אבל שם ה־crawler הבא, סוכן retrieval או ברוקר dataset יכולים להופיע מחר. מדיניות מבוססת מטרה תאפשר לאתר לומר "אינדוקס חיפוש כן, אימון AI לא, retrieval ביוזמת משתמש אולי" בלי להפוך את robots.txt לספר טלפונים של בוטים.


מה זה אומר עבור ממשל AI

הדיון הציבורי נוטה למסגר את robots.txt כמשמעותי או כמיושן. הנתונים מציעים תשובה מעשית יותר:

robots.txt הוא משמעותי, אבל עמוס מדי.

הוא משמעותי כי אתרים גדולים משתמשים בו, crawlers יכולים לנתח אותו, והבחירות במדיניות נראות לחוקרים, עיתונאים, ספקים ובתי משפט. הדוח המקורי מצא ש־17.0% מהאתרים המובילים שניתנים לניתוח כתבו כללי AI מכוונים. זה לא רעש סמלי.

הוא עמוס מדי כי הקובץ צריך עכשיו להביע יותר מגישה לבוטים:

  • "אל תאמן על התוכן הזה."
  • "מותר לך להשתמש בתוכן הזה לאינדוקס חיפוש."
  • "מותר לך להשתמש בתוכן הזה לשליפת מידע בזמן אמת."
  • "אסור לך ליצור מערכי נתונים במטמון."
  • "שמירת הזכויות המשפטית הזו חלה לפי דיני text-and-data-mining של האיחוד האירופי."
  • "האתר הזה שמנוהל על ידי CDN שולח Content-Signal: ai-train=no."
  • "האתר הזה רוצה את Googlebot אבל לא את YandexBot."
  • "לאתר הזה יש 1,000 נתיבי URL ותיקים שלא אמורים להיסרק."

התחביר לא תוכנן לכל כך הרבה משימות.

שלושה שינויים יצמצמו את החוב:

  1. זהות crawlers צריכה רישום. מפעילי אתרים לא צריכים לנהל רשימה הולכת וגדלה של GPTBot, ‏ClaudeBot, ‏anthropic-ai, ‏CCBot, ‏Google-Extended, ‏Applebot-Extended, ‏Bytespider, ‏OAI-SearchBot, ‏ChatGPT-User, ועוד עשרות. בלי רישום, המדיניות תמיד תפגר אחרי התנהגות ה־crawler.

  2. שימושי AI צריכים אוצר מילים מובנה. אימון, retrieval, אינדוקס, סיכום, מכירת dataset, הערכת מודל, וגלישה ביוזמת משתמש הם שימושים שונים. לבטא אותם דרך שמות user-agent תלויי ספק זה שביר.

  3. מדיניות צריכה יכולת ביקורת. האינטרנט צריך דרך להבדיל בין שמירת זכויות שנכתבה ביד לבין ברירות מחדל של CDN שעברו בירושה, תבניות CMS שנוצרו אוטומטית, כללים ותיקים שהשתמרו, וחסימות גורפות בשוגג. ההבדל חשוב לאמון וגם לליטיגציה.

שום דבר מזה לא אומר להחליף את robots.txt בן לילה. הדרך הטובה יותר היא שכבתיות: לשמור על robots.txt כממשק גילוי ותאימות, אבל לסטנדרט שכבת מדיניות קריאת־מכונה סמוכה עבור שימושים ספציפיים ל־AI.

llms.txt הוא ניסיון אחד כזה, אבל האימוץ שלו במערך הנתונים הזה עדיין זעיר: רק 83 קבצים קריאים מזכירים אותו. Content-Signal בולט יותר כי Cloudflare יכולה להפיץ אותו דרך התשתית, וכל 271 קובצי Content-Signal בסריקה הזו גם התאימו לשפת מדיניות AI. ועדיין, הפצה אינה אותו דבר כמו קונצנזוס. פתרון עמיד כנראה ידרוש את המכונה המשעממת של סטנדרטיזציה: שדות ברורים, סמנטיקה ברורה, התחייבויות של crawlers, ומערכי בדיקה ציבוריים.


מסקנה

המאבק סביב AI crawlers הפך את robots.txt לחפץ ממשלי. זה גם שימושי וגם מסוכן.

שימושי, כי הקובץ ציבורי. חוקרים יכולים לבחון אותו. מוציאים לאור יכולים לשנות אותו. crawlers יכולים לכבד אותו. בתי משפט יכולים לקרוא אותו. ספקי תשתית יכולים לפרוס אותו בקנה מידה גדול.

מסוכן, כי הוא נושא יותר מדי.

קובץ ה־robots.txt החציוני ב־Tranco Top 10K עדיין קטן מספיק להבנה. אבל הזנב הארוך של הרשת עתיר התעבורה מלא בקבצים גדולים, ישנים, רב־שכבתיים, תלויי ספק, וטעונים משפטית. מאות אתרים מנהלים היום תצורות robots.txt שעדיף להבין אותן כמערכות מדיניות בייצור ולא כרמזים פשוטים ל־crawler.

השיעור המרכזי הוא לא ש־robots.txt נכשל. הוא שהרשת קידמה אותו בלי לעשות לו refactor.

אם מדיניות גישת AI עומדת להישען על הצהרות ציבוריות קריאות למכונה, הצעד הבא אינו עוד רשימת חסימה ארוכה יותר. הוא תשתית מדיניות טובה יותר: הרשאות מבוססות מטרה, זהות crawler יציבה, תבניות שניתן לבקר, ונתיבי ביקורת.

עד אז, שכבת הממשל של AI באינטרנט הציבורי תמשיך להישען על קובץ טקסט שמעולם לא נועד לשאת משקל כזה.


הערות לשחזור

תיק המסירה כולל:

  • source_data/analysis.json — מדדי האגרגציה המקוריים.
  • source_data/site_meta.csv — הטבלה האנליטית המקורית ברמת אתר.
  • source_data/bot_status.csv — טבלת המדיניות המקורית ברמת דומיין מול בוט.
  • source_data/fetch_meta.csv — מטא־דאטת fetch מקורית.
  • source_data/sites.csv — טבלת הדומיין/קטגוריה/סטטוס המקורית.
  • derived_data/robots_complexity_by_site.csv — מדדי מורכבות ברמת אתר שנוצרו עבור דוח זה.
  • derived_data/search_bot_treatment.csv — מטריצת טיפול ב־search crawlers.
  • derived_data/category_complexity_summary.csv — סיכום מורכבות ברמת קטגוריה.
  • derived_data/top_config_debt_sites.csv — האתרים המובילים לפי ציון המיון שתואר לעיל.
  • derived_data/summary_metrics.json — כל מדדי הכותרת שצוטטו בדוח הזה.

הורדת כל הסקריפטים ומערכי הנתונים


תיקוני מתודולוגיה, בעיות במערך הנתונים וניתוחים נוספים יתקבלו בברכה ב־ support@thunderbit.com. הדוח הזה פורסם באופן עצמאי מכל עמדה מסחרית ש־Thunderbit מחזיקה; אנחנו בונים AI web scraper, ויש לנו עניין מבני בכך ש־robots.txt יישאר חוזה משמעותי וקריא למכונה ברשת הציבורית. הנתונים בדוח הזה עומדים בפני עצמם. — צוות המחקר של Thunderbit, מאי 2026.

נסו את Thunderbit ל־AI Web Scraping Get Started Free

Shuai Guan
Shuai Guan
מנכ"ל Thunderbit | מומחה לאוטומציה של נתונים באמצעות AI Shuai Guan הוא המנכ"ל של Thunderbit ובוגר הפקולטה להנדסה של אוניברסיטת מישיגן. עם כמעט עשור של ניסיון בטכנולוגיה ובארכיטקטורת SaaS, הוא מתמחה בהפיכת מודלים מורכבים של AI לכלי חילוץ נתונים פרקטיים, ללא קוד. בבלוג הזה הוא משתף תובנות ישירות מהשטח, שנבחנו בפועל, על Web Scraping ואסטרטגיות אוטומציה שיעזרו לכם לבנות תהליכי עבודה חכמים יותר, מבוססי נתונים. כשאינו משפר תהליכי נתונים, הוא מביא את אותה תשומת לב לפרטים גם לתשוקה שלו לצילום.
תוכן עניינים

גרדו דף אינטרנט פשוט על ידי בקשה

תגידו מה צריך באנגלית פשוטה. או אפילו לא צריך להגיד כלום.

נסו את Thunderbit חינם
חילוץ נתונים באמצעות AI
העבירו נתונים בקלות ל-Google Sheets, Airtable או Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week