Η άνοδος του llms.txt: Πώς οι ιστότοποι σηματοδοτούν στην AI

Τελευταία ενημέρωση στις May 8, 2026
Η άνοδος του llms.txt: Πώς οι ιστότοποι σηματοδοτούν στην AI
Εξαγωγή δεδομένων με την υποστήριξη του Thunderbit.

Μια μελέτη βασισμένη σε crawl για το πώς ιστότοποι υψηλής επισκεψιμότητας δημοσιεύουν αναγνώσιμες από μηχανές οδηγίες για μεγάλα γλωσσικά μοντέλα, πώς μοιάζουν οι πρώτες υλοποιήσεις και γιατί η μέτρηση της υιοθέτησης απαιτεί περισσότερα από το να μετράς αποκρίσεις HTTP 200.

  • Σύνολο δεδομένων: data/llms_probe_results_top_10000.csv
  • Λίστα Tranco που κατεβήκε: 6 Μαΐου 2026
  • Πεδίο: /llms.txt και /llms-full.txt στο ριζικό επίπεδο

Βασικές Μετρικές

llms-txt-adoption-landscape.webp

  • 5,86%: Έγκυρη υιοθέτηση του llms.txt στο Tranco Top 10.000, δηλαδή 586 domains.
  • 1,03%: Έγκυρη υιοθέτηση του llms-full.txt, δηλαδή 103 domains. Κάθε έγκυρος πλήρης adopter είχε επίσης έγκυρο αρχείο ευρετηρίου.
  • 63,51%: Ποσοστό αποκρίσεων HTTP 200 για /llms.txt που απέτυχαν στη validation.
  • 2,74x: Προσεγγιστική υπερεκτίμηση αν η υιοθέτηση μετριόταν μόνο με ακατέργαστες αποκρίσεις HTTP 200.

Εκτελεστική Σύνοψη

Το llms.txt παραμένει ακόμη μια πρώιμη σύμβαση του web, αλλά δεν είναι πια ένα περιθωριακό πείραμα. Σε ένα crawl της 6ης Μαΐου 2026 στα 10.000 domains του Tranco Top 10.000, η μελέτη εντόπισε 586 έγκυρα αρχεία llms.txt, δηλαδή ποσοστό υιοθέτησης 5,86%. Το συνοδευτικό llms-full.txt ήταν πολύ πιο σπάνιο: 103 domains είχαν έγκυρο πλήρες αρχείο, για ποσοστό υιοθέτησης 1,03%.

Το πιο σημαντικό μεθοδολογικό εύρημα είναι ότι οι κωδικοί κατάστασης είναι κακός δείκτης υιοθέτησης. Ο crawler κατέγραψε 1.606 αποκρίσεις HTTP 200 για /llms.txt, αλλά μόνο 586 πέρασαν τη validation. Οι υπόλοιπες 1.020 ήταν κυρίως ανακατευθύνσεις εκτός στόχου, γενικές σελίδες HTML, άδεια σώματα ή άλλες άκυρες αποκρίσεις. Ένας αφελής crawler που μετρά κάθε απόκριση 200 ως υιοθέτηση θα υπερεκτιμούσε την πραγματική υιοθέτηση κατά περίπου 2,74 φορές.

Μεταξύ των έγκυρων adopters, η ποιότητα υλοποίησης είναι υψηλότερη απ’ όσο θα υπέθετε κανείς από μια απλή ιστορία “placeholder”. Το διάμεσο μέγεθος ενός έγκυρου αρχείου ήταν περίπου 7,1 KB, το 61,77% των έγκυρων αρχείων ήταν μεγαλύτερα από 5 KB, το 70,82% περιείχαν έξι ή περισσότερες ενότητες Markdown και το 77,47% περιείχαν 11 ή περισσότερους συνδέσμους Markdown. Στους πρώιμους adopters περιλαμβάνονται οι Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog και Cloudinary.

Το llms.txt κατανοείται καλύτερα ως ένα επεξηγηματικό και πλοηγητικό σήμα για συστήματα AI, όχι ως αντικατάσταση του robots.txt. Η αξία του δεν είναι απλώς ότι υπάρχει ένα αρχείο, αλλά αν αυτό βοηθά τις μηχανές να βρίσκουν έγκυρες, σύντομες και επίκαιρες πληροφορίες.

Πλαίσιο: Το Web Προσθέτει Σήματα για AI

Οι ιστότοποι χρησιμοποιούν εδώ και χρόνια το robots.txt για να εκφράζουν προτιμήσεις των crawler, το sitemap.xml για να βελτιώνουν την ανακάλυψη URLs και τα δομημένα δεδομένα για να βοηθούν τις μηχανές αναζήτησης και τις πλατφόρμες να ερμηνεύουν τις σελίδες. Η γενετική AI εισάγει ένα διαφορετικό πρόβλημα. Το περιεχόμενο μπορεί να χρησιμοποιηθεί για εκπαίδευση, ανάκτηση, σύνοψη, agentic browsing, βοήθεια σε κώδικα, υποστήριξη πελατών και δημιουργία απαντήσεων. Αυτό δημιουργεί δύο ταυτόχρονες ανάγκες: οι εκδότες θέλουν περισσότερο έλεγχο στη μη αυτοματοποιημένη χρήση, αλλά θέλουν επίσης τα συστήματα AI να βρίσκουν τη σωστή canonical πληροφορία όταν πράγματι αλληλεπιδρούν με τους ιστότοπούς τους.

Η αρχική πρόταση για το llms.txt, που παρουσιάστηκε από τον Jeremy Howard το 2024, περιγράφει το αρχείο ως ένα έγγραφο Markdown τοποθετημένο στο ριζικό επίπεδο ενός ιστότοπου για να παρέχει πληροφορίες φιλικές προς LLM κατά το inference. Η πρόταση υποστηρίζει ότι οι HTML σελίδες συχνά περιέχουν πλοήγηση, διαφημίσεις, scripts και άλλο θόρυβο που τις κάνει δυσκολότερες στην επεξεργασία από γλωσσικά μοντέλα. Ένα σύντομο αρχείο Markdown μπορεί να κατευθύνει τα μοντέλα προς τις πιο σημαντικές σελίδες, τα docs, τα APIs, τα παραδείγματα, τις πολιτικές και τις πληροφορίες προϊόντος.

Η εξωτερική web έρευνα δίνει το ευρύτερο υπόβαθρο. Το “Consent in Crisis” της Data Provenance Initiative περιγράφει μια ταχεία αύξηση των περιορισμών που σχετίζονται με AI στο robots.txt και στους όρους χρήσης, και υποστηρίζει ότι οι υπάρχοντες μηχανισμοί συναίνεσης του web δεν σχεδιάστηκαν για επαναχρησιμοποίηση δεδομένων AI σε μεγάλη κλίμακα. Το Cloudflare Radar AI Insights έχει επίσης καταστήσει ορατά τα μοτίβα AI crawler και robots.txt στο επίπεδο των top 10.000 domains. Σε αυτό το περιβάλλον, το llms.txt βρίσκεται στην εποικοδομητική πλευρά της σηματοδότησης προς την AI: όχι «μην κάνεις crawl εδώ», αλλά «αν χρειάζεται να καταλάβεις αυτόν τον ιστότοπο, ξεκίνα από εδώ».

Εξωτερικά Στοιχεία και η Συζήτηση για την Υιοθέτηση

Η δημόσια συζήτηση γύρω από το llms.txt διχάζεται ανάμεσα σε δύο ισχυρισμούς. Ο αισιόδοξος ισχυρισμός είναι ότι το αρχείο δίνει στα συστήματα AI καθαρότερη και πιο αποτελεσματική πρόσβαση σε έγκυρο περιεχόμενο. Ο σκεπτικιστικός ισχυρισμός είναι ότι κανένας μεγάλος πάροχος LLM δεν έχει δεσμευτεί δημόσια να το χρησιμοποιεί ως σήμα κατάταξης, crawling ή αναφοράς, άρα οι εκδότες δεν θα πρέπει να περιμένουν αύξηση επισκεψιμότητας μόνο από το αρχείο. Οι τρεις εξωτερικές αναφορές που εξετάστηκαν για αυτή την ενημέρωση στηρίζουν ένα πιο σύνθετο συμπέρασμα: το llms.txt είναι χρήσιμη υποδομή, αλλά τα στοιχεία για άμεσο αντίκτυπο στην επισκεψιμότητα παραμένουν περιορισμένα και εξαρτώμενα από το πλαίσιο.

Τα Εξωτερικά Benchmarks Υιοθέτησης Κινούνται Γρήγορα

Το adoption tracker της Rankability ανέφερε ποσοστό υιοθέτησης 0,3% στο top 1.000 websites έως τις 22 Ιουνίου 2025, δηλαδή 3 στα 1.000 sites. Περιγράφει μηνιαίο αυτοματοποιημένο scanning του domain.com/llms.txt, με validation που αποκλείει ανακατευθύνσεις και αποκρίσεις HTML. Αυτή η μεθοδολογία είναι κατευθυντικά παρόμοια με τη συντηρητική προσέγγιση validation της παρούσας μελέτης.

Η διαφορά στα αποτελέσματα είναι μεγάλη: η μελέτη αυτή βρήκε 75 έγκυρα αρχεία llms.txt στο Tranco Top 1.000 στις 6 Μαΐου 2026, δηλαδή 7,50%. Οι δύο αριθμοί δεν πρέπει να αντιμετωπιστούν ως αυστηρή χρονοσειρά, επειδή η πηγή κατάταξης, οι λεπτομέρειες υλοποίησης, η λογική validation και ο χρόνος του crawl μπορεί να διαφέρουν. Παρ’ όλα αυτά, η αντίθεση δείχνει ότι η υιοθέτηση άλλαξε ουσιαστικά μεταξύ μέσων του 2025 και Μαΐου 2026, ειδικά σε ιστότοπους με έμφαση σε developer, SaaS, cloud, security και documentation.

ΠηγήΣτιγμιότυποΔείγμαΑναφερόμενη έγκυρη υιοθέτησηΕρμηνεία
Rankability22 Ιουνίου 2025Top 1.000 websites0,3%Πρώιμο δημόσιο benchmark που δείχνει ελάχιστη υιοθέτηση στα μέσα του 2025.
Αυτή η μελέτη6 Μαΐου 2026Tranco Top 1.0007,50%Μεταγενέστερο crawl που δείχνει ορατή υιοθέτηση σε ιστότοπους υψηλής επισκεψιμότητας.
Αυτή η μελέτη6 Μαΐου 2026Tranco Top 10.0005,86%Ευρύτερο δείγμα που δείχνει ότι η υιοθέτηση είναι μετρήσιμη αλλά όχι mainstream.

Τα Πειράματα Επισκεψιμότητας Παραμένουν Ανάμεικτα

Το Search Engine Land δημοσίευσε τον Ιανουάριο του 2026 μια ανάλυση 10 sites που παρακολουθούσε τους ιστότοπους για 90 ημέρες πριν και 90 ημέρες μετά την υλοποίηση. Το άρθρο ανέφερε ότι δύο sites είδαν αύξηση AI traffic κατά 12,5% και 25%, οκτώ δεν είδαν μετρήσιμη βελτίωση και ένα σημείωσε πτώση 19,7%. Η βασική του ερμηνεία ήταν η αιτιώδης επιφύλαξη: οι δύο φαινομενικές επιτυχίες είχαν επίσης λανσάρει νέα templates, αναδομήσει resource centers, προσθέσει συγκρίσιμους πίνακες που εξάγονται εύκολα, κερδίσει κάλυψη από τον Τύπο, διορθώσει τεχνικά ζητήματα ή δημοσιεύσει νέο περιεχόμενο τύπου FAQ. Σε αυτό το πλαίσιο, το llms.txt τεκμηρίωνε ισχυρότερο περιεχόμενο και τεχνική δουλειά· δεν φαινόταν να προκάλεσε από μόνο του την ανάπτυξη.

Το πείραμα στο προσωπικό blog του Renat Alimbekov κατέληξε σε πιο θετικό συμπέρασμα από μια μικρότερη παρατήρηση σε επίπεδο site. Σύγκρινε δύο περιόδους τεσσάρων μηνών στο Yandex.Metrica μετά την προσθήκη τόσο του llms.txt όσο και του llms-full.txt. Τα sessions referral από LLM αυξήθηκαν από 75 σε 92, δηλαδή κατά 23%, ενώ οι χρήστες αυξήθηκαν από 51 σε 64. Τα sessions από Perplexity αυξήθηκαν από 29 σε 55, ενώ τα sessions από ChatGPT μειώθηκαν από 31 σε 26. Το ίδιο post σημειώνει επίσης ότι η συνολική επισκεψιμότητα referral αυξήθηκε πιο γρήγορα, από 160 σε 290 sessions, οπότε το μερίδιο των sessions από LLM έπεσε από 47% σε 32%.

Τύπος στοιχείουΠαρατηρούμενο αποτέλεσμαΚύρια επιφύλαξηΠώς επηρεάζει αυτή την αναφορά
10-site πριν/μετά μελέτη του Search Engine LandΔύο sites ανέβηκαν, οκτώ δεν είχαν μετρήσιμη αλλαγή, ένα έπεσε.Οι θετικές περιπτώσεις είχαν ταυτόχρονες αλλαγές σε περιεχόμενο, PR και τεχνικά θέματα.Υποστηρίζει ότι το llms.txt είναι υποδομή, όχι αυτόνομος μοχλός ανάπτυξης.
Προσωπική παρατήρηση πριν/μετά στο blog του AlimbekovΤα sessions referral από LLM αυξήθηκαν 23% στην περίοδο μετά.Δεν υπάρχει ομάδα ελέγχου· η συνολική επισκεψιμότητα referral αυξήθηκε 81% και το μερίδιο LLM μειώθηκε.Υποδηλώνει πιθανό όφελος για τεχνικά blogs, ειδικά μέσω Perplexity, αλλά η αιτιότητα δεν απομονώνεται.
Αυτή η μελέτη υιοθέτησης με βάση crawl586 έγκυρα αρχεία και πολλές δομημένες υλοποιήσεις.Μετρά παρουσία και δομή, όχι downstream αντίκτυπο στην επισκεψιμότητα.Δείχνει υιοθέτηση και ωριμότητα υλοποίησης, αλλά όχι ROI από μόνη της.

Τι Αποσαφηνίζει η Συζήτηση

Τα εξωτερικά στοιχεία οξύνουν την ερμηνεία αυτού του συνόλου δεδομένων. Ένα καλά δομημένο αρχείο llms.txt μπορεί να μειώσει την τριβή στην ανάλυση από μηχανές, ειδικά για documentation σε developer sites, αναφορές API και περιεχόμενο knowledge base. Όμως οι ισχυρότερες περιπτώσεις επισκεψιμότητας φαίνεται ακόμη να εξαρτώνται από περιεχόμενο που είναι χρήσιμο, εξαγώγιμο, έγκυρο και ανακαλύψιμο και πέρα από το αρχείο. Γι’ αυτό, το πρακτικό ερώτημα δεν είναι «το llms.txt έχει σημασία;» απομονωμένα. Είναι αν το αρχείο αποτελεί μέρος ενός ευρύτερου συστήματος περιεχομένου που διαβάζεται από AI.

Ενημερωμένη ερμηνεία: Το llms.txt θα πρέπει να υλοποιείται ως χαμηλού κόστους υποδομή για AI. Δεν θα πρέπει να παρουσιάζεται ως υποκατάστατο καλύτερης τεκμηρίωσης, δομημένου περιεχομένου, τεχνικής προσβασιμότητας, παραπομπών, συνδέσμων ή αυθεντίας του brand.

Δοκιμάστε το Thunderbit για AI web scraping

Μεθοδολογία

Η μελέτη χρησιμοποίησε τα 10.000 domains του Tranco Top 10.000 ως δείγμα. Το Tranco είναι μια κατάταξη top sites με ερευνητικό προσανατολισμό, σχεδιασμένη να είναι πιο σταθερή και πιο ανθεκτική σε χειραγώγηση από πολλές παραδοσιακές λίστες. Το αρχείο πηγής Tranco κατεβήκε στις 6 Μαΐου 2026, με timestamp Last-Modified πηγής 5 Μαΐου 2026 στις 22:17:59 GMT.

Ο crawler έλεγξε δύο διαδρομές στο ριζικό επίπεδο για κάθε domain:

  • https://example.com/llms.txt, με fallback σε HTTP όπου χρειαζόταν.
  • https://example.com/llms-full.txt, με fallback σε HTTP όπου χρειαζόταν.

Για κάθε probe, ο crawler κατέγραψε κωδικό κατάστασης, τελικό URL, μέθοδο fetch, bytes απόκρισης, content type, μήνυμα σφάλματος, χρόνο εκτέλεσης και αποτέλεσμα validation. Τα επιτυχημένα σώματα αποκρίσεων αποθηκεύτηκαν στο raw_llms_txt/ για έλεγχο και δευτερογενή ανάλυση.

Κανόνες Validation

Μια απόκριση μετρήθηκε ως έγκυρο αρχείο μόνο αν επέστρεψε επιτυχημένο body και δεν έμοιαζε με γενικό web fallback. Η τελική διαδρομή URL έπρεπε να παραμείνει /llms.txt ή /llms-full.txt. Τα άδεια σώματα απορρίφθηκαν. Προφανή έγγραφα HTML και app shells απορρίφθηκαν. Το content type αντιμετωπίστηκε ως υποστηρικτικό στοιχείο και όχι ως ο μοναδικός κανόνας, επειδή ένας μικρός αριθμός έγκυρων text-like αρχείων σερβίρισε με ασυνήθιστα content types.

Το Τοπίο της Υιοθέτησης

Το crawl βρήκε 586 έγκυρα αρχεία llms.txt στο Tranco Top 10.000. Αυτό δίνει ποσοστό έγκυρης υιοθέτησης 5,86%. Το μικρότερο συνοδευτικό αρχείο llms-full.txt βρέθηκε και ήταν έγκυρο σε 103 domains, δηλαδή στο 1,03% του δείγματος.

ΜετρικήΠλήθοςΠοσοστό του Top 10.000
Domains που ελέγχθηκαν10.000100,00%
Έγκυρα αρχεία llms.txt5865,86%
Έγκυρα αρχεία llms-full.txt1031,03%
Αποκρίσεις HTTP 200 για /llms.txt1.60616,06%
Αποκρίσεις HTTP 200 που απορρίφθηκαν ως άκυρες1.02010,20%

Η Υιοθέτηση Δεν Είναι Μόνο Top-Heavy

Η υιοθέτηση ήταν υψηλότερη στο Top 1.000 από ό,τι στο πλήρες Top 10.000, αλλά δεν περιοριζόταν μόνο στους πολύ μεγάλους ιστότοπους. Το ποσοστό υιοθέτησης στο Top 1.000 ήταν 7,50%. Το τελευταίο bucket των 1.000 domains, θέσεις 9.001-10.000, έπεσε στο 3,80%. Το μεσαίο μέρος της κατάταξης παρέμεινε ενεργό: τα buckets 2.001-3.000, 3.001-4.000, 5.001-6.000 και 6.001-7.000 κινήθηκαν όλα γύρω στο 6%.

tranco-domain-adoption-rate.webp

Πρώιμοι Adopters

Ο υψηλότερα καταταγμένος έγκυρος adopter ήταν η Cloudflare στη θέση 4 του Tranco. Άλλοι adopters υψηλής κατάταξης περιλάμβαναν τις Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink και OneSignal.

Αυτοί οι adopters δεν είναι τυχαίοι. Τείνουν να έχουν μεγάλες επιφάνειες documentation, σειρές προϊόντων που χρειάζονται επεξήγηση, APIs ή οικοσυστήματα για developers, περιεχόμενο υποστήριξης, σελίδες τιμολόγησης, υλικό για ασφάλεια και ιδιωτικότητα και αρκετή ισχύ brand ώστε να τους ενδιαφέρει πώς τα συστήματα AI ερμηνεύουν τον ιστότοπό τους.

ΚατάταξηDomainΜέγεθος αρχείουΠαρατηρούμενο μοτίβο
4cloudflare.com4.225 BΣυνοπτικό ευρετήριο προϊόντων, developer, εταιρείας και τιμολόγησης.
26azure.com47.037 BDeveloper tools, AI, compute, storage, security, monitoring και προαιρετικοί πόροι.
28github.com27.108 BProgrammatic access, Copilot, MCP, REST API, Actions, repositories και σύνδεσμοι CLI.
248stripe.com64.229 BΠληρωμές, Connect, Checkout, Billing, Tax, Atlas, Radar και developer docs.
265salesforce.com1,02 MBΤεράστιος κατάλογος συνδέσμων προϊόντων και Agentforce, χωρίς επικεφαλίδες ενοτήτων Markdown.

Κατηγορίες Adopters στο Top 1.000

Η μελέτη ταξινόμησε τους 75 έγκυρους adopters στο Tranco Top 1.000 χρησιμοποιώντας το πλαίσιο του domain, τις πρώτες επικεφαλίδες, τη δομή του ακατέργαστου αρχείου και keywords του περιεχομένου. Η μεγαλύτερη ομάδα ήταν marketing, media και adtech με 22,67%. Οι ιστότοποι cloud, developer και infrastructure αντιστοιχούσαν στο 20,00%. Οι ιστότοποι SaaS, παραγωγικότητας και customer operations αντιστοιχούσαν στο 17,33%. Οι ιστότοποι ασφάλειας, ταυτότητας και ιδιωτικότητας αντιστοιχούσαν στο 12,00%.

top-1000-adopters-categories.webp

ΚατηγορίαDomainsΠοσοστό των adopters του Top 1.000Διάμεση βαθμολογία ποιότηταςΔιάμεσοι σύνδεσμοι
Marketing, media & adtech1722,67%9425
Cloud, dev & infrastructure1520,00%9462
SaaS, productivity & customer ops1317,33%9446
Security, identity & privacy912,00%9878
CMS, hosting & web presence79,33%10024

Μοτίβα TLD

Τα top-level domains δεν είναι ετικέτες κλάδου, αλλά είναι χρήσιμα κατευθυντικά σήματα. Μεταξύ των TLDs με τουλάχιστον 50 domains στο δείγμα, το .io είχε το υψηλότερο έγκυρο ποσοστό υιοθέτησης με 14,44%. Ακολούθησε το .com με 8,19%. Η χαμηλότερη υιοθέτηση στα .gov, .edu και .net δείχνει ότι η πρώιμη βάση adopters είναι περισσότερο εμπορική και τεχνική παρά θεσμική.

Ποιότητα Υλοποίησης

Η έγκυρη υιοθέτηση δεν σημαίνει ομοιόμορφη ποιότητα υλοποίησης. Ορισμένα αρχεία είναι σύντομα, καλά οργανωμένα ευρετήρια. Ορισμένα είναι κυρίως πεζό κείμενο. Ορισμένα είναι ακατέργαστοι κατάλογοι συνδέσμων. Ορισμένα είναι σχεδόν κενά placeholders. Ορισμένα είναι dumps περιεχομένου πολλών megabytes που μπορεί να είναι πλήρη αλλά ακριβά στην ανάκτηση και την ανάλυση.

Μεταξύ των έγκυρων αρχείων llms.txt, τα 362 ήταν μεγαλύτερα από 5 KB, δηλαδή το 61,77% των έγκυρων adopters. Το διάμεσο μέγεθος αρχείου ήταν περίπου 7,1 KB. Το P90 ήταν 156 KB, το P95 356 KB, το P99 2,54 MB και το μεγαλύτερο αρχείο που παρατηρήθηκε ήταν 7,97 MB.

Συνήθη Σήματα Περιεχομένου

Μια σάρωση σε επίπεδο λέξης-κλειδί στα έγκυρα αρχεία έδειξε ότι πολλοί ιστότοποι δεν δημοσιεύουν απλώς μια δήλωση· κατευθύνουν τα μοντέλα σε υλικό επιχειρησιακής χρησιμότητας. Όροι υποστήριξης ή βοήθειας εμφανίστηκαν στο 70,31% των έγκυρων αρχείων. Όροι blog, οδηγού ή tutorial εμφανίστηκαν στο 67,92%. Όροι ασφάλειας, ιδιωτικότητας, συμμόρφωσης ή όρων χρήσης εμφανίστηκαν στο 61,43%. Η τιμολόγηση εμφανίστηκε στο 53,92%, η τεκμηρίωση στο 52,22%, όροι API στο 33,96% και σήματα changelog ή κυκλοφορίας στο 27,30%.

Βαθμολόγηση Ποιότητας και Αρχέτυπα

Για να περάσει από την παρουσία στην ωριμότητα, η μελέτη δημιούργησε ένα ελαφρύ score υλοποίησης. Το score λαμβάνει υπόψη τον τύπο περιεχομένου, το μέγεθος αρχείου, τη δομή Markdown, τον αριθμό συνδέσμων, την κάλυψη θεμάτων και προειδοποιητικά σημάδια όπως απουσία επικεφαλίδων, μηδέν συνδέσμους Markdown, ασυνήθιστους τύπους περιεχομένου, μικροσκοπικά αρχεία, πολύ μεγάλα αρχεία και συμπεριφορά τύπου link dump. Αυτό δεν είναι επίσημο πρότυπο. Είναι ένα ερευνητικό μοντέλο βαθμολόγησης για σύγκριση των υλοποιήσεων που παρατηρήθηκαν.

Με βάση αυτό το μοντέλο, 416 έγκυρα αρχεία ταξινομήθηκαν ως ισχυρά δομημένα ευρετήρια, 107 ως αξιοποιήσιμα ευρετήρια, 24 ως αδύναμα ή ακανόνιστα και 39 ως συμβολικά ή χαμηλής χρησιμότητας. Μια ξεχωριστή ανάλυση αρχέτυπων βρήκε 296 δομημένα ευρετήρια, 113 αρχεία κειμένου με ενότητες, 63 καταλόγους συνδέσμων, 52 λεπτά ευρετήρια, 50 συμβολικά ή placeholder αρχεία και 12 τεράστιους dumps περιεχομένου.

tranco-crawl-implementation-archetypes.webp

ΑρχέτυποDomainsΠοσοστό έγκυρων αρχείωνΔιάμεσο scoreΔιάμεσο μέγεθος αρχείουΔιάμεσοι σύνδεσμοι
Δομημένο ευρετήριο29650,51%9811.241 B61,5
Κείμενο με ενότητες11319,28%784.718 B0
Κατάλογος συνδέσμων6310,75%864.160 B23
Λεπτό ευρετήριο528,87%662.814 B0
Συμβολικό ή placeholder508,53%2715 B0
Τεράστιο dump περιεχομένου122,05%742,84 MB7.259,5

Οι Κορυφαίοι Adopters Έχουν Πυκνότερες Υλοποιήσεις

tranco-crawl-ranks-stats.webp

Οι 75 έγκυροι adopters στο Tranco Top 1.000 είχαν διάμεσο score ποιότητας 96, διάμεσο μέγεθος αρχείου 9.068 bytes, διάμεσο πλήθος συνδέσμων Markdown 52 και διάμεσο πλήθος ενοτήτων 11. Οι 511 adopters με κατάταξη 1.001-10.000 είχαν χαμηλότερες διαμέσους τιμές: score 90, μέγεθος αρχείου 6.506 bytes, 23 συνδέσμους Markdown και 9 ενότητες. Οι adopters του Top 1.000 είχαν επίσης μεγαλύτερη πιθανότητα να είναι δομημένα ευρετήρια: 69,33% έναντι 47,75% στη μεταγενέστερη ομάδα.

Το Πρόβλημα των Ψευδών Θετικών

llms-txt-http-200-outcomes.webp

Ο μεγαλύτερος κίνδυνος στη μέτρηση είναι τα ψευδή θετικά. Από τα 1.606 domains που επέστρεψαν HTTP 200 για το /llms.txt, τα 1.020 απέτυχαν στη validation. Η πιο συνηθισμένη αιτία ακυρότητας ήταν η ανακατεύθυνση εκτός στόχου, με 618 περιπτώσεις. Άλλες 367 αποκρίσεις ήταν γενικά έγγραφα HTML. Είκοσι εννέα επέστρεψαν άδειο σώμα και έξι ήταν άλλες ή μη κατηγοριοποιημένες άκυρες αποκρίσεις.

Αυτό έχει σημασία επειδή πολλοί μεγάλοι ιστότοποι κατευθύνουν άγνωστες διαδρομές σε σελίδες σύνδεσης, homepages, app shells, περιφερειακές σελίδες, surfaces συναίνεσης ή marketing fallbacks. Αυτές οι αποκρίσεις μπορεί να φαίνονται υγιείς σε έναν crawler που βασίζεται μόνο σε status codes, αλλά δεν περιέχουν έγκυρο σήμα llms.txt.

llms-full.txt: Πιο Σπάνιο και Πιο Ανομοιογενές

Το συνοδευτικό αρχείο llms-full.txt ήταν πολύ πιο σπάνιο από το llms.txt. Το crawl βρήκε 103 έγκυρα πλήρη αρχεία, δηλαδή το 17,58% των έγκυρων adopters του llms.txt και το 1,03% του συνολικού δείγματος Top 10.000.

Οι υλοποιήσεις πλήρους αρχείου ήταν ανομοιογενείς. Μεταξύ των 103 adopters με διπλό αρχείο, οι 57 είχαν αρχείο llms-full.txt μεγαλύτερο από το αρχείο ευρετηρίου, αλλά 46 είτε είχαν πλήρες αρχείο όχι μεγαλύτερο από το ευρετήριο είτε είχαν πλήρες αρχείο κάτω από 100 bytes. Ο διάμεσος λόγος μεγέθους πλήρους αρχείου προς ευρετήριο ήταν 1,43, αλλά οι ακραίες περιπτώσεις ήταν πολύ υψηλότερες. Το πλήρες αρχείο της Supabase ήταν περίπου 7.139 φορές το μέγεθος του αρχείου ευρετηρίου της. Το Made-in-China.com είχε πλήρες αρχείο 89,89 MB.

Domainllms.txtllms-full.txtΑναλογία
made-in-china.com4,49 MB89,89 MB20,0x
sendbird.com281,86 KB11,99 MB42,5x
taboola.com286,78 KB11,73 MB40,9x
supabase.co1,26 KB8,98 MB7.139,3x
neon.tech27,44 KB5,01 MB182,7x

Σύσταση: δημοσιεύστε llms-full.txt μόνο όταν ο ιστότοπος έχει ήδη σταθερό pipeline τεκμηρίωσης, πειθαρχία versioning και σαφή λόγο να εκθέσει μεγάλους όγκους περιεχομένου σε ένα μόνο αναγνώσιμο από μηχανές αρχείο.

llms.txt, robots.txt και sitemap.xml

Το llms.txt δεν πρέπει να αντιμετωπίζεται ως νέο robots.txt. Και τα δύο είναι αρχεία αναγνώσιμα από μηχανές στο ριζικό επίπεδο, αλλά επικοινωνούν διαφορετικά πράγματα. Το robots.txt είναι σήμα προτίμησης crawler και ελέγχου πρόσβασης. Το sitemap.xml είναι σήμα ανακάλυψης URLs. Το llms.txt είναι επεξηγηματικό και πλοηγητικό σήμα.

ΣήμαΚύριος ρόλοςΤυπικός αναγνώστηςΕρμηνεία σε αυτή τη μελέτη
robots.txtΔηλώνει προτιμήσεις crawler και περιορισμούς σε επίπεδο διαδρομής.Search crawlers, AI crawlers, archive crawlers, γενικά bots.Σήμα διακυβέρνησης και πρόσβασης.
sitemap.xmlΠαραθέτει URLs που μπορούν να ανακαλυφθούν για συστήματα indexing.Μηχανές αναζήτησης και pipelines indexing.Σήμα ανακάλυψης.
llms.txtΠαρέχει συμπαγές πλαίσιο για τον ιστότοπο, σημαντικούς συνδέσμους, docs, APIs, παραδείγματα και αναφορές πολιτικών.Εφαρμογές LLM, AI agents, εργαλεία για developers, συστήματα retrieval.Σήμα επεξήγησης και πλοήγησης.

Συστάσεις

Για ιστότοπους που εξετάζουν το llms.txt, οι ισχυρότερες υλοποιήσεις σε αυτό το σύνολο δεδομένων και τα εξωτερικά στοιχεία επισκεψιμότητας υποδεικνύουν ένα πρακτικό μοτίβο:

  • Δημοσιεύστε το /llms.txt στη ρίζα και κρατήστε το προσβάσιμο χωρίς login, εκτέλεση JavaScript, consent walls ή ανακατευθύνσεις εκτός διαδρομής.
  • Σερβίρετέ το ως text/plain ή text/markdown όπου είναι δυνατό.
  • Ξεκινήστε με μια σύντομη περιγραφή του ιστότοπου και στη συνέχεια ομαδοποιήστε συνδέσμους κατά προϊόν, τεκμηρίωση, API, τιμολόγηση, changelog, παραδείγματα, υποστήριξη, πολιτικές και εταιρικούς πόρους.
  • Προτιμήστε canonical links αντί για εξαντλητικές λίστες URLs.
  • Αποφύγετε κενά συμβολικά αρχεία· το πολύ να αποτελούν αδύναμο σήμα.
  • Αποφύγετε τεράστια, αδιαφοροποίητα dumps, εκτός αν υπάρχει ισχυρή περίπτωση χρήσης για κατανάλωση από μηχανές και αξιόπιστο pipeline παραγωγής.
  • Ελέγξτε τελικό URL, σώμα απόκρισης, content type, δομή Markdown, αριθμό συνδέσμων και μέγεθος αρχείου μετά τη δημοσίευση.

Οι ομάδες θα πρέπει επίσης να θέτουν ρεαλιστικές προσδοκίες. Τα διαθέσιμα δημόσια πειράματα δεν αποδεικνύουν ότι το llms.txt αυξάνει ανεξάρτητα την AI referral επισκεψιμότητα. Αν μια ομάδα θέλει να δοκιμάσει τον επιχειρηματικό αντίκτυπο, θα πρέπει να παρακολουθεί μαζί τα LLM referrals, τις σελίδες που παρατίθενται, τα bot requests, τη φρεσκάδα του index και τις αλλαγές περιεχομένου. Ένα χρήσιμο πείραμα θα συνέκρινε ταιριασμένες ομάδες σελίδων, θα διατηρούσε τις ενημερώσεις περιεχομένου σταθερές όπου είναι δυνατό και θα διαχώριζε την πλατφορμική επισκεψιμότητα όπως Perplexity, ChatGPT, Gemini, Claude και Bing/Copilot.

Περιορισμοί

Αυτό είναι ένα στιγμιότυπο βασισμένο σε crawl, όχι μόνιμη αλήθεια. Οι ιστότοποι μπορούν να προσθέτουν, να αφαιρούν ή να αλλάζουν αρχεία llms.txt οποιαδήποτε στιγμή. Ορισμένα domains μπορεί να μπλοκάρουν αυτοματοποιημένα αιτήματα ή να συμπεριφέρονται διαφορετικά ανάλογα με τη γεωγραφία, τη ρύθμιση TLS, τη λογική ανακατεύθυνσης, το user agent ή μηχανισμούς bot mitigation. Η μελέτη δοκίμασε μόνο αρχεία στο ριζικό επίπεδο και δεν αναζήτησε subdomains ή μη τυπικές διαδρομές.

Το score ποιότητας και τα αρχέτυπα είναι ερευνητικά εργαλεία, όχι επίσημες ετικέτες συμμόρφωσης. Η ανάλυση θεμάτων βασίζεται σε keywords και θα πρέπει να διαβάζεται ως κατευθυντική. Η μελέτη δεν αποδεικνύει ότι κάποια συγκεκριμένη πλατφόρμα AI διαβάζει, σέβεται ή χρησιμοποιεί σήμερα το llms.txt στην παραγωγή.

Τα εξωτερικά στοιχεία επισκεψιμότητας που εξετάστηκαν σε αυτή την έκδοση έχουν επίσης περιορισμούς. Η ανάλυση του Search Engine Land είναι ισχυρότερη ως προειδοποιητική παρατήρηση πολλών sites παρά ως τυχαιοποιημένο πείραμα. Το αποτέλεσμα του Alimbekov είναι χρήσιμο ως διαφανής μελέτη περίπτωσης σε επίπεδο site, αλλά δεν έχει ομάδα ελέγχου και περιλαμβάνει μια περίοδο κατά την οποία η συνολική referral επισκεψιμότητα αυξήθηκε σημαντικά. Αυτές οι αναφορές βοηθούν να πλαισιωθεί η συζήτηση, αλλά δεν μετατρέπουν αυτό το crawl σε αιτιώδη μελέτη επισκεψιμότητας.

Αρχεία και Αναπαραγωγιμότητα

ΑρχείοΣκοπός
crawl_llms_txt.pyCrawler για /llms.txt και /llms-full.txt.
analyze_llms_txt.pyΚύρια ανάλυση υιοθέτησης και δημιουργία γραφημάτων.
deep_analyze_llms_txt.pyΔευτερογενής ανάλυση για deciles κατάταξης, TLDs, σήματα θεμάτων, scores ποιότητας, αρχέτυπα και συμπεριφορά διπλού αρχείου.
deep_dive_early_quality.pyΤαξινόμηση πρώιμων adopters και εις βάθος διερεύνηση ποιότητας υλοποίησης.
data/llms_probe_results_top_10000.csvΚύριο σύνολο δεδομένων αποτελεσμάτων crawl.
data/deep_analysis_top_10000.jsonΣύνοψη δευτερογενούς ανάλυσης.
data/deep_early_quality_analysis.jsonΚατηγορίες πρώιμων adopters, σύγκριση cohort ποιότητας, λεπτομέρειες αρχέτυπων και μελέτες περίπτωσης.

Πηγές

Διορθώσεις μεθοδολογίας, ζητήματα συνόλου δεδομένων και επακόλουθες αναλύσεις είναι ευπρόσδεκτες στο support@thunderbit.com. Η παρούσα αναφορά δημοσιεύεται ανεξάρτητα από οποιαδήποτε εμπορική θέση της Thunderbit. Τα δεδομένα σε αυτή την αναφορά στέκουν από μόνα τους. — Η ερευνητική ομάδα της Thunderbit, Μάιος 2026.

Δοκιμάστε το Thunderbit για να κάνετε scraping και ανάλυση web δεδομένων Get Started Free

Shuai Guan
Shuai Guan
Διευθύνων Σύμβουλος της Thunderbit | Ειδικός στην Αυτοματοποίηση Δεδομένων με AI Ο Shuai Guan είναι ο CEO της Thunderbit και απόφοιτος της Σχολής Μηχανικών του University of Michigan. Με σχεδόν μια δεκαετία εμπειρίας στην τεχνολογία και την αρχιτεκτονική SaaS, εξειδικεύεται στη μετατροπή σύνθετων μοντέλων AI σε πρακτικά εργαλεία εξαγωγής δεδομένων χωρίς κώδικα. Σε αυτό το blog μοιράζεται ανοιχτά, δοκιμασμένες στην πράξη γνώσεις για το web scraping και τις στρατηγικές αυτοματοποίησης, ώστε να σας βοηθήσει να δημιουργείτε πιο έξυπνες, data-driven ροές εργασίας. Όταν δεν βελτιστοποιεί ροές δεδομένων, εφαρμόζει την ίδια προσοχή στη λεπτομέρεια και στο πάθος του για τη φωτογραφία.

Δοκίμασε το Thunderbit

Εξήγαγε leads και άλλα δεδομένα σε μόλις 2 κλικ. Με AI.

Απόκτησε το Thunderbit Είναι δωρεάν
Εξαγωγή δεδομένων με AI
Μετέφερε εύκολα δεδομένα σε Google Sheets, Airtable ή Notion
Chrome Store Rating
PRODUCT HUNT#1 Product of the Week