트래픽 상위 웹사이트들이 대형 언어 모델용 안내 파일을 어떻게 공개하고 있는지, 초기 구현은 어떤 형태인지, 그리고 도입률을 잴 때 왜 HTTP 200 응답 개수만 세면 안 되는지를 크롤 데이터로 따져 본 연구예요.
- 데이터셋:
data/llms_probe_results_top_10000.csv - Tranco 목록 내려받은 날: 2026년 5월 6일
- 조사 범위: 루트 수준
/llms.txt와/llms-full.txt
핵심 지표

- 5.86%: Tranco 상위 10,000개 중 유효한
llms.txt도입률이에요. 586개 도메인에 해당해요. - 1.03%: 유효한
llms-full.txt도입률이에요. 103개 도메인이고, 전체 파일이 유효한 사이트는 예외 없이 인덱스 파일도 유효했어요. - 63.51%:
/llms.txt에 대한 HTTP 200 응답 가운데 검증에 실패한 비율이에요. - 2.74배: 원시 HTTP 200 응답만 세서 도입률을 잡으면 대략 이만큼 부풀려져요.
요약
llms.txt는 아직 초기 단계의 웹 관행이에요. 그래도 변두리 실험으로만 치부할 단계는 지났어요. 2026년 5월 6일에 Tranco 상위 10,000개 도메인을 크롤해 보니 유효한 llms.txt 파일이 586개 나왔고, 관측 도입률은 5.86%였어요. 짝이 되는 llms-full.txt는 훨씬 드물었어요. 유효한 전체 파일을 둔 도메인은 103개, 도입률 1.03%에 그쳤어요.
방법론 측면에서 가장 중요한 발견은 상태 코드가 도입 여부를 잘 못 가린다는 점이에요. 크롤러는 /llms.txt에서 HTTP 200 응답을 1,606건 받았지만, 검증을 통과한 건 586건뿐이었어요. 나머지 1,020건은 대부분 엉뚱한 리디렉션, 평범한 HTML 페이지, 빈 본문, 그 밖의 무효 응답이었어요. 200 응답을 전부 도입으로 세는 단순 크롤러라면 실제 유효 도입률을 2.74배쯤 부풀려 잡게 돼요.
유효한 사례만 떼어 놓고 보면 구현 수준은 빈칸만 채운 파일이라는 인상보다 높았어요. 유효 파일의 중앙값 크기는 약 7.1KB였고, 61.77%는 5KB를 넘겼어요. 70.82%가 Markdown 섹션을 6개 이상 담았고, 77.47%는 Markdown 링크를 11개 이상 포함했어요. 초기 도입자에는 Cloudflare, Azure, GitHub, DigiCert, WordPress.org, Adobe, Dropbox, PayPal, Stripe, Salesforce, Slack, Zendesk, Okta, Datadog, Cloudinary 등이 들어 있어요.
llms.txt는robots.txt를 대체하는 파일이 아니에요. AI 시스템을 위한 설명·탐색 신호로 보는 편이 가장 정확해요. 파일이 그냥 있다는 사실이 중요한 게 아니라, 기계가 권위 있고 간결하며 최신인 정보를 찾는 데 실제로 도움이 되느냐가 관건이에요.
배경: 웹은 AI용 신호를 늘려 가고 있어요
웹사이트는 크롤러 선호를 알리려고 오래전부터 robots.txt를 써 왔어요. URL 발견을 돕는 데는 sitemap.xml을, 검색·플랫폼 시스템이 페이지를 해석하도록 돕는 데는 구조화 데이터를 써 왔고요. 생성형 AI는 또 다른 숙제를 던져요. 콘텐츠가 학습, 검색, 요약, 에이전트 브라우징, 코드 지원, 고객 지원, 답변 생성 등에 두루 쓰이거든요. 여기서 요구가 둘로 갈라져요. 게시자는 자동화 사용을 더 통제하고 싶어 하면서도, 정작 AI 시스템이 자기 사이트를 들를 때는 정확한 정본 정보를 찾아가길 바라요.
Jeremy Howard가 2024년에 내놓은 원래의 llms.txt 제안은 이 파일을 웹사이트 루트에 두는 Markdown 문서로 정의해요. 추론 시점에 LLM이 다루기 좋은 정보를 건넨다는 역할에 무게를 둬요. HTML 페이지에는 탐색 요소, 광고, 스크립트, 잡음이 너무 많아 언어 모델이 처리하기 버겁다는 게 출발점이에요. 간결한 Markdown 파일 하나면 모델을 가장 중요한 페이지, 문서, API, 예제, 정책, 제품 정보로 곧장 데려갈 수 있어요.
바깥 연구는 더 넓은 맥락을 보태 줘요. Data Provenance Initiative의 “Consent in Crisis”는 robots.txt와 서비스 약관에서 AI 관련 제한이 급증하고 있다고 짚어요. 기존 웹 동의 장치는 애초에 대규모 AI 데이터 재사용을 염두에 두고 만든 게 아니라는 거죠. Cloudflare Radar AI Insights도 상위 10,000개 도메인 수준에서 AI 크롤러와 robots.txt 패턴을 눈에 보이게 정리했어요. 이런 흐름 속에서 llms.txt는 AI 신호의 건설적인 쪽에 서요. 「여기는 크롤링하지 마」가 아니라 「이 사이트를 이해하려면 여기서 출발해」라는 메시지인 셈이에요.
외부 근거와 도입을 둘러싼 논쟁
llms.txt를 두고 공개 논쟁은 두 갈래로 나뉘어요. 낙관론은 이 파일이 AI 시스템에 권위 있는 콘텐츠로 가는 더 깔끔하고 효율적인 길을 열어 준다고 봐요. 회의론은 주요 LLM 제공업체 가운데 이걸 순위·크롤·인용 신호로 쓰겠다고 공개 약속한 곳이 한 군데도 없으니, 게시자가 파일 하나로 트래픽이 늘 거라 기대해선 안 된다고 봐요. 이번에 살펴본 외부 자료 세 건은 좀 더 결이 미묘한 결론을 받쳐 줘요. llms.txt는 쓸모 있는 인프라지만, 직접적인 트래픽 효과를 보여 주는 증거는 아직 제한적이고 상황을 많이 타요.
외부 도입 벤치마크는 빠르게 움직여요
Rankability의 도입 추적기는 2025년 6월 22일 기준 상위 1,000개 웹사이트의 도입률을 0.3%, 그러니까 1,000개 중 3개로 보고했어요. 이 자료는 domain.com/llms.txt를 월 단위로 자동 스캔하고 리디렉션과 HTML 응답을 걸러내는 검증을 쓴다고 밝혀요. 본 연구의 보수적 검증 방향과 결이 비슷해요.
결과 차이는 꽤 커요. 본 연구는 2026년 5월 6일에 Tranco 상위 1,000개에서 유효 llms.txt 파일 75개를 찾아 7.50% 도입률을 확인했어요. 다만 순위 출처, 구현 방식, 검증 로직, 크롤 시점이 제각각이라 두 숫자를 엄밀한 시계열로 읽으면 안 돼요. 그래도 이 대비는 2025년 중반과 2026년 5월 사이에, 특히 개발자 중심·SaaS·클라우드·보안·문서형 사이트에서 도입이 의미 있게 퍼졌음을 가리켜요.
| 출처 | 시점 | 표본 | 보고된 유효 도입률 | 해석 |
|---|---|---|---|---|
| Rankability | 2025년 6월 22일 | 상위 1,000개 웹사이트 | 0.3% | 2025년 중반의 낮은 도입률을 보여 주는 초기 공개 벤치마크입니다. |
| 본 연구 | 2026년 5월 6일 | Tranco 상위 1,000개 | 7.50% | 트래픽이 많은 사이트들 사이에서 눈에 띄는 도입이 보이는 이후 크롤 결과입니다. |
| 본 연구 | 2026년 5월 6일 | Tranco 상위 10,000개 | 5.86% | 도입이 측정 가능하지만 아직 주류는 아님을 보여 주는 더 넓은 표본입니다. |
트래픽 실험 결과는 아직 갈려요
Search Engine Land는 2026년 1월에 10개 사이트를 대상으로 도입 전 90일과 도입 후 90일을 따라간 분석을 냈어요. 이 글에 따르면 두 사이트는 AI 트래픽이 각각 12.5%와 25% 늘었고, 여덟 사이트는 측정 가능한 개선이 없었으며, 한 사이트는 19.7% 줄었어요. 핵심 메시지는 인과 해석을 조심하라는 거였어요. 성공처럼 보인 두 사이트는 같은 기간에 새 템플릿을 내놓고, 리소스 센터를 다시 짓고, 추출하기 좋은 비교 표를 더하고, 언론 노출을 얻고, 기술 결함을 손보거나, 새 FAQ형 콘텐츠를 올렸거든요. 이 관점에서 보면 llms.txt는 더 탄탄해진 콘텐츠와 기술 작업을 기록한 것이지, 성장 자체를 만든 게 아니었어요.
Renat Alimbekov의 개인 블로그 실험은 더 작은 사이트 단위 관찰에서 조금 더 긍정적인 결론에 닿았어요. llms.txt와 llms-full.txt를 둘 다 붙인 뒤 Yandex.Metrica로 4개월짜리 두 기간을 비교했어요. LLM 추천 세션은 75회에서 92회로 23% 늘었고, 사용자는 51명에서 64명으로 증가했어요. Perplexity 세션은 29회에서 55회로 뛴 반면, ChatGPT 세션은 31회에서 26회로 줄었고요. 같은 글은 전체 추천 트래픽이 160회에서 290회로 더 빠르게 늘었다고도 밝혔어요. 그 바람에 LLM 세션 비중은 47%에서 32%로 내려갔고요.
| 증거 유형 | 관찰된 결과 | 주요 한계 | 이 보고서에 주는 의미 |
|---|---|---|---|
| Search Engine Land의 10개 사이트 전후 비교 연구 | 두 사이트는 증가, 여덟 사이트는 측정 가능한 변화 없음, 한 사이트는 감소. | 긍정 사례에는 콘텐츠, 홍보, 기술 변경이 동시에 있었습니다. | llms.txt를 독립적인 성장 레버가 아니라 인프라로 보아야 함을 뒷받침합니다. |
| Alimbekov 개인 블로그 전후 관찰 | 이후 기간 동안 LLM 추천 세션이 23% 증가. | 대조군이 없고, 전체 추천 트래픽이 81% 증가했으며 LLM 비중은 감소했습니다. | 특히 Perplexity를 통해 기술 블로그에 긍정적 가능성이 있음을 시사하지만, 인과성은 분리되지 않았습니다. |
| 본 크롤링 기반 도입 연구 | 586개의 유효 파일과 많은 구조화 구현 사례. | 존재와 구조만 측정하며, 이후 트래픽 영향은 측정하지 않습니다. | 도입과 구현 성숙도는 보여 주지만, 그 자체로 ROI를 말해 주지는 않습니다. |
논쟁이 정리해 주는 것
외부 근거는 이 데이터셋을 읽는 눈을 더 또렷하게 만들어 줘요. 잘 짜인 llms.txt 파일은 특히 개발자 문서, API 레퍼런스, 지식베이스 콘텐츠에서 기계가 파싱할 부담을 덜어 줄 수 있어요. 그런데 트래픽 효과가 가장 컸던 사례조차도 결국은 유용하고, 추출하기 좋고, 권위 있고, 파일 밖에서도 발견되는 콘텐츠에 기대고 있었어요. 그러니 실무에서 진짜 던질 질문은 llms.txt가 혼자서 의미가 있느냐가 아니에요. 이 파일이 더 큰 AI 가독성 콘텐츠 체계의 한 조각이냐는 거예요.
업데이트된 해석:
llms.txt는 비용이 낮은 AI용 인프라로 두는 게 좋아요. 더 나은 문서화, 구조화 콘텐츠, 기술적 접근성, 인용, 링크, 브랜드 권위를 대신하는 수단으로 삼아선 안 돼요.
방법론
이 연구는 표본으로 Tranco 상위 10,000개 도메인을 골랐어요. Tranco는 흔한 전통적 상위 목록보다 더 안정적이고 조작에 강하게 설계된 연구용 사이트 순위예요. Tranco 원본 파일은 2026년 5월 6일에 내려받았고, 원본의 Last-Modified 타임스탬프는 GMT 기준 2026년 5월 5일 22:17:59였어요.
크롤러는 도메인마다 루트 수준 경로 두 개를 살폈어요.
https://example.com/llms.txt, 필요하면 HTTP 폴백을 썼어요.https://example.com/llms-full.txt, 필요하면 HTTP 폴백을 썼어요.
조사할 때마다 상태 코드, 최종 URL, 가져오기 방식, 응답 바이트 수, 콘텐츠 유형, 오류 메시지, 경과 시간, 검증 결과를 남겼어요. 성공한 응답 본문은 검토와 2차 분석을 위해 raw_llms_txt/ 아래에 저장했고요.
검증 규칙
응답이 정상 본문을 돌려주고 흔한 웹 폴백처럼 보이지 않을 때만 유효 파일로 셌어요. 최종 URL 경로는 /llms.txt나 /llms-full.txt여야 했어요. 빈 본문은 뺐어요. 누가 봐도 HTML 문서이거나 앱 셸인 것도 제외했고요. 일부 정상 텍스트 파일이 특이한 콘텐츠 유형으로 제공돼서, 콘텐츠 유형은 유일 기준이 아니라 보조 증거로만 썼어요.
도입 현황
크롤 결과 Tranco 상위 10,000개에서 유효 llms.txt 파일이 586개 나왔어요. 유효 도입률 5.86%예요. 더 작은 짝 파일 llms-full.txt는 103개 도메인에서 유효하게 존재했고, 표본의 1.03%였어요.
| 지표 | 개수 | 상위 10,000개 대비 비중 |
|---|---|---|
| 크롤된 도메인 | 10,000 | 100.00% |
| 유효한 llms.txt 파일 | 586 | 5.86% |
| 유효한 llms-full.txt 파일 | 103 | 1.03% |
| /llms.txt에 대한 HTTP 200 응답 | 1,606 | 16.06% |
| 무효로 거부된 HTTP 200 응답 | 1,020 | 10.20% |
도입은 최상위권에만 몰려 있지 않아요
상위 1,000개 도입률은 상위 10,000개 전체보다 높았어요. 그렇다고 아주 큰 사이트에만 묶여 있진 않았어요. 상위 1,000개 도입률은 7.50%였어요. 반면 9,00110,000위 구간의 마지막 1,000개 묶음은 3.80%로 떨어졌어요. 순위 중간대도 활발했어요. 2,0013,000위, 3,0014,000위, 5,0016,000위, 6,001~7,000위 구간이 모두 6% 안팎이었어요.

초기 도입자
순위가 가장 높은 유효 도입자는 Tranco 4위 Cloudflare였어요. 그 밖의 상위권 도입자로는 Azure, GitHub, DigiCert, WordPress.org, Adobe, Sentry, Dropbox, PayPal, Shopify, Taboola, Avast, Weather.com, Oxylabs, SourceForge, Cisco, Stripe, Slack, Dell, NVIDIA, Indeed, Zendesk, Calendly, Palo Alto Networks, Okta, Braze, Klaviyo, Intercom, Datadog, Cloudinary, ClassLink, OneSignal 등이 있었어요.
이 도입자들은 무작위가 아니에요. 대체로 방대한 문서 영역, 설명이 필요한 제품군, API나 개발자 생태계, 지원 콘텐츠, 요금 페이지, 보안·개인정보 자료를 갖췄어요. 게다가 AI 시스템이 자사 사이트를 어떻게 읽는지 신경 쓸 만큼 브랜드 권위도 충분하고요.
| 순위 | 도메인 | 파일 크기 | 관찰된 패턴 |
|---|---|---|---|
| 4 | cloudflare.com | 4,225 B | 간결한 제품, 개발자, 회사, 요금 인덱스입니다. |
| 26 | azure.com | 47,037 B | 개발 도구, AI, 컴퓨트, 저장소, 보안, 모니터링, 선택적 리소스를 포함합니다. |
| 28 | github.com | 27,108 B | 프로그램 방식 접근, Copilot, MCP, REST API, Actions, 저장소, CLI 링크를 포함합니다. |
| 248 | stripe.com | 64,229 B | 결제, Connect, Checkout, Billing, Tax, Atlas, Radar, 개발자 문서를 다룹니다. |
| 265 | salesforce.com | 1.02 MB | Markdown 섹션 제목이 없는 거대한 제품 및 Agentforce 링크 카탈로그입니다. |
상위 1,000개 도입자 분류
이 연구는 도메인 맥락, 첫 제목, 원시 파일 구조, 콘텐츠 키워드를 써서 Tranco 상위 1,000개의 유효 도입자 75개를 분류했어요. 가장 큰 그룹은 마케팅·미디어·애드테크로 22.67%였어요. 클라우드·개발·인프라 사이트가 20.00%, SaaS·생산성·고객 운영 사이트가 17.33%, 보안·아이덴티티·개인정보 사이트가 12.00%를 차지했고요.

| 범주 | 도메인 수 | 상위 1,000개 도입자 대비 비중 | 중앙값 품질 점수 | 중앙값 링크 수 |
|---|---|---|---|---|
| 마케팅, 미디어 & 애드테크 | 17 | 22.67% | 94 | 25 |
| 클라우드, 개발 & 인프라 | 15 | 20.00% | 94 | 62 |
| SaaS, 생산성 & 고객 운영 | 13 | 17.33% | 94 | 46 |
| 보안, 아이덴티티 & 개인정보 보호 | 9 | 12.00% | 98 | 78 |
| CMS, 호스팅 & 웹 존재감 | 7 | 9.33% | 100 | 24 |
TLD 패턴
최상위 도메인이 산업 라벨은 아니에요. 그래도 방향을 일러 주는 쓸 만한 신호예요. 표본에서 도메인이 50개 이상인 TLD 중에선 .io가 14.44%로 유효 도입률이 가장 높았어요. .com이 8.19%로 뒤를 이었고요. .gov, .edu, .net의 낮은 도입률은 초기 도입자 집단이 기관 색채보다 상업적·기술적 색채가 더 짙다는 점을 시사해요.
구현 품질
유효 도입이 곧 균일한 구현 품질을 뜻하진 않아요. 어떤 파일은 간결하고 잘 나뉜 인덱스예요. 어떤 건 거의 산문이고요. 어떤 건 원시 링크 카탈로그, 어떤 건 거의 빈 자리 표시자예요. 어떤 건 완성형이긴 해도 가져오고 파싱하기엔 비싼 수 메가바이트짜리 콘텐츠 덤프고요.
유효 llms.txt 파일 중 362개가 5KB를 넘겼어요. 유효 도입자의 61.77%예요. 파일 크기 중앙값은 약 7.1KB였어요. P90은 156KB, P95는 356KB, P99는 2.54MB였고, 가장 큰 파일은 7.97MB였어요.
자주 보이는 콘텐츠 신호
유효 파일을 키워드 단위로 훑어보니, 많은 사이트가 선언문만 올려 두는 데 그치지 않고 모델을 운영상 쓸모 있는 자료로 안내하고 있었어요. 지원·도움말 용어는 유효 파일의 70.31%에서, 블로그·가이드·튜토리얼 용어는 67.92%에서 나왔어요. 보안·개인정보·규정 준수·약관 용어는 61.43%였고요. 요금은 53.92%, 문서는 52.22%, API 용어는 33.96%, 변경 로그나 릴리스 신호는 27.30%에서 잡혔어요.
품질 점수와 유형
존재 여부에서 성숙도로 한 발 더 나아가려고, 이 연구는 가벼운 구현 점수 모델을 짰어요. 이 점수는 콘텐츠 유형, 파일 크기, Markdown 구조, 링크 수, 주제 범위를 보고, 제목 없음·Markdown 링크 없음·특이한 콘텐츠 유형·지나치게 작은 파일·지나치게 큰 파일·링크 덤프 행동 같은 경고 신호도 함께 따져요. 공식 표준은 아니에요. 관찰된 구현을 견줘 보려는 연구용 점수 모델이에요.
이 모델로 416개 유효 파일은 강한 구조화 인덱스, 107개는 쓸 만한 인덱스, 24개는 얇거나 들쭉날쭉한 파일, 39개는 상징적이거나 활용도가 낮은 파일로 나눴어요. 별도의 유형 분석에서는 구조화 인덱스 296개, 구획된 텍스트 파일 113개, 링크 카탈로그 63개, 얇은 인덱스 52개, 상징적·자리 표시자 파일 50개, 거대한 콘텐츠 덤프 12개가 확인됐어요.

| 유형 | 도메인 수 | 유효 파일 대비 비중 | 중앙값 점수 | 중앙값 파일 크기 | 중앙값 링크 수 |
|---|---|---|---|---|---|
| 구조화 인덱스 | 296 | 50.51% | 98 | 11,241 B | 61.5 |
| 구획된 텍스트 | 113 | 19.28% | 78 | 4,718 B | 0 |
| 링크 카탈로그 | 63 | 10.75% | 86 | 4,160 B | 23 |
| 얇은 인덱스 | 52 | 8.87% | 66 | 2,814 B | 0 |
| 상징적 또는 자리 표시자 | 50 | 8.53% | 27 | 15 B | 0 |
| 거대한 콘텐츠 덤프 | 12 | 2.05% | 74 | 2.84 MB | 7,259.5 |
상위 도입자일수록 구현 밀도가 높아요

Tranco 상위 1,000개 안의 유효 도입자 75개는 중앙값 품질 점수 96, 중앙값 파일 크기 9,068바이트, 중앙값 Markdown 링크 52개, 중앙값 섹션 11개를 기록했어요. 반면 1,001~10,000위에 속한 도입자 511개는 중앙값이 더 낮았어요. 점수 90, 파일 크기 6,506바이트, Markdown 링크 23개, 섹션 9개였고요. 상위 1,000개 도입자는 이후 집단보다 구조화 인덱스일 확률도 더 높았어요. 각각 69.33%와 47.75%였어요.
오탐 문제

측정에서 가장 큰 위험은 오탐이에요. /llms.txt에 HTTP 200을 돌려준 1,606개 도메인 중 1,020개가 검증에서 떨어졌어요. 가장 흔한 무효 사유는 엉뚱한 경로로의 리디렉션으로 618건이었어요. 또 367건은 평범한 HTML 문서, 29건은 빈 본문, 6건은 기타·미분류 무효 응답이었고요.
대형 사이트들이 알 수 없는 경로를 로그인 페이지, 홈페이지, 앱 셸, 지역 페이지, 동의 화면, 마케팅 폴백으로 돌리는 일이 잦기 때문이에요. 이런 응답은 상태 코드만 보는 크롤러에겐 정상처럼 비쳐도, 실제 유효한 llms.txt 신호는 담고 있지 않아요.
llms-full.txt: 더 드물고 더 들쭉날쭉해요
짝 파일 llms-full.txt는 llms.txt보다 훨씬 드물었어요. 크롤 결과 유효한 전체 파일은 103개였고, 유효 llms.txt 도입자의 17.58%, 상위 10,000개 표본의 1.03%에 해당했어요.
전체 파일 구현은 들쭉날쭉했어요. llms.txt와 llms-full.txt를 둘 다 운영한 103개 도메인 중 57개는 전체 파일이 인덱스 파일보다 컸어요. 하지만 46개는 전체 파일이 인덱스 파일보다 크지 않거나 100바이트도 안 됐고요. 전체 파일과 인덱스 파일의 크기 비율 중앙값은 1.43이었지만, 극단값은 훨씬 컸어요. Supabase의 전체 파일은 인덱스 파일보다 약 7,139배 컸어요. Made-in-China.com의 전체 파일은 89.89MB나 됐고요.
| 도메인 | llms.txt | llms-full.txt | 비율 |
|---|---|---|---|
| made-in-china.com | 4.49 MB | 89.89 MB | 20.0x |
| sendbird.com | 281.86 KB | 11.99 MB | 42.5x |
| taboola.com | 286.78 KB | 11.73 MB | 40.9x |
| supabase.co | 1.26 KB | 8.98 MB | 7,139.3x |
| neon.tech | 27.44 KB | 5.01 MB | 182.7x |
권장 사항: 안정적인 문서 파이프라인과 버전 관리 습관이 이미 있고, 많은 콘텐츠를 기계 판독 파일 하나로 노출할 분명한 이유가 있는 사이트에서만
llms-full.txt를 발행하세요.
llms.txt, robots.txt, sitemap.xml
llms.txt를 새로운 robots.txt처럼 다루면 안 돼요. 셋 다 루트 수준 기계 판독 파일이지만, 전하는 메시지가 달라요. robots.txt는 크롤러 선호와 접근 제어 신호예요. sitemap.xml은 URL 발견 신호고요. llms.txt는 설명·탐색 신호예요.
| 신호 | 주요 역할 | 일반적인 읽는 주체 | 이 연구에서의 해석 |
|---|---|---|---|
robots.txt | 크롤러 선호와 경로 수준 제한을 선언합니다. | 검색 크롤러, AI 크롤러, 아카이브 크롤러, 일반 봇. | 거버넌스 및 접근 신호입니다. |
sitemap.xml | 색인 시스템을 위한 발견 가능한 URL을 나열합니다. | 검색 엔진과 색인 파이프라인. | 발견 신호입니다. |
llms.txt | 간결한 사이트 맥락, 중요한 링크, 문서, API, 예제, 정책 참조를 제공합니다. | LLM 애플리케이션, AI 에이전트, 개발자 도구, 검색 시스템. | 설명 및 탐색 신호입니다. |
권장 사항
llms.txt를 고민하는 사이트라면, 이 데이터셋에서 가장 강한 구현 사례와 외부 트래픽 근거가 함께 가리키는 실용 패턴은 다음과 같아요.
- 루트에
/llms.txt를 발행하고, 로그인, JavaScript 실행, 동의 차단, 경로 이탈 리디렉션 없이 접근되게 유지하세요. - 되도록
text/plain이나text/markdown으로 제공하세요. - 사이트를 짧게 설명한 다음 제품, 문서, API, 요금, 변경 로그, 예제, 지원, 정책, 회사 리소스별로 링크를 묶으세요.
- URL을 다 늘어놓기보다 정본 링크를 앞세우세요.
- 비어 있는 상징적 파일은 피하세요. 잘해야 약한 신호일 뿐이에요.
- 탄탄한 기계 소비 사례와 믿을 만한 생성 파이프라인이 없다면, 크고 무질서한 덤프는 피하세요.
- 발행한 뒤엔 최종 URL, 응답 본문, 콘텐츠 유형, Markdown 구조, 링크 수, 파일 크기를 검증하세요.
기대치도 신중하게 잡아야 해요. 지금까지 공개된 실험만으론 llms.txt가 AI 추천 트래픽을 단독으로 늘린다고 입증되지 않았어요. 비즈니스 효과를 시험하고 싶다면 LLM 추천, 인용된 페이지, 봇 요청, 색인 최신성, 콘텐츠 변화를 함께 추적해야 해요. 쓸 만한 실험은 페이지 그룹을 짝지어 비교하고, 콘텐츠 업데이트는 되도록 일정하게 유지하며, Perplexity, ChatGPT, Gemini, Claude, Bing/Copilot처럼 플랫폼별 트래픽을 따로 떼어 보는 거예요.
한계
이건 크롤 스냅샷이지 영구적인 사실이 아니에요. 웹사이트는 언제든 llms.txt 파일을 더하고, 지우고, 바꿀 수 있어요. 어떤 도메인은 자동화 요청을 막거나, 지리 위치·TLS 설정·리디렉션 로직·사용자 에이전트·봇 방지 방식에 따라 다르게 굴 수도 있고요. 이 연구는 루트 수준 파일만 테스트했고 서브도메인이나 비표준 경로는 찾지 않았어요.
품질 점수와 유형은 연구 도구지 공식 준수 라벨이 아니에요. 주제 분석은 키워드 기반이라 방향을 보여 주는 지표로 읽어야 해요. 이 연구는 특정 AI 플랫폼이 지금 실제 운영 환경에서 llms.txt를 읽고, 존중하고, 쓴다는 사실을 증명하지 않아요.
이번에 살펴본 외부 트래픽 근거에도 한계가 있어요. Search Engine Land 분석은 무작위 실험이라기보단 주의를 환기하는 다사이트 관찰에 가까워요. Alimbekov의 결과는 투명한 사이트 단위 사례 연구로 쓸모는 있지만, 대조군이 없고 전체 추천 트래픽이 크게 늘어난 기간을 끼고 있어요. 이런 참고문헌은 논쟁의 틀을 잡아 주긴 해도, 이 크롤을 인과적 트래픽 연구로 바꿔 주진 못해요.
파일과 재현성
| 파일 | 용도 |
|---|---|
crawl_llms_txt.py | /llms.txt와 /llms-full.txt용 크롤러입니다. |
analyze_llms_txt.py | 주요 도입 분석 및 차트 생성입니다. |
deep_analyze_llms_txt.py | 순위 분위, TLD, 주제 신호, 품질 점수, 유형, 이중 파일 행동에 대한 2차 분석입니다. |
deep_dive_early_quality.py | 초기 도입자 분류와 구현 품질 심층 분석입니다. |
data/llms_probe_results_top_10000.csv | 주요 크롤 결과 데이터셋입니다. |
data/deep_analysis_top_10000.json | 2차 분석 요약입니다. |
data/deep_early_quality_analysis.json | 초기 도입자 범주, 품질 집단 비교, 유형 세부 정보, 사례 연구입니다. |
출처
- The /llms.txt file, Jeremy Howard, 2024.
- HTTP Archive Web Almanac 2024 Methodology.
- Cloudflare Radar: Expanded AI insights.
- Cloudflare Radar AI Insights.
- Consent in Crisis: The Rapid Decline of the AI Data Commons, Data Provenance Initiative.
- Tranco: A Research-Oriented Top Sites Ranking Hardened Against Manipulation.
- Does llms.txt matter?, Search Engine Land, 2026년 1월.
- The State of llms.txt Adoption, Rankability, 2025년 6월.
- How LLMS.txt Increased AI Chat Traffic by 23%, Renat Alimbekov.
방법론 수정, 데이터셋 이슈, 후속 분석은 support@thunderbit.com 으로 보내 주세요. 이 보고서는 Thunderbit의 어떤 상업적 입장과도 무관하게 발행되었습니다. 이 보고서의 데이터는 그 자체로 의미를 가집니다. — Thunderbit 연구팀, 2026년 5월.
Thunderbit로 웹 데이터를 스크래핑하고 분석해 보세요 Get Started Free


