Tehnic

robots.txt și llms.txt pentru boții AI — cum permiți crawlarea și ghidezi citabilitatea

Cum configurezi robots.txt pentru a permite boților AI accesul corect și ce este llms.txt: cu ce dovezi, cu ce limite, și cum îl structurezi dacă decizi să-l folosești.

De actualizat SEO tehnic

De ce robots.txt contează specific pentru AI

Un robots.txt configurat pentru SEO clasic (permite Googlebot, blochează tot ce nu e necesar) poate bloca involuntar boții AI de căutare, cei care preiau conținut pentru răspunsuri cu atribuire. Dacă PerplexityBot, OAI-SearchBot sau Claude-SearchBot nu pot crawla site-ul tău, conținutul tău nu poate fi preluat de funcțiile de căutare respective — indiferent cât de bun e (Perplexity, OpenAI, Anthropic).

Problema poate apărea când robots.txt are User-agent: * cu permisiuni restrictive sau când un CMS (WordPress, Shopify, Wix) adaugă reguli de blocare generice. Auditarea robots.txt e primul pas în orice audit GEO/AEO.

Lista completă de boți AI pe care să îi permiți

Boți de căutare — preiau conținut pentru funcțiile de căutare AI (prioritate maximă):

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Bingbot
Allow: /

Fetchere declanșate de utilizator — accesează o pagină când cineva o cere într-o conversație. Documentația OpenAI spune că, fiind acțiuni inițiate de utilizator, regulile robots.txt pot să nu se aplice, iar Perplexity-User „ignoră în general" regulile robots.txt. Un Allow pentru ei e deci în mare parte simbolic:

User-agent: ChatGPT-User
Allow: /

User-agent: Perplexity-User
Allow: /

User-agent: Claude-User
Allow: /

Boți de antrenare și tokenuri de control — decid dacă conținutul poate fi folosit la antrenarea modelelor, nu dacă apari în căutare. Google-Extended nu e un bot separat, ci un token de control în robots.txt pentru folosirea conținutului la antrenarea și grounding-ul Gemini; nu influențează prezența în Google Search sau în AI Overviews. CCBot e crawlerul Common Crawl, o arhivă deschisă de date web:

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: CCBot
Allow: /

User-agent: Google-Extended
Allow: /

Strategia recomandată: permit totul implicit (User-agent: * / Allow: /) și listează excepțiile specifice, nu invers. O agenție AEO trebuie să fie maxim citabilă — blocarea selectivă a boților de training e opțională și are sens doar dacă ai conținut proprietar pe care nu vrei inclus în date de training. Liniile Allow: / de mai sus sunt implicite — le scrii doar ca să fie explicit. Și rețineți: robots.txt nu autorizează și nu protejează conținut, ci doar cere crawlerilor să respecte reguli (RFC 9309).

Ce este llms.txt

llms.txt e un fișier de convenție (similar robots.txt) care ghidează modelele de limbaj mari (LLM-uri) în înțelegerea structurii și contextului unui site. Nu e un standard oficial, ci o propunere a comunității (llmstxt.org). Adopția e reală, de ordinul a 10% dintre site-uri într-o analiză SE Ranking pe ~300.000 de domenii, dar folosirea rămâne mică: potrivit unui studiu Ahrefs (mai 2026), 97% dintre fișierele llms.txt valide nu au primit nicio cerere, iar niciun furnizor major de LLM nu îl suportă oficial. Google spune că nu ai nevoie de fișiere speciale pentru AI ca să apari în Search. Tratează-l ca pe o convenție ieftină și opțională, nu ca pe un factor de citare.

Spre deosebire de robots.txt (care spune ce poți crawla), llms.txt spune ce există și ce înseamnă — o hartă a site-ului optimizată pentru înțelegere automată, nu pentru navigare umană.

Structura unui llms.txt eficient

Format recomandat (Markdown, accesibil la /llms.txt):

# [Numele brandului]

> [O propoziție: ce face brandul, pentru cine, unde]

[2-3 paragrafe: context, fondator/echipă, abordare distinctivă]

## Servicii
- [Serviciu 1](URL): descriere scurtă
- [Serviciu 2](URL): descriere scurtă

## Resurse
- [Blog/Lab/Ghiduri](URL): ce conțin
- [Despre](URL): cine suntem

## Contact
- [Metodă de contact](URL sau tel)

Principii pentru un llms.txt bun:

Robots.txt vs llms.txt — care face ce

Aspect robots.txt llms.txt
ScopControlează accesul crawlerilorGhidează înțelegerea LLM-urilor
FormatReguli Allow/Disallow per botMarkdown structurat, text descriptiv
StandardStandard IETF (RFC 9309, 2022)Propunere a comunității (2024+), nu standard
Impact imediatEfect în cel mult ~24 de ore (cache-ul crawlerului), nu instant; nu e un mecanism de autorizareNeconfirmat: fără efect măsurabil pe citări în studiile publicate

Verificare și mentenanță

Dragoș Mihai Drăgoi
Despre autor

12+ ani în SEO, SEO tehnic la scară enterprise. Scrie despre GEO/AEO și schema markup din experiență directă, nu din research generic.

Vezi profilul complet →
Întrebări frecvente

Întrebări despre Tehnic

Prioritate maximă: boții de căutare OAI-SearchBot, PerplexityBot, Claude-SearchBot și Bingbot — preiau conținut pentru funcțiile de căutare AI. ChatGPT-User, Perplexity-User și Claude-User sunt fetchere declanșate de utilizator (unele ignoră robots.txt). Secundar: GPTBot, ClaudeBot, CCBot și tokenul Google-Extended — decid folosirea conținutului la antrenare, nu prezența în căutare.

llms.txt e un fișier Markdown la /llms.txt care descrie site-ul pentru LLM-uri: ce ești, ce oferi, unde e conținutul. Nu e un standard oficial, ci o propunere a comunității; Google spune că nu e necesar pentru a apărea în Search, iar dovezile publice că influențează citările lipsesc. Creează-l cu o definiție clară a brandului, linkuri spre paginile principale și actualizează-l la fiecare conținut nou major.

Poate fi, pentru citabilitate. Dacă PerplexityBot e blocat, nu vei apărea în rezultatele de căutare ale Perplexity prin acest bot. Dacă OAI-SearchBot e blocat, funcțiile de căutare ale ChatGPT nu te pot include. E o cauză posibilă și ușor de verificat pentru branduri cu conținut bun care nu apar în răspunsurile AI.

E o decizie strategică. Permițând boții de training, conținutul tău poate fi inclus în datele de antrenament pentru modele viitoare — ceea ce alimentează canalul parametric. Blocând, protejezi conținut proprietar dar renunți la brand awareness în modele viitoare. Pentru o agenție de marketing, permisiunea e de obicei avantajoasă.

La fiecare pagină sau secțiune majoră nouă: articole blog, servicii noi, experimente Lab finalizate. Nu e necesar la fiecare modificare minoră. O frecvență de actualizare de 1-2 ori pe lună pentru un site activ e suficientă.
Următorul pas

Vrei să aplici asta pe site-ul tău?

Discovery call de 15 minute. Îți spun direct ce poți face și prin ce ar trebui să începi.