De ce robots.txt contează specific pentru AI
Un robots.txt configurat pentru SEO clasic (permite Googlebot, blochează tot ce nu e necesar) poate bloca involuntar boții AI de căutare, cei care preiau conținut pentru răspunsuri cu atribuire. Dacă PerplexityBot, OAI-SearchBot sau Claude-SearchBot nu pot crawla site-ul tău, conținutul tău nu poate fi preluat de funcțiile de căutare respective — indiferent cât de bun e (Perplexity, OpenAI, Anthropic).
Problema poate apărea când robots.txt are User-agent: * cu permisiuni restrictive sau când un CMS (WordPress, Shopify, Wix) adaugă reguli de blocare generice. Auditarea robots.txt e primul pas în orice audit GEO/AEO.
Lista completă de boți AI pe care să îi permiți
Boți de căutare — preiau conținut pentru funcțiile de căutare AI (prioritate maximă):
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Bingbot
Allow: /
Fetchere declanșate de utilizator — accesează o pagină când cineva o cere într-o conversație. Documentația OpenAI spune că, fiind acțiuni inițiate de utilizator, regulile robots.txt pot să nu se aplice, iar Perplexity-User „ignoră în general" regulile robots.txt. Un Allow pentru ei e deci în mare parte simbolic:
User-agent: ChatGPT-User
Allow: /
User-agent: Perplexity-User
Allow: /
User-agent: Claude-User
Allow: /
Boți de antrenare și tokenuri de control — decid dacă conținutul poate fi folosit la antrenarea modelelor, nu dacă apari în căutare. Google-Extended nu e un bot separat, ci un token de control în robots.txt pentru folosirea conținutului la antrenarea și grounding-ul Gemini; nu influențează prezența în Google Search sau în AI Overviews. CCBot e crawlerul Common Crawl, o arhivă deschisă de date web:
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: CCBot
Allow: /
User-agent: Google-Extended
Allow: /
Strategia recomandată: permit totul implicit (User-agent: * / Allow: /) și listează excepțiile specifice, nu invers. O agenție AEO trebuie să fie maxim citabilă — blocarea selectivă a boților de training e opțională și are sens doar dacă ai conținut proprietar pe care nu vrei inclus în date de training. Liniile Allow: / de mai sus sunt implicite — le scrii doar ca să fie explicit. Și rețineți: robots.txt nu autorizează și nu protejează conținut, ci doar cere crawlerilor să respecte reguli (RFC 9309).
Ce este llms.txt
llms.txt e un fișier de convenție (similar robots.txt) care ghidează modelele de limbaj mari (LLM-uri) în înțelegerea structurii și contextului unui site. Nu e un standard oficial, ci o propunere a comunității (llmstxt.org). Adopția e reală, de ordinul a 10% dintre site-uri într-o analiză SE Ranking pe ~300.000 de domenii, dar folosirea rămâne mică: potrivit unui studiu Ahrefs (mai 2026), 97% dintre fișierele llms.txt valide nu au primit nicio cerere, iar niciun furnizor major de LLM nu îl suportă oficial. Google spune că nu ai nevoie de fișiere speciale pentru AI ca să apari în Search. Tratează-l ca pe o convenție ieftină și opțională, nu ca pe un factor de citare.
Spre deosebire de robots.txt (care spune ce poți crawla), llms.txt spune ce există și ce înseamnă — o hartă a site-ului optimizată pentru înțelegere automată, nu pentru navigare umană.
Structura unui llms.txt eficient
Format recomandat (Markdown, accesibil la /llms.txt):
# [Numele brandului]
> [O propoziție: ce face brandul, pentru cine, unde]
[2-3 paragrafe: context, fondator/echipă, abordare distinctivă]
## Servicii
- [Serviciu 1](URL): descriere scurtă
- [Serviciu 2](URL): descriere scurtă
## Resurse
- [Blog/Lab/Ghiduri](URL): ce conțin
- [Despre](URL): cine suntem
## Contact
- [Metodă de contact](URL sau tel)
Principii pentru un llms.txt bun:
- Prima propoziție ar trebui să fie o definiție clară a brandului, utilă oricărui om sau agent care citește fișierul (nicio platformă majoră nu a declarat public că îl folosește ca sursă de citare)
- Fiecare link din llms.txt trebuie să fie real și să returneze 200 — 404-urile erodează credibilitatea
- Actualizează llms.txt de fiecare dată când adaugi pagini sau servicii noi
- Nu include URL-uri de pagini draft, pagini private sau landing pages temporare
Robots.txt vs llms.txt — care face ce
| Aspect | robots.txt | llms.txt |
|---|---|---|
| Scop | Controlează accesul crawlerilor | Ghidează înțelegerea LLM-urilor |
| Format | Reguli Allow/Disallow per bot | Markdown structurat, text descriptiv |
| Standard | Standard IETF (RFC 9309, 2022) | Propunere a comunității (2024+), nu standard |
| Impact imediat | Efect în cel mult ~24 de ore (cache-ul crawlerului), nu instant; nu e un mecanism de autorizare | Neconfirmat: fără efect măsurabil pe citări în studiile publicate |
Verificare și mentenanță
- Verifică raportul robots.txt din Google Search Console (Setări): arată fișierul găsit de Google și erorile. Vechiul instrument de testare a fost retras; pentru un URL anume folosește Inspecția URL-ului, iar pentru alți boți un parser local (biblioteca open-source robots.txt a Google)
- Verifică periodic că /llms.txt returnează 200 (poate fi spart de redirects sau config server)
- Adaugă în llms.txt secțiunile Blog și Lab pe măsură ce publici conținut nou
- După orice modificare de CMS sau server, re-verifică că boții AI nu au fost blocați accidental
12+ ani în SEO, SEO tehnic la scară enterprise. Scrie despre GEO/AEO și schema markup din experiență directă, nu din research generic.
Vezi profilul complet →