robots.txt pentru boți AI:Cine te antrenează, cine te citește și cum decizi tu
Toată piața vorbește despre llms.txt ca despre fișierul care controlează relația ta cu AI-ul. Am arătat, cu date, că e un mit: din 500 de milioane de accesări de boți AI, doar 408 au țintit llms.txt, iar Google Search îl ignoră explicit. Fișierul pe care toți boții AI îl respectă, în schimb, e cel vechi de zeci de ani: robots.txt.
Acolo se ia decizia reală — cine antrenează modele pe conținutul tău, cine te citește în răspunsuri, cine te lasă în pace. Iar decizia nu e „totul sau nimic": poți permite unui bot să te citească în răspunsuri și, în același timp, să refuzi ca datele tale să antreneze modele viitoare. Ghidul ăsta îți arată exact cum, cu directivele oficiale verificate la sursă.
Cele două manete Google:Googlebot vs. Google-Extended
Prima confuzie pe care majoritatea o fac: cred că „las Google-ul să-mi vadă site-ul pentru AI" e o singură decizie. Sunt două manete independente.
| User-agent | Ce face | Dacă îl blochezi în robots.txt |
|---|---|---|
| Googlebot | Indexează site-ul pentru Google Search, iar conținutul indexat alimentează și AI Overviews / AI Mode | Dispari complet din Google Search |
| Google-Extended | Token pentru antrenarea generațiilor viitoare de modele Gemini și pentru grounding în Vertex AI | Rămâi în Google Search — nu-ți afectează ranking-ul; doar nu-ți antrenezi datele în modele |
Detaliul de inginerie, direct din documentația Google: „Google-Extended nu are un user agent HTTP separat. Crawling-ul se face cu string-urile de user agent Google existente." Și, critic: „Google-Extended nu afectează includerea unui site în Google Search și nu e folosit ca semnal de ranking."
Consecința practică: poți fi complet vizibil în AI Overviews (prin Googlebot) și, simultan, să refuzi ca datele tale să antreneze Gemini (blocând Google-Extended). Nu e o alegere binară.
Toți boții AI din 2026, pe categorii
Aici e referința pe care puține ghiduri o dau completă. Nu sunt patru boți, sunt zeci — iar fiecare mare furnizor rulează boți separați pentru antrenare, pentru căutare și pentru navigarea live cerută de utilizator. Ca să controlezi corect, trebuie să știi cine e cine.
Boți de antrenare (îți folosesc conținutul ca să antreneze modele)
| Bot | Cui aparține | Respectă robots.txt |
|---|---|---|
| GPTBot | OpenAI | Da |
| ClaudeBot | Anthropic | Da |
| Amazonbot | Amazon (Alexa + Nova) | Da |
| Meta-ExternalAgent | Meta (AI din Facebook/Instagram/WhatsApp) | Da |
| CCBot | Common Crawl (antrenează majoritatea modelelor open-source) | Da |
| Bytespider | ByteDance (Doubao) | Nedocumentat — adesea NU |
Boți de căutare și recuperare (te citează în răspunsuri)
| Bot | Cui aparține | Respectă robots.txt |
|---|---|---|
| Googlebot | Google (Search + AI Overviews) | Da |
| OAI-SearchBot | OpenAI (căutarea ChatGPT) | Da |
| Claude-SearchBot | Anthropic | Da |
| PerplexityBot | Perplexity | Documentat da, observat inconsecvent |
| Google-CloudVertexBot | Google (grounding Vertex AI) | Da |
| Bingbot | Microsoft (Bing + Copilot) | Da |
| DuckAssistBot | DuckDuckGo | Da |
| Applebot | Apple (Siri, Spotlight, Safari) | Da |
Fetcheri declanșați de utilizator (navighează live când cineva le cere)
| Bot | Cui aparține | Respectă robots.txt |
|---|---|---|
| Google-Agent | Google (Project Mariner) | NU — cererea vine de la un om |
| ChatGPT-User | OpenAI | Da |
| Claude-User | Anthropic | Da |
| Perplexity-User | Perplexity | Inconsecvent |
| MistralAI-User | Mistral (Le Chat) | Da |
Nuanța pe care Google o declară oficial: „pentru că fetch-ul a fost cerut de un utilizator, acești fetcheri ignoră în general regulile robots.txt". Deci un agent care-ți deschide pagina fiindcă un om i-a cerut-o poate trece peste robots.txt — nu e o portiță, e prin design.
Cele două manete de opt-out din antrenare (NU sunt crawleri)
| Token | Cui aparține | Ce controlează | Ce NU afectează |
|---|---|---|---|
| Google-Extended | Antrenarea Gemini pe conținut crawl-uit | Ranking-ul în Google Search | |
| Applebot-Extended | Apple | Antrenarea Apple Intelligence | Siri, Spotlight, Safari |
Amândouă sunt manete, nu boți: „Google-Extended nu are un user agent HTTP separat", iar „Applebot-Extended nu crawl-ează pagini". Le pui în robots.txt ca să refuzi antrenarea, fără să-ți afectezi vizibilitatea.
Trafic nedeclarat sau mascat (aici robots.txt NU te apără)
| Bot | Cui aparține | Problema |
|---|---|---|
| xAI Grok | xAI | IP-uri rezidențiale + user-agent falsificat; zero documentație — nu-l poți bloca fiabil din robots.txt |
| Copilot Actions | Microsoft | User-agent Edge standard; niciun semnal distinct de bot |
| Firecrawl | Firecrawl | Scraper-as-a-service |
Adevărul incomod, spus cinstit: robots.txt e o convenție de bunăvoință. Boții declarați ai marilor furnizori o respectă. Bytespider și xAI Grok, adesea, nu. Pentru ei, robots.txt nu ajunge — ai nevoie de blocare la nivel de firewall / CDN (Cloudflare, reguli de WAF), sau de verificare criptografică (Web Bot Auth, RFC 9421). Cine îți vinde „control total al AI prin robots.txt" îți vinde jumătate de adevăr.
Decizia strategică:Permite căutarea, refuză antrenarea
Cea mai comună strategie pentru un brand care vrea vizibilitate în răspunsurile AI, dar nu vrea să-și doneze conținutul la antrenarea gratuită a modelelor: permite boții de căutare, blochează boții de antrenare.
Exemplu de robots.txt care face exact asta:
# Boții de CĂUTARE — permiși (ca să apari în răspunsuri)
User-agent: Googlebot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Boții de ANTRENARE — blocați (ca să nu-ți antrenezi datele)
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
Reține: pentru boții care ignoră robots.txt (Bytespider, xAI Grok, fetcherii declanșați de utilizator), regulile de mai sus nu sunt suficiente — blocarea reală se face la nivel de firewall sau CDN.
Nu e singura strategie corectă — un publisher care vrea licențiere de conținut poate bloca tot, un brand agresiv pe vizibilitate poate permite tot. Ideea e că decizia e a ta, per bot, și se ia în robots.txt — nu într-un fișier pe care nimeni nu-l citește.
Controlul afișării în AI Overviews:Nosnippet și max-snippet
robots.txt decide cine te crawlează. Pentru a controla cât din conținutul tău poate fi folosit ca input în rezumatele AI, ai directive separate, la nivel de pagină. Aici e o precizie pe care puține ghiduri o fac corect:
nosnippet— Google confirmă oficial că această directivă „va împiedica folosirea conținutului ca input direct pentru AI Overviews și AI Mode".max-snippet:[n]— limitează snippet-ul la n caractere și, citat oficial, „va limita de asemenea cât din conținut poate fi folosit ca input direct pentru AI Overviews și AI Mode".data-nosnippet— atribut HTML care marchează porțiuni de text să nu apară ca snippet. Atenție la mitul repetat des: documentația Google NU afirmă cădata-nosnippetcontrolează folosirea în AI Overviews, spre deosebire denosnippetșimax-snippet. Dacă vrei să ții o secțiune în afara input-ului AI, mecanismul documentat enosnippet, nudata-nosnippet.
Ce NU face robots.txt
Ca să fim la fel de clari ca despre llms.txt: robots.txt controlează accesul, nu citarea. Faptul că permiți un bot nu garantează că vei fi citat — asta depinde de calitatea și claritatea conținutului tău, exact ce spune Google că funcționează. robots.txt e maneta de acces, nu un truc de ranking.
Și nu confunda blocarea antrenării cu dispariția din răspunsuri: multe modele răspund pe baza căutării live (grounding), nu doar a antrenamentului. De aceea separi boții — blochezi antrenarea, păstrezi căutarea.
FAQ.PROTOCOL
Întrebări frecvente
Hai să construim ceva remarcabil.
Discovery call 30 min — fără cost, fără pitch. Auditul arhitecturii tale digitale și un plan operațional clar.
- 01Mesaj scurt cu contextul afacerii tale
- 02Răspuns în 24h cu o propunere de discovery call
- 03Plan operațional + recomandare de scope