Sari la conținut
Căutare AI (AEO/GEO)23 iul. 2026·8 min citire

robots.txt pentru boți AI: Google-Extended, GPTBot și controlul real

Dragoș-Adrian BuhoiuDragoș-Adrian BuhoiuFondator · Arhitect Ecosisteme Digitale

Cum controlezi cine te antrenează și cine te citește: Google-Extended, GPTBot, ClaudeBot, per bot. Directive oficiale verificate la sursă, nu llms.txt.

robots.txt pentru boți AI:Cine te antrenează, cine te citește și cum decizi tu

Toată piața vorbește despre llms.txt ca despre fișierul care controlează relația ta cu AI-ul. Am arătat, cu date, că e un mit: din 500 de milioane de accesări de boți AI, doar 408 au țintit llms.txt, iar Google Search îl ignoră explicit. Fișierul pe care toți boții AI îl respectă, în schimb, e cel vechi de zeci de ani: robots.txt.

Acolo se ia decizia reală — cine antrenează modele pe conținutul tău, cine te citește în răspunsuri, cine te lasă în pace. Iar decizia nu e „totul sau nimic": poți permite unui bot să te citească în răspunsuri și, în același timp, să refuzi ca datele tale să antreneze modele viitoare. Ghidul ăsta îți arată exact cum, cu directivele oficiale verificate la sursă.

Cele două manete Google:Googlebot vs. Google-Extended

Prima confuzie pe care majoritatea o fac: cred că „las Google-ul să-mi vadă site-ul pentru AI" e o singură decizie. Sunt două manete independente.

User-agentCe faceDacă îl blochezi în robots.txt
GooglebotIndexează site-ul pentru Google Search, iar conținutul indexat alimentează și AI Overviews / AI ModeDispari complet din Google Search
Google-ExtendedToken pentru antrenarea generațiilor viitoare de modele Gemini și pentru grounding în Vertex AIRămâi în Google Search — nu-ți afectează ranking-ul; doar nu-ți antrenezi datele în modele

Detaliul de inginerie, direct din documentația Google: „Google-Extended nu are un user agent HTTP separat. Crawling-ul se face cu string-urile de user agent Google existente." Și, critic: „Google-Extended nu afectează includerea unui site în Google Search și nu e folosit ca semnal de ranking."

Consecința practică: poți fi complet vizibil în AI Overviews (prin Googlebot) și, simultan, să refuzi ca datele tale să antreneze Gemini (blocând Google-Extended). Nu e o alegere binară.

Toți boții AI din 2026, pe categorii

Aici e referința pe care puține ghiduri o dau completă. Nu sunt patru boți, sunt zeci — iar fiecare mare furnizor rulează boți separați pentru antrenare, pentru căutare și pentru navigarea live cerută de utilizator. Ca să controlezi corect, trebuie să știi cine e cine.

Boți de antrenare (îți folosesc conținutul ca să antreneze modele)

BotCui aparțineRespectă robots.txt
GPTBotOpenAIDa
ClaudeBotAnthropicDa
AmazonbotAmazon (Alexa + Nova)Da
Meta-ExternalAgentMeta (AI din Facebook/Instagram/WhatsApp)Da
CCBotCommon Crawl (antrenează majoritatea modelelor open-source)Da
BytespiderByteDance (Doubao)Nedocumentat — adesea NU

Boți de căutare și recuperare (te citează în răspunsuri)

BotCui aparțineRespectă robots.txt
GooglebotGoogle (Search + AI Overviews)Da
OAI-SearchBotOpenAI (căutarea ChatGPT)Da
Claude-SearchBotAnthropicDa
PerplexityBotPerplexityDocumentat da, observat inconsecvent
Google-CloudVertexBotGoogle (grounding Vertex AI)Da
BingbotMicrosoft (Bing + Copilot)Da
DuckAssistBotDuckDuckGoDa
ApplebotApple (Siri, Spotlight, Safari)Da

Fetcheri declanșați de utilizator (navighează live când cineva le cere)

BotCui aparțineRespectă robots.txt
Google-AgentGoogle (Project Mariner)NU — cererea vine de la un om
ChatGPT-UserOpenAIDa
Claude-UserAnthropicDa
Perplexity-UserPerplexityInconsecvent
MistralAI-UserMistral (Le Chat)Da

Nuanța pe care Google o declară oficial: „pentru că fetch-ul a fost cerut de un utilizator, acești fetcheri ignoră în general regulile robots.txt". Deci un agent care-ți deschide pagina fiindcă un om i-a cerut-o poate trece peste robots.txt — nu e o portiță, e prin design.

Cele două manete de opt-out din antrenare (NU sunt crawleri)

TokenCui aparțineCe controleazăCe NU afectează
Google-ExtendedGoogleAntrenarea Gemini pe conținut crawl-uitRanking-ul în Google Search
Applebot-ExtendedAppleAntrenarea Apple IntelligenceSiri, Spotlight, Safari

Amândouă sunt manete, nu boți: „Google-Extended nu are un user agent HTTP separat", iar „Applebot-Extended nu crawl-ează pagini". Le pui în robots.txt ca să refuzi antrenarea, fără să-ți afectezi vizibilitatea.

Trafic nedeclarat sau mascat (aici robots.txt NU te apără)

BotCui aparțineProblema
xAI GrokxAIIP-uri rezidențiale + user-agent falsificat; zero documentație — nu-l poți bloca fiabil din robots.txt
Copilot ActionsMicrosoftUser-agent Edge standard; niciun semnal distinct de bot
FirecrawlFirecrawlScraper-as-a-service

Adevărul incomod, spus cinstit: robots.txt e o convenție de bunăvoință. Boții declarați ai marilor furnizori o respectă. Bytespider și xAI Grok, adesea, nu. Pentru ei, robots.txt nu ajunge — ai nevoie de blocare la nivel de firewall / CDN (Cloudflare, reguli de WAF), sau de verificare criptografică (Web Bot Auth, RFC 9421). Cine îți vinde „control total al AI prin robots.txt" îți vinde jumătate de adevăr.

Decizia strategică:Permite căutarea, refuză antrenarea

Cea mai comună strategie pentru un brand care vrea vizibilitate în răspunsurile AI, dar nu vrea să-și doneze conținutul la antrenarea gratuită a modelelor: permite boții de căutare, blochează boții de antrenare.

Exemplu de robots.txt care face exact asta:

# Boții de CĂUTARE — permiși (ca să apari în răspunsuri)
User-agent: Googlebot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Boții de ANTRENARE — blocați (ca să nu-ți antrenezi datele)
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Meta-ExternalAgent
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

Reține: pentru boții care ignoră robots.txt (Bytespider, xAI Grok, fetcherii declanșați de utilizator), regulile de mai sus nu sunt suficiente — blocarea reală se face la nivel de firewall sau CDN.

Nu e singura strategie corectă — un publisher care vrea licențiere de conținut poate bloca tot, un brand agresiv pe vizibilitate poate permite tot. Ideea e că decizia e a ta, per bot, și se ia în robots.txt — nu într-un fișier pe care nimeni nu-l citește.

Controlul afișării în AI Overviews:Nosnippet și max-snippet

robots.txt decide cine te crawlează. Pentru a controla cât din conținutul tău poate fi folosit ca input în rezumatele AI, ai directive separate, la nivel de pagină. Aici e o precizie pe care puține ghiduri o fac corect:

  • nosnippet — Google confirmă oficial că această directivă „va împiedica folosirea conținutului ca input direct pentru AI Overviews și AI Mode".
  • max-snippet:[n] — limitează snippet-ul la n caractere și, citat oficial, „va limita de asemenea cât din conținut poate fi folosit ca input direct pentru AI Overviews și AI Mode".
  • data-nosnippet — atribut HTML care marchează porțiuni de text să nu apară ca snippet. Atenție la mitul repetat des: documentația Google NU afirmă că data-nosnippet controlează folosirea în AI Overviews, spre deosebire de nosnippet și max-snippet. Dacă vrei să ții o secțiune în afara input-ului AI, mecanismul documentat e nosnippet, nu data-nosnippet.

Ce NU face robots.txt

Ca să fim la fel de clari ca despre llms.txt: robots.txt controlează accesul, nu citarea. Faptul că permiți un bot nu garantează că vei fi citat — asta depinde de calitatea și claritatea conținutului tău, exact ce spune Google că funcționează. robots.txt e maneta de acces, nu un truc de ranking.

Și nu confunda blocarea antrenării cu dispariția din răspunsuri: multe modele răspund pe baza căutării live (grounding), nu doar a antrenamentului. De aceea separi boții — blochezi antrenarea, păstrezi căutarea.

FAQ.PROTOCOL

Întrebări frecvente

Nu. Oficial, Google spune că Google-Extended „nu afectează includerea unui site în Google Search și nu e folosit ca semnal de ranking". Rămâi în căutare și în AI Overviews (alimentate de Googlebot); doar refuzi ca datele tale să antreneze modelele Gemini viitoare.
Nu neapărat. GPTBot e botul de antrenare al OpenAI; căutarea din ChatGPT o face OAI-SearchBot, iar acțiunile agentului, ChatGPT-User. Dacă vrei vizibilitate în răspunsuri dar nu în antrenare, blochezi GPTBot și permiți OAI-SearchBot.
Nu. `robots.txt` e respectat de toți boții AI majori și e mecanismul oficial de control al accesului. `llms.txt` e ignorat de Google Search și are adoptare sub 11%. Vezi ghidul complet despre llms.txt.
Boții declarați ai marilor furnizori (Google, OpenAI, Anthropic, Perplexity) respectă `robots.txt`. Există și crawlere care îl ignoră, dar controlul per bot din `robots.txt` acoperă marea majoritate a traficului AI legitim și e prima linie de decizie.
Din log-urile serverului sau din analytics, filtrând după user-agent (Googlebot, GPTBot, ClaudeBot etc.). Așa vezi cine te crawlează cu adevărat, înainte să decizi ce permiți și ce blochezi.
INIȚIAZĂ.SECVENȚA
// 01_OF_01
// Următorul Pas

Hai să construim ceva remarcabil.

Discovery call 30 min — fără cost, fără pitch. Auditul arhitecturii tale digitale și un plan operațional clar.

  1. 01Mesaj scurt cu contextul afacerii tale
  2. 02Răspuns în 24h cu o propunere de discovery call
  3. 03Plan operațional + recomandare de scope
Contactează-nesau explorează resursele
Răspuns în 24hZero spamDirect cu fondatorul

Note de inginerie digitală

SEO, AEO, automatizări — esențialul, o dată la ~2 săptămâni. Fără spam.

Te poți dezabona oricând. Confidențialitate

Articole conexe

AUDIT GRATUIT · 24–48H

Vezi exact unde stai — fără promisiuni.

Rulăm datele reale ale site-ului tău — viteză, indexare, vizibilitate în Google și în căutarea AI — și-ți trimitem un raport concret.

✓ AȘA DA

  • Probleme concrete, prioritizate
  • Verificat manual, nu de un tool
  • Fără card, fără obligații

✕ AȘA NU

  • „Locul 1 garantat în 7 zile"
  • Raport generic scuipat de AI
  • Apel de vânzare agresiv
Cere auditul gratuit →
WhatsApp direct