Biti vidljiv u ChatGPT-u više ne znači automatski dati sadržaj za treniranje
Tvrtka može zadržati vidljivost u ChatGPT pretraživanju i istodobno ograničiti korištenje svog sadržaja za AI treniranje. OpenAI danas odvaja crawler za pretraživanje OAI-SearchBot od GPTBota, koji vlasnici webova mogu blokirati ako ne žele da njihove stranice budu uključene u potencijalno treniranje modela. OpenAI izričito navodi da za pojavljivanje sadržaja u sažecima i isječcima ChatGPT pretraživanja OAI-SearchBot ne smije biti blokiran, dok se za isključivanje iz potencijalnog treniranja preporučuje blokiranje GPTBota.
To je važna promjena u odnosu na jednostavno pitanje „dopustiti ili blokirati AI botove”. Ako tvrtka želi da njezine usluge, proizvodi i stručni sadržaj budu dostupni AI pretraživačima, potpuno blokiranje svih AI crawlera može biti kontraproduktivno. Upravo zato kod GEO optimizacije i privlačenja B2B kupaca kroz ChatGPT treba odvojiti vidljivost od dopuštenja za druge oblike korištenja sadržaja.
Isto vrijedi kod tehničke izrade web stranica. robots.txt više nije samo datoteka koja govori Googleu koje stranice može indeksirati. Danas može sadržavati pravila za različite AI crawlere i signale o tome smije li se sadržaj koristiti za pretraživanje, odgovore AI modela ili treniranje.
Web stranica može dopustiti AI pretraživaču da pronađe i citira sadržaj, a istodobno zabraniti crawleru za treniranje pristup tom istom sadržaju.
Cloudflareovi podaci pokazuju zašto je ta razlika postala bitna. U lipnju 2026. čak 52% crawler zahtjeva koje Cloudflare klasificira prema namjeni odnosilo se na AI treniranje, u usporedbi s 22% u proljeće 2025. Više od 36% aktivnosti dolazilo je od mixed-use crawlera koji kombiniraju pretraživanje, agentske funkcije i treniranje.
Search, ai-input i ai-train nisu ista stvar
Content Signals razdvajaju tri potpuno različita načina korištenja sadržaja. Cloudflare je u robots.txt proširio mogućnost izražavanja namjene kroz pojmove search, ai-input i ai-train.
search označava izgradnju indeksa i prikaz klasičnih rezultata s poveznicama i kratkim isječcima sadržaja. ai-input označava korištenje sadržaja kao ulaza u AI model u trenutku upita, primjerice za RAG, grounding ili generiranje odgovora temeljenog na aktualnom sadržaju weba. ai-train označava treniranje ili dodatno prilagođavanje AI modela.
Ta razlika je važna jer tvrtka možda želi jedno, ali ne i drugo. Primjerice, hotel može željeti da AI pronađe aktualne informacije o sobama i lokaciji kada korisnik postavi pitanje, ali ne mora automatski željeti dati cijelu bazu autorskih vodiča i članaka za treniranje budućih modela.
Cloudflare je još 2025. naveo da su korisnici uključili njegov managed robots.txt za više od 3,8 milijuna domena kako bi izrazili stav search=yes, ai-train=no. U rujnu 2026. otišao je korak dalje s opcijom Disallow AI Training, čiji je cilj zadržati indeksiranje za pretraživanje, a zasebno izraziti zabranu korištenja za treniranje.
Kako razdvojiti ChatGPT pretraživanje od treniranja
- Omogućite OAI-SearchBotu pristup javnim stranicama koje želite prikazivati u ChatGPT pretraživanju.
- Blokirajte GPTBot na sadržaju koji ne želite staviti na raspolaganje za potencijalno treniranje OpenAI modela.
- Provjerite robots.txt, CDN i WAF pravila kako sigurnosni sustav ne bi slučajno blokirao dopušteni crawler.
| Kriterij | ChatGPT pretraživanje | AI treniranje | | -------------------------------------------- | ---------------------------- | ------------------------------ | | OpenAI crawler | OAI-SearchBot | GPTBot | | Glavna svrha | pronalazak i prikaz sadržaja | potencijalno treniranje modela | | Treba li ga dopustiti za ChatGPT vidljivost? | da | ne | | Može li se kontrolirati odvojeno? | da | da | | Cloudflare Content Signal | search / ai-input | ai-train |
OpenAI također navodi još jednu zanimljivu mogućnost: ako izdavač dopušta OAI-SearchBot, dolazni promet iz ChatGPT pretraživanja može pratiti u analitici jer ChatGPT u referral URL dodaje utm_source=chatgpt.com. Vidljivost u AI pretraživanju zato više nije nužno potpuno nevidljiv kanal koji se ne može povezati s prometom na webu.
AI crawler više nije samo tehničko pitanje
Tvrtke trebaju odlučiti kojoj vrsti automatiziranog pristupa njihov sadržaj stvarno služi. Problem više nije samo u tome može li bot otvoriti URL, nego zašto ga otvara i što nakon toga radi sa sadržajem.
Cloudflare navodi da manje od 1% webova na njegovoj mreži bira blokirati Search botove, dok oko 17% webova koristi neki mehanizam za blokiranje AI treniranja. Ta razlika jasno pokazuje da vlasnici webova uglavnom žele ostati pronađeni, ali sve češće ne žele automatski dati ista prava sustavima koji prikupljaju podatke za treniranje.
Brojke iz prethodnih mjerenja dodatno objašnjavaju razlog. Cloudflare je za lipanj 2025. procijenio da je OpenAI imao približno 1.700 crawlova za svaki referral posjet koji je vraćao webovima, dok je Anthropicov omjer bio oko 73.000 prema jedan. Cloudflare je pritom upozorio da referral promet iz aplikacija nije uvijek moguće potpuno atribuirati, pa te brojeve treba promatrati kao procjenu, a ne kao univerzalnu vrijednost za svaki web.
To znači da stari odnos „dopustim crawleru pristup, a tražilica mi zauzvrat pošalje posjetitelje” više nije dovoljan model za donošenje odluke. Kod AI sustava isti sadržaj može služiti za indeks, generiranje odgovora, treniranje ili izvršavanje korisničke akcije.
Zato AI Search i promet web stranice treba promatrati zajedno s kontrolom crawlera. GEO nije samo strukturiranje sadržaja kako bi ga AI bolje razumio. GEO strategija mora definirati i kojem se AI sustavu sadržaj želi otvoriti, za koju namjenu te kako mjeriti rezultat.
Važno je i ograničenje robots.txt datoteke. Robots Exclusion Protocol izražava pravila crawlerima, ali nije isto što i tehnička kontrola pristupa. Cloudflare izričito upozorava da robots.txt sam ne može identificirati crawler, utvrditi njegovu stvarnu namjenu niti zaustaviti crawler koji odluči ignorirati pravila. Za stvarno blokiranje potrebni su dodatni mehanizmi poput WAF-a, bot managementa ili mrežne kontrole.
U praksi zato treba razlikovati tri razine: što web deklarira u robots.txt, što pojedini AI operator obećava poštovati i što infrastruktura weba stvarno tehnički dopušta ili blokira.
