Johdanto
Jokainen tekoälyindeksoijia käsittelevä artikkeli varoittaa samasta virheestä. Varoitus kuuluu, että estit GPTBot-robotin vuoden 2023 scraping-paniikin aikana ja sait vahingossa kiinni uudemmat agentit, jotka hakevat sivuja siteerattavaksi reaaliaikaisissa vastauksissa. Tarkoituksesi oli pysäyttää koulutusscraperit, mutta samalla kieltäydyit hiljaisesti suosituksista.
Tarkistimme, tapahtuuko näin todellisuudessa.
219 verkkotunnuksen joukossa sitä ei tapahtunut kertaakaan.
Ei harvoin. Ei muutamassa tapauksessa. Ei kertaakaan.
Menetelmä
Otimme 26 kaupallisen hakukyselyn 20 parasta orgaanista tulosta seitsemästä kategoriasta: SaaS, verkkokauppa, rahoitus, terveys, matkailu, koti ja markkinointi. Tuloksena saimme 254 yksilöllistä verkkotunnusta. Haimme jokaisesta robots.txt-tiedoston 28. heinäkuuta 2026, ja 219 tunnistetta ratkaistiin. Seitsemästä niistä ei löytynyt lainkaan robots.txt-tiedostoa, mikä lasketaan kaiken sallimiseksi.
Jokaiselle verkkotunnukselle tarkistimme jokaisen tekoälykäyttäjäagentin tiedoston suhteen käyttäen vakiintunutta prioriteettisääntöä: tarkin vastaava User-agent-ryhmä voittaa, joten tarkka agenttivastaavuus ohittaa *-merkin. Verkkotunnuksen katsotaan estävän agenttia, kun sen voittava ryhmä kieltää sivuston juurihakemiston ilman tarkempaa sallintaa.
Tarkistettiin kaksitoista agenttia, jaoteltuna niiden syöttämän sisällön mukaan.
| Agentti | Operaattori | Syötteet |
| GPTBot | OpenAI | koulutus |
| OAI-SearchBot | OpenAI | ChatGPT-hakulähteet |
| ClaudeBot | Anthropic | koulutus |
| Claude-SearchBot | Anthropic | Claude-hakulähteet |
| PerplexityBot | Perplexity | vastaukset |
| DuckAssistBot | DuckDuckGo | vastaukset |
| Amazonbot | Amazon | vastaukset |
| CCBot | Common Crawl | monien mallien käyttämä tekstikorpus |
| Google-Extended | Gemini-koulutus, ei haku | |
| Applebot-Extended | Apple | koulutus |
| Bytespider | ByteDance | koulutus |
| meta-ulkoinen agentti | Meta | koulutus |
Tulokset
77 % näistä verkkotunnuksista sallii kaikki tekoälyagentit. 23 % estää vähintään yhden.
| Agentti | Estetty | Verkkotunnukset, joissa se mainitaan nimenomaisesti |
| Bytespider | 20 % | 45 |
| CCBot | 20 % | 47 |
| ClaudeBot | 17 % | 50 |
| Google-Extended | 16 % | 46 |
| meta-externalagent | 16 % | 38 |
| PerplexityBot | 15 % | 44 |
| GPTBot | 14 % | 53 |
| Applebot-Extended | 14 % | 39 |
| Amazonbot | 13 % | 39 |
| Claude-SearchBot | 10 % | 22 |
| DuckAssistBot | 10 % | 24 |
| OAI-SearchBot | 9 % | 34 |
Harvimmin estetty agentti on se, joka hakee sivuja ChatGPT:n lainaamista varten. Useimmin estetyt agentit ovat niitä, jotka keräävät dataa koulutuskorpuksiin.
All-in-One-alusta tehokkaaseen hakukoneoptimointiin
Jokaisen menestyvän yrityksen takana on vahva SEO-kampanja. Mutta kun tarjolla on lukemattomia optimointityökaluja ja -tekniikoita, voi olla vaikea tietää, mistä aloittaa. No, älä pelkää enää, sillä minulla on juuri oikea apu. Esittelen Ranktracker all-in-one -alustan tehokasta SEO:ta varten.
Olemme vihdoin avanneet Ranktrackerin rekisteröinnin täysin ilmaiseksi!
Luo ilmainen tiliTai Kirjaudu sisään omilla tunnuksillasi
Tämä järjestys ei ole sattumaa, ja se on koko tutkimuksen tulos.
Kukaan ei tee virhettä. Jokainen tekee päätöksen
Tarkastellaan kahta operaattoria, jotka ylläpitävät sekä koulutuskrawleria että hakukrawleria.
| Estää molemmat | Estää koulutuksen, sallii haun | Estää haun, sallii koulutuksen | |
| OpenAI, GPTBot / OAI-SearchBot | 9 % | 5 % | 0 |
| Anthropic, ClaudeBot / Claude-SearchBot | 10 % | 7 % | 0 |
Kaksitoista verkkotunnusta estää GPTBot-robotin, mutta sallii tarkoituksellisesti OAI-SearchBot-robotin. Viisitoista toimii vastaavasti Anthropicin osalta. Tämä on johdonmukainen käytäntö: älä kouluta sisältöäni, mutta lainaa minua vapaasti.
Kukaan ei tee päinvastoin.
Kaksi muuta lukua viittaavat samaan suuntaan. Koko otoksessa vain neljä verkkotunnusta käyttää yleistä User-agent: * -juurikieltoa, ja täsmälleen yksi estää tekoälyagentin mainitsematta mitään tekoälyagenttia nimenomaisesti. Kuka tahansa näitä tiedostoja muokkaa, tietää, mitkä agentit ovat olemassa ja mitä kukin niistä tekee.
Joten alan varoitus koskee ongelmaa, jota tässä otoksessa ei ole olemassa. Mielenkiintoinen kysymys ei ole se, estitkö hakurobotit vahingossa, vaan se, oliko se tarkoituksesi.
Koska 18 % näistä verkkotunnuksista estää vähintään yhden hakurobotin ja 4 % estää kaikki neljä. Nämä sivustot ovat kieltäytyneet näkymästä tekoälyvastauksissa, ja tämän todistusaineiston perusteella ne ovat tehneet sen tarkoituksella.
Viisi tapaa korjata tilanne jo tänään
-
Käsittele koulutusta ja hakua kahtena erillisenä kysymyksenä. Ne ovat erilaisia päätöksiä, ja markkinat ovat jo erottaneet ne toisistaan. Useimmat julkaisijat haluavat jälkimmäisen ilman ensimmäistä. Kirjoita tiedosto tällä tavalla sen sijaan, että käsittelisit ”AI-indeksoijia” yhtenä kategoriana.
-
Nimeä jokainen agentti nimenomaisesti. Vain neljä verkkotunnusta tässä luettelossa käyttää jokerimerkkiä, ja siihen on hyvä syy: pelkkä User-agent: * disallow -määräys estää agentteja, joita ei ollut olemassa, kun kirjoitit sen, ja se estää myös agentteja, joita ei ole vielä olemassa. Kaksi näistä tuloksista eniten estettyä agenttia, Bytespider ja meta-externalagent, ovat peräisin ajalta, joka on myöhempi kuin suurin osa edelleen kiertävistä robots.txt-ohjeista.
-
Tarkista OAI-SearchBot ja Claude-SearchBot nimeltä. Nämä kaksi päättävät, voidaanko sinua siteerata. Yhdeksän ja kymmenen prosenttia otoksesta estää ne. Jos kuulut tähän ryhmään ilman että se oli tarkoituksesi, tämä on se rivi, jota sinun tulee muuttaa, ja se on ainoa kohta tässä luettelossa, jolla on välitön näkyvyyskustannus.
-
Tarkista tilanne uudelleen neljännesvuosittain. Uusia agentteja on ilmestynyt useita kertoja kuluneen vuoden aikana. 18 kuukautta sitten laaditusta tiedostosta puuttuu merkintöjä riippumatta siitä, kuinka huolellisesti se tuolloin laadittiin.
-
Tarkista myös reuna-alueet, älä vain tiedostoa. CDN:n botinhallintasäännöt voivat estää agentin, jonka robots.txt nimenomaisesti sallii, eikä tiedosto kerro siitä mitään. Tämä on virhe, joka selviää täydellisestäkin robots.txt-tiedostosta.
Lähtökohta, joka erottaa nämä kaksi päätöstä toisistaan:
# Lainaa minua. Nämä hakevat sivuja, joita voidaan lainata reaaliaikaisissa vastauksissa.
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Tapaa RanktrackerAll-in-One-alusta tehokkaaseen hakukoneoptimointiin
Jokaisen menestyvän yrityksen takana on vahva SEO-kampanja. Mutta kun tarjolla on lukemattomia optimointityökaluja ja -tekniikoita, voi olla vaikea tietää, mistä aloittaa. No, älä pelkää enää, sillä minulla on juuri oikea apu. Esittelen Ranktracker all-in-one -alustan tehokasta SEO:ta varten.
Olemme vihdoin avanneet Ranktrackerin rekisteröinnin täysin ilmaiseksi!
Luo ilmainen tiliTai Kirjaudu sisään omilla tunnuksillasi
User-agent: DuckAssistBot
Allow: /
Älä kouluta minua. Vaihda nämä salliviksi (Allow), jos olet eri mieltä.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Tämä vastaa melko tarkasti sitä konfiguraatiota, jota jo 12–15 verkkotunnusta tässä otoksessa käyttää. Se on nykyään pikemminkin yleinen käytäntö kuin mikään erityisen oivaltava ratkaisu.
Miksi mikään tästä ei näy raportissa, jota jo käytät
Search Console raportoi Googlebotista. Se ei mainitse mitään OAI-SearchBotista. Analytics raportoi istuntoja, eikä hakukone, joka ei koskaan viittaa sivustoosi, lähetä puuttuvia istuntoja. Sijoitusten seurantatyökalut raportoivat sijoituksia, eikä mikään tästä vaikuta sijoituksiisi.
All-in-One-alusta tehokkaaseen hakukoneoptimointiin
Jokaisen menestyvän yrityksen takana on vahva SEO-kampanja. Mutta kun tarjolla on lukemattomia optimointityökaluja ja -tekniikoita, voi olla vaikea tietää, mistä aloittaa. No, älä pelkää enää, sillä minulla on juuri oikea apu. Esittelen Ranktracker all-in-one -alustan tehokasta SEO:ta varten.
Olemme vihdoin avanneet Ranktrackerin rekisteröinnin täysin ilmaiseksi!
Luo ilmainen tiliTai Kirjaudu sisään omilla tunnuksillasi
On kaksi tapaa havaita tämä. Lue tiedosto suoraan, kuten tässä tutkimuksessa tehtiin. Tai etsi syy oireiden perusteella AI-näkyvyystarkistimella, esittämällä hakukoneille luokkakohtaisia kysymyksiä aikataulun mukaisesti ja odottamalla vastausta, jossa ne ilmoittavat, etteivät näe sivustoasi lainkaan.
Tämän tutkimuksen taustalla oleva indeksointirobotin tarkastus on sama, jota käytämme Honeyb:ssä: se vertaa jokaisen yllä olevassa luettelossa mainitun agentin sivuston robot-sääntöihin säännöllisesti eikä kertaluonteisesti. Pääsy on ensimmäinen neljästä tarkistettavasta asiasta. Kolme muuta ovat se, suosittelevatko hakukoneet sinua, mitä konkreettisesti tulisi muuttaa, sekä muutoksen edellyttämän sisällön tuottaminen ja julkaiseminen.
Kaksi mainitsemisen arvoista rajoitusta
Tämä otos koostuu Yhdysvaltain kaupallisista hakutulossivuista, joten se painottuu suuriin julkaisijoihin ja vakiintuneisiin brändeihin, joilla on sekä tietoisuutta että oikeudellista neuvontaa harkitun päätöksen tekemiseen tässä asiassa. Otos pienyritysten sivustoista näyttäisi hyvin todennäköisesti erilaiselta, ja tarina tahattomasta estämisestä saattaisi hyvinkin osoittautua totta niissä. Suoritamme sen seuraavaksi.
Robots.txt-tiedosto tallentaa aikomuksen, ei täytäntöönpanoa. Emme testanneet, tarjoavatko nämä verkkotunnukset tosiasiassa sisältöä jokaiselle agentille, sillä juuri siinä piilee CDN-sääntöjen merkitys ja siinä kohtaa tiedoston ja todellisuuden välinen kuilu yleensä avautuu.
Tämän tutkimuksen taustalla oleva alusta löytyy osoitteesta honeyb.ai.

