- Palvelut
- Caset
- Toimialat
- Teknologiat
-
Ajankohtaista
- Ajankohtaista
- Ura
- Ota yhteyttä
Mikä on robots.txt?
robots.txt on verkkosivuston juureen sijoitettava tekstitiedosto, jolla sivuston omistaja voi ohjata, mitä osia sivustosta hakukonerobotit saavat tai eivät saa indeksoida. Se on yksi vanhimmista ja tärkeimmistä teknisen hakukoneoptimoinnin peruselementeistä.
Vaikka robots.txt on yksinkertainen tiedosto, sen vaikutus voi olla ratkaiseva – hyvässä ja pahassa.
Ambientia verkkokaupan strategisena kumppanina
Ambientia on kumppani, joka auttaa keskisuuria ja suuria yrityksiä kehittämään verkkoliiketoimintaa, palvelukokemusta, hakukonenäkyvyyttä, digitaalista mainontaa ja kasvattamaan myyntiä verkossa.
- Haluatko kehittää verkkokauppaasi?
- Haluatko haastaa olemassa olevaa liiketoimintamallia?
- Haluatko lisätä myyntiä?
Me voimme auttaa näissä kaikissa! Ota yhteyttä täyttämällä oheinen lomake tai ole suoraan yhteydessä Head of Commerce Timo Humalamäkeen. Jatketaan sitten juttua ja kartoitetaan teidän tilanteenne yhdessä.
Jätä yhdeydenottopyyntö
Mitä robots.txt tekee?
robots.txt kertoo hakukoneroboteille (kuten Googlebotille), miten niiden tulisi käyttäytyä sivustolla. Sen avulla voidaan esimerkiksi:
- estää tiettyjen sivujen tai hakemistojen indeksointi
- sallia vain osa sisällöstä roboteille
- ohjata crawl-budjettia tärkeille sivuille
- suojata teknisiä tai keskeneräisiä osioita
Robots.txt ei ole turvamekanismi, vaan ohje roboteille.
Missä robots.txt sijaitsee?
robots.txt tulee sijoittaa aina sivuston juureen, esimerkiksi:
https://www.example.com/robots.txt
Jos tiedostoa ei ole olemassa, hakukoneet olettavat, että kaikki sisältö on indeksoitavissa.
Miten robots.txt toimii?
Robots.txt perustuu yksinkertaiseen sääntökieleen, jossa määritellään:
- User-agent – mitä bottia ohje koskee
- Disallow – mitä polkua ei saa indeksoida
- Allow – mitä saa indeksoida, vaikka ylempi polku olisi estetty
Hakukonerobotti lukee robots.txt:n ennen kuin se alkaa indeksoida sivustoa.
Yksinkertainen robots.txt-esimerkki
Esimerkki tiedostosta, joka estää hakukoneita indeksoimasta hallintapaneelia:
User-agent: * Disallow: /admin/
Tämä tarkoittaa: kaikki robotit (User-agent: *) eivät saa indeksoida /admin/-hakemistoa.
Mitä robots.txt ei tee?
Yleinen väärinkäsitys on, että robots.txt:
- piilottaisi sivun kokonaan internetistä
- estää sivun näkymisen, jos URL tunnetaan
- takaa, ettei sivua näytetä hakutuloksissa
Jos sivuun on linkkejä muualta, se voi silti näkyä hakutuloksissa ilman sisältöä. Varsinaiseen indeksoinnin estoon tarvitaan usein noindex-tagi.
robots.txt ja SEO
Oikein käytettynä robots.txt auttaa hakukoneita keskittymään olennaiseen sisältöön ja parantaa sivuston teknistä laatua. Väärin käytettynä se voi estää koko sivuston näkymisen hakutuloksissa.
Yleisiä SEO-käyttötarkoituksia:
- estää duplikaattisisältöä (esim. suodatus-URLit)
- sulkea tekniset resurssit tai testisivut
- ohjata indeksointi tärkeimmille sivuille
robots.txt ja tekoäly
Perinteisesti robots.txt on suunnattu hakukoneille, mutta tekoälyaikakaudella sen rooli muuttuu. Yhä useammin robots.txt toimii rinnakkain:
llms.txt– ohjaa kielimallien sisällön käyttöä- API- ja lisenssiehtojen kanssa
robots.txt kertoo, mitä saa indeksoida. llms.txt kertoo, mitä saa käyttää vastauksissa.
Yleisimmät virheet robots.txt:n kanssa
- koko sivuston estäminen vahingossa
- JavaScript- tai CSS-tiedostojen estäminen
- robots.txt:n käyttäminen tietoturvakeinona
- testiympäristön unohtaminen tuotantoon siirryttäessä
Pieni virhe robots.txt:ssä voi tarkoittaa nollanäkyvyyttä hakukoneissa.
Yhteenveto
robots.txt on teknisen hakukoneoptimoinnin peruspilari, jolla ohjataan hakukonerobottien toimintaa sivustolla. Se ei ole suojausmekanismi, vaan ohjetiedosto, jonka avulla voidaan hallita indeksointia ja crawl-budjettia.
Oikein käytettynä robots.txt tukee näkyvyyttä. Väärin käytettynä se voi estää koko sivuston löytymisen.

Meri- ja veneteollisuus