Przejdź do treści
‹ Wszystkie narzędzia

Co Twój robots.txt pozwala indeksować

Plik robots.txt mówi robotom wyszukiwarek, gdzie wolno im wejść. Jeden zapis potrafi zamknąć całą stronę przed Google, a serwer przez cały czas odpowiada normalnie, więc zwykły monitoring niczego nie zauważa. Nie zostawiamy Cię z wydrukiem reguł: piszemy, co każda z nich robi, co zostaje poza wynikami i czy wskazana mapa strony naprawdę istnieje.

Podaj samą domenę. Adres wklejony z przeglądarki też przyjmiemy.

Co dokładnie sprawdzamy

  • Czy plik zamyka całą stronę przed wyszukiwarkami (User-agent: *, Disallow: /)
  • Czy któraś wyszukiwarka ma własny zakaz wstępu, mimo otwartej reguły ogólnej — Googlebot, Bingbot i inne
  • Które ścieżki zostają poza zasięgiem robotów, czyli czego nie będzie w wynikach
  • Którym robotom modeli AI plik zabrania wstępu: GPTBot, ClaudeBot, CCBot, Google-Extended i inne
  • Czy plik wskazuje mapę strony — i czy pod wskazanym adresem naprawdę stoi mapa, a nie strona błędu
  • Czy mapa istnieje, choć nikt jej w pliku nie wskazał (/sitemap.xml, /sitemap_index.xml, /wp-sitemap.xml)
  • Czy plik w ogóle istnieje pod adresem /robots.txt

Czytamy plik robots.txt i pobieramy mapę strony, którą wskazuje — sam wpis „Sitemap:" niczego nie dowodzi, bo wygląda tak samo, gdy prowadzi do adresu po poprzednim systemie. Znaczniki noindex na poszczególnych podstronach sprawdza przegląd podstron w panelu, bo wymaga wejścia na każdy adres z osobna.

Chcesz zbudować albo poprawić plik? Generator robots.txt ›

Jak czytać wynik

Cała strona zamknięta

Zapis „User-agent: * / Disallow: /" mówi wszystkim wyszukiwarkom, że nie wolno im pobrać ani jednej podstrony. Strona działa dla odwiedzających, ale z czasem znika z Google. Najczęściej to plik ze środowiska testowego, który wjechał na produkcję razem z wdrożeniem.

Zablokowane roboty AI

Osobne wpisy potrafią odmówić wstępu robotom modeli AI, jak GPTBot czy ClaudeBot, przy stronie otwartej dla zwykłych wyszukiwarek. Bywa to świadomym wyborem: nie każdy chce, żeby jego treści zasilały modele. Pokazujemy stan, decyzja należy do Ciebie.

Zakaz z nazwy robota

Grupa „User-agent: Googlebot" zastępuje regułę ogólną w całości, a nie dokłada się do niej. Plik potrafi więc wpuszczać wszystkich zapisem „*" i osobnym wpisem zamykać samego Googlebota. Reguła ogólna wygląda wtedy niewinnie, a strony w Google nie ma.

Mapa strony, której nie ma

Wpis „Sitemap:" podpowiada wyszukiwarce pełną listę adresów, ale jest tylko deklaracją: adres bywa z poprzedniego systemu i oddaje 404, bywa względny (a ten zapis wymaga pełnego adresu), bywa zamknięty własną regułą Disallow. Dlatego wskazany adres pobieramy i mówimy, co pod nim stoi. Brak wpisu nie jest błędem — mapę można zgłosić w narzędziach dla webmasterów — ale wpis w robots.txt to najprostsza droga.

Brak pliku

Gdy pliku nie ma, roboty indeksują wszystko domyślnie. To nie usterka, choć plik przydaje się choćby po to, żeby wskazać mapę strony albo zamknąć zaplecze.

Najczęstsze przyczyny

Plik ze staginga na produkcji

Środowiska testowe trzymają „Disallow: /", żeby nie trafiły do Google. Wdrożenie kopiujące pliki w całości przenosi ten zapis na żywą stronę. To najczęstsza przyczyna nagłego zniknięcia z wyników.

Odhaczone „nie indeksuj" w systemie zarządzania treścią

W systemach jak WordPress jedno pole „poproś wyszukiwarki o nieindeksowanie" przełącza całą stronę na niewidoczną. Zostaje włączone po migracji albo po pracach i nikt do niego nie zagląda.

Skopiowany cudzy robots.txt

Plik przeklejony z innej strony blokuje katalogi, których u Ciebie nie ma, albo boty, które chcesz wpuścić. Warto przeczytać go linijka po linijce, a nie ufać, że pasuje.

Pytania i odpowiedzi

Czy robots.txt to to samo co noindex?

Nie. robots.txt prosi robota, żeby nie wchodził na adres. Znacznik noindex pozwala wejść, ale zabrania pokazywać stronę w wynikach. Adres zablokowany w robots.txt bywa nawet pokazywany jako goły link, bo wyszukiwarka nie weszła i nie zobaczyła noindex.

Zablokowałem boty AI. Czy to zaszkodzi pozycji w Google?

Nie. Google-Extended i GPTBot to roboty osobne od Googlebota, który indeksuje stronę do wyszukiwarki. Blokada tych pierwszych nie rusza Twojej widoczności w wynikach.

Czy robots.txt ukrywa prywatne strony?

Nie. To prośba, nie zamek, a sam plik jest jawny. Adres wpisany w Disallow bywa właśnie tam wypatrywany. Do zamknięcia treści służą logowanie i uprawnienia, nie robots.txt.

To był jeden obszar. Kondycja strony ma ich cztery.

To sprawdzenie to wycinek jednego z czterech obszarów kondycji strony. Bezpłatny przegląd w kreatorze łączy je w jedną ocenę 0–100 i pokazuje, co zabiera punkty i od czego zacząć.

  • Ocena wstępna 0–100 od razu po przeglądzie, z powodem przy każdym odjętym punkcie
  • Potem stała opieka: sprawdzenie co 5 minut w pakiecie bezpłatnym, alarm po potwierdzeniu kolejnym sprawdzeniem
  • Ostrzeżenie przed wygaśnięciem certyfikatu i domeny
  • Powiadomienia e-mail bez limitu
Sprawdź pełną kondycję strony

Jak pilnujemy tego na co dzień: Przegląd treści ›