Aby zablokować indeksowanie strony w Google, najczęściej należy zastosować dyrektywę noindex. Można dodać ją jako meta tag w kodzie HTML albo wysłać w nagłówku HTTP X-Robots-Tag. Jeśli strona jest już w Google, robot musi mieć możliwość ponownego odwiedzenia adresu i odczytania noindex. Samo zablokowanie adresu w robots.txt nie jest właściwym sposobem na usunięcie go z indeksu.
Kiedy warto zablokować indeksowanie strony?
Nie każda podstrona serwisu powinna pojawiać się w wynikach wyszukiwania. Indeksowanie warto ograniczyć przede wszystkim tam, gdzie dany adres nie przedstawia wartości dla osoby korzystającej z Google.
W zależności od konstrukcji serwisu mogą to być na przykład:
- strony techniczne,
- niektóre wyniki wewnętrznego wyszukiwania,
- strony przeznaczone wyłącznie dla określonych użytkowników,
- wybrane strony z bardzo podobną zawartością,
- podstrony tworzone na potrzeby kampanii, które nie mają zdobywać ruchu organicznego.
Nie należy jednak automatycznie blokować wszystkich filtrów, tagów czy stron paginacji. Decyzja powinna wynikać ze struktury konkretnego serwisu i strategii SEO.
Jak zablokować indeksowanie za pomocą noindex?
Najpopularniejszym rozwiązaniem jest meta tag robots z dyrektywą noindex.
W sekcji <head> strony dodaj:
<meta name="robots" content="noindex">
Jeśli dodatkowo chcesz pozostawić robotom możliwość śledzenia linków znajdujących się na stronie, możesz spotkać zapis:
<meta name="robots" content="noindex, follow">
Najważniejszym elementem z punktu widzenia indeksacji jest tutaj noindex.
Po ponownym odwiedzeniu strony Google może odczytać tę informację i usunąć adres z wyników wyszukiwania.
Jak ustawić noindex w WordPressie?
Jeżeli korzystasz z WordPressa, nie musisz ręcznie modyfikować kodu HTML. Wiele popularnych wtyczek SEO umożliwia zmianę ustawień indeksowania konkretnego wpisu lub strony.
Taką funkcję oferują między innymi:
- Yoast SEO,
- Rank Math,
- All in One SEO,
- SEOPress.
Otwórz edycję podstrony i znajdź ustawienia zaawansowane lub sekcję dotyczącą widoczności dla wyszukiwarek. Ustaw opcję odpowiadającą za niedopuszczenie strony do indeksowania i zapisz zmiany.
Nazwy oraz położenie ustawień mogą różnić się między wersjami wtyczek.
Po zmianie wyświetl kod źródłowy strony i wyszukaj noindex. Dzięki temu upewnisz się, że CMS rzeczywiście wygenerował odpowiednią dyrektywę.
Jak zablokować indeksowanie pliku PDF?
Meta tag działa w dokumentach HTML. W przypadku zasobów innych niż HTML, na przykład plików PDF, można zastosować nagłówek HTTP:
X-Robots-Tag: noindex
Konfigurację wykonuje się po stronie serwera. Dokładny sposób zależy od hostingu i używanego oprogramowania serwerowego.
X-Robots-Tag może być również używany dla stron HTML, ale w typowym CMS-ie prostsze będzie zastosowanie ustawień SEO generujących meta robots.
Dlaczego robots.txt nie wystarczy?
To jeden z najczęstszych błędów technicznego SEO.
W pliku robots.txt można umieścić regułę blokującą robotowi możliwość crawlowania określonego adresu lub katalogu. Nie jest to jednak równoznaczne z poleceniem usunięcia strony z indeksu.
Jeżeli URL jest już znany Google, samo zablokowanie crawlowania nie daje gwarancji zniknięcia adresu z wyników.
Co więcej, jeśli jednocześnie ustawisz noindex i zabronisz Googlebotowi odwiedzania strony przez robots.txt, robot może nie mieć możliwości zobaczenia dyrektywy noindex.
Jeżeli zależy Ci na deindeksacji istniejącego adresu, pozwól Google odwiedzić stronę i odczytać noindex.
Co zrobić, jeśli strona jest już w Google?
Najpierw ustaw noindex i sprawdź, czy Googlebot może otworzyć stronę.
Następnie przejdź do Google Search Console, wklej URL w narzędziu kontroli adresu i sprawdź jego aktualny stan.
Jeśli potrzebujesz szybko ukryć wynik, Search Console oferuje również narzędzie Usunięcia. Służy ono do tymczasowego ukrywania adresów w wynikach Google. Nie powinno zastępować trwałego rozwiązania po stronie witryny.
Długoterminowo Google musi otrzymać odpowiedni sygnał, na przykład noindex, albo zobaczyć, że strona została rzeczywiście usunięta.
Noindex czy usunięcie strony?
Jeśli podstrona ma nadal działać dla użytkowników, ale nie powinna pojawiać się w Google, noindex jest typowym rozwiązaniem.
Jeżeli treść została usunięta na stałe i nie ma odpowiedniego zamiennika, adres może zwracać kod 404 lub 410.
Jeśli natomiast treść została przeniesiona pod nowy, właściwy adres, zazwyczaj należy rozważyć przekierowanie 301, zamiast stosować noindex.
Wybór rozwiązania zależy więc od tego, co faktycznie stało się z zawartością.
Czy blokować stronę, do której prowadzą linki zewnętrzne?
Przed ustawieniem noindex warto sprawdzić, czy do adresu prowadzą wartościowe linki zewnętrzne. Jeśli strona ma zostać całkowicie usunięta, a istnieje jej odpowiedni tematycznie zamiennik, sensowniejsze może być przekierowanie 301.
Przy ocenie linków patrz przede wszystkim na kontekst. Nie cały serwis linkujący musi być poświęcony Twojej branży. Ważne, żeby konkretna publikacja, z której prowadzi link, była tematycznie powiązana z podstroną docelową.
Nie blokuj więc indeksowania mechanicznie. Najpierw ustal, czy adres powinien pozostać dostępny, zostać usunięty czy przekierowany. Jeśli ma działać, ale nie pojawiać się w Google, prawidłowo wdrożony noindex będzie najczęściej właściwym rozwiązaniem.