Thin content i duplicate content - czego unikać w SEO

Thin content i duplicate content - czego unikać w SEO

Ten artykuł rozwija temat z: Google Panda - algorytm jakości treści w SEO

Thin content (uboga treść) i duplicate content (powielona treść) to dwa z najpoważniejszych problemów technicznego SEO, które mogą drastycznie obniżyć widoczność witryny w wynikach wyszukiwania. Chociaż ich nazwy brzmią różnie, łączy je wspólny mianownik: niska wartość dla użytkownika. Zrozumienie, czym są, jak ich unikać i jak je naprawić, jest kluczowe dla utrzymania zdrowej i konkurencyjnej strony internetowej.

Więcej o tym przeczytasz w: Czym był algorytm Google Panda i co zmienił w SEO

Wprowadzenie - dlaczego to poważny problem SEO

Algorytmy Google od lat ewoluują w kierunku promowania treści, które są unikalne, wartościowe i odpowiadają na potrzeby użytkowników. Historyczna aktualizacja Panda była pierwszym dużym krokiem w walce z witrynami o niskiej jakości. Nowszym i kluczowym elementem jest Helpful Content System, wprowadzony w sierpniu 2022 roku, który obecnie stanowi integralną część głównego algorytmu Google. Jego celem jest nagradzanie stron stworzonych dla ludzi, a nie dla wyszukiwarek.

Zarówno thin content, jak i duplicate content są sygnałami dla Google, że witryna może nie dostarczać wartości. To prowadzi do obniżenia jej autorytetu, marnowania budżetu indeksowania (crawl budget) i w konsekwencji do spadków w rankingu.

Warto przy tym rozwiać popularny mit: Google oficjalnie nie stosuje bezpośredniej „kary za duplicate content”. Zamiast tego, algorytmy starają się zidentyfikować oryginalną wersję (kanoniczną) i to ją wyświetlić w wynikach, filtrując pozostałe duplikaty. Problem polega na tym, że jeśli nie wskażemy jasno, która wersja jest właściwa, Google może wybrać ją za nas - i nie zawsze będzie to ta, na której nam zależy.

Więcej o tym przeczytasz w: Jak tworzyć treści wysokiej jakości dla Google? Przewodnik

Thin Content (uboga treść) - czego unikać

Thin content to nie kwestia liczby słów - to każda podstrona, która nie wnosi realnej wartości dla użytkownika, niezależnie od jej długości. Może to być strona z jednym zdaniem, ale też strona z tysiącem słów skopiowanych z innego źródła lub wygenerowanych automatycznie bez żadnej edycji.

Automatycznie generowana treść (scaled content abuse)

Masowe publikowanie tekstów generowanych przez AI bez redakcji i wiedzy eksperckiej Google klasyfikuje jako scaled content abuse (nadużycie treści na dużą skalę). Zgodnie z zasadami Google dotyczącymi spamu, jest to tworzenie wielu stron z treścią, która nie wnosi oryginalnej wartości, a jej głównym celem jest manipulowanie rankingami.

Strony przejściowe (doorway pages)

To podstrony zoptymalizowane pod bardzo konkretne, często lokalne frazy, które mają niemal identyczną treść i służą jedynie jako „przejście” do właściwej części serwisu. Tworzenie dziesiątek niemal identycznych stron różniących się tylko nazwą miasta (np. „naprawa pralek Warszawa”, „naprawa pralek Piaseczno”) to klasyczne doorway pages, które Google zwalcza.

Słabe strony afiliacyjne

Strony afiliacyjne stają się thin content, gdy nie oferują żadnej wartości dodanej ponad to, co można znaleźć w sklepie producenta. Strona afiliacyjna z samymi opisami producenta i linkami, bez własnego testu, autorskiej recenzji, zdjęć czy rzetelnego porównania, jest oceniana jako thin affiliate.

Scraped content i synonimizacja

Scraped content to treść skopiowana (zeskrobana) z innych stron internetowych bez dodania oryginalnej wartości. Synonimizacja to z kolei próba jej „zamaskowania” poprzez automatyczną zamianę słów na synonimy za pomocą tzw. mieszarek tekstu. Obie techniki tworzą bezwartościowe, często nielogiczne treści, które są łatwo identyfikowane przez algorytmy.

Puste tagi, kategorie i archiwa

W systemach CMS (jak WordPress) łatwo jest stworzyć setki podstron, które nie niosą żadnej wartości. Setki stron tagów przypisanych do pojedynczego artykułu lub puste strony kategorii tworzą bezwartościowe adresy URL, które rozmywają jakość witryny i marnują budżet na indeksowanie.

Jak naprawić thin content

Istnieją trzy główne strategie radzenia sobie z ubogą treścią:

  1. Rozbuduj (Expand): Jeśli strona ma potencjał, ale brakuje jej treści, należy ją rozbudować. Dodaj unikalne analizy, dane, grafiki, opinie ekspertów - wszystko, co uczyni ją wyczerpującą i wartościową dla użytkownika.
  2. Połącz (Merge): Jeśli masz kilka słabych podstron na podobny temat, połącz je w jeden, kompleksowy materiał (tzw. pillar page). Następnie ustaw przekierowania 301 z usuniętych adresów URL na nowy, zbiorczy artykuł.
  3. Usuń/Zablokuj (Delete/Noindex): Strony, które nie mają żadnej wartości i nie da się ich poprawić (np. puste strony tagów), należy usunąć (ustawiając kod odpowiedzi 404 lub 410) lub wykluczyć z indeksowania za pomocą meta tagu noindex.

Do masowej analizy witryny pod kątem pustych lub ubogich stron świetnie nadają się narzędzia takie jak Screaming Frog, a raporty w Google Search Console pomogą zidentyfikować strony z problemami z indeksowaniem.

Duplicate Content (powielona treść) - czego unikać

Duplicate content to treść, która w całości lub w znacznej części jest identyczna z treścią dostępną pod innym adresem URL. Duplicate content dzielimy na wewnętrzny (ta sama treść pod wieloma URL w jednej domenie) i zewnętrzny (ta sama treść na różnych domenach).

Duplikacja wewnętrzna

To najczęstszy rodzaj duplikacji, często generowany nieświadomie przez systemy CMS i strukturę witryny.

  • Warianty produktu: Ten sam produkt w pięciu kolorach na pięciu osobnych podstronach z identycznym opisem to wewnętrzny duplicate content.
  • Problemy kanoniczności: Dostępność strony pod wieloma wersjami adresu to klasyczny problem techniczny. Przykłady to:
    • Wersja z http:// i https://
    • Wersja z www. i bez www. (np. www.domena.pl i domena.pl)
    • Wersja z index.html na końcu i bez (np. domena.pl/strona/ i domena.pl/strona/index.html)
  • Parametry filtrowania i sortowania: Adresy URL generowane przez filtry, sortowanie czy wyszukiwarkę wewnętrzną tworzą dziesiątki duplikatów. Dla Google domena.pl/kategoria i domena.pl/kategoria?color=red&sort=price to dwa osobne adresy z niemal tą samą treścią.
  • Wersje do druku i PDF: Generowanie osobnej, zoptymalizowanej do druku wersji strony (?print=true) lub udostępnianie treści w pliku PDF bez odpowiednich oznaczeń tworzy duplikaty.

Duplikacja zewnętrzna

Występuje, gdy Twoja treść pojawia się na innych, niezależnych domenach.

  • Opisy produktów od producenta: Wklejanie opisów z bazy producenta oznacza, że setki, a nawet tysiące sklepów mają identyczny tekst - Twój nigdy nie wyprzedzi konkurencji.
  • Syndykacja treści: Przedrukowywanie Twoich artykułów na innych portalach (za Twoją zgodą) bez wskazania oryginału za pomocą tagu kanonicznego powoduje, że Google może uznać portal partnerski za źródło.
  • Plagiat: Świadome kopiowanie treści z Twojej strony przez inne witryny.

Jak naprawić duplicate content

Kluczem jest wskazanie Google, która wersja treści jest tą oryginalną i preferowaną. Służą do tego trzy główne narzędzia techniczne:

  1. Tag kanoniczny (rel="canonical"): To najważniejsze narzędzie. Umieszczając w sekcji <head> strony-duplikatu tag <link rel="canonical" href="https://www.twojadomena.pl/oryginalny-adres-url" />, informujesz Google, gdzie znajduje się oryginał, na który należy przenieść całą „moc”.
  2. Przekierowanie 301: Służy do trwałego przekierowania jednego adresu URL na inny. Używa się go np. do ujednolicenia wersji domeny (z www na bez-www) lub po połączeniu kilku artykułów w jeden. Składnia w pliku .htaccess to: Redirect 301 /stary-adres/ /nowy-adres/.
  3. Meta tag noindex: Jeśli strona-duplikat nie powinna w ogóle znaleźć się w wynikach wyszukiwania (np. wyniki wewnętrznej wyszukiwarki, strony filtrowania), należy dodać do jej sekcji <head> tag: <meta name="robots" content="noindex">.

W przypadku e-commerce najlepszym rozwiązaniem jest tworzenie unikalnych opisów produktów lub, w przypadku wariantów, stosowanie jednego głównego adresu URL i dynamicznej zmiany zdjęć/cen bez przeładowywania strony. Do wykrywania duplikacji wewnętrznej można użyć narzędzia Siteliner, a do zewnętrznej - Copyscape.

Podsumowanie - złota zasada tworzenia treści

Zarówno thin content, jak i duplicate content sprowadzają się do jednego fundamentalnego pytania, które powinieneś sobie zadać przed publikacją każdej nowej podstrony: „Czy ta strona wnosi realną wartość dla użytkownika i czy różni się od tego, co już istnieje w Internecie?”

W dzisiejszym SEO strategia „less is more” jest skuteczniejsza niż kiedykolwiek wcześniej. Mniejsza liczba podstron o wysokiej unikalności, wartości merytorycznej i doskonałym doświadczeniu użytkownika bije na głowę tysiące słabych, powielonych lub automatycznie wygenerowanych adresów URL. Skupienie się na jakości, a nie ilości, to najlepsza droga do zbudowania silnej i stabilnej widoczności w Google.

Napisz do mnie

Chcesz takich efektów u siebie?