Qu'est-ce que le contenu en double

À la fin de cette leçon, vous comprendrez ce qu'est le contenu dupliqué et pourquoi Google le déteste, comment il nuit à votre référencement, les différents types de contenu dupliqué sur les sites web, des moyens simples de le repérer sur votre site et des méthodes éprouvées pour corriger et prévenir les problèmes de contenu dupliqué.

Qu’est-ce que le contenu dupliqué ?

On parle de contenu dupliqué lorsque le même contenu apparaît à plusieurs endroits sur Internet, que ce soit sur votre propre site web ou sur différents sites.

Explication simple

Imaginez que vous rédigez un article de blog et le publiez sur votre site web. Ensuite, vous copiez exactement le même article et le publiez sur trois autres pages de votre site. Il s'agit de contenu dupliqué.

Imaginez aussi que quelqu'un copie votre article de blog et le publie sur son site web sans autorisation. Il s'agit également de contenu dupliqué.

Pourquoi c'est un problème

Pour Google: Google souhaite proposer aux utilisateurs le contenu le plus pertinent et original. Lorsqu'un même contenu est présent à plusieurs endroits, Google doit choisir quelle version afficher. Cela représente une perte de temps et de ressources pour Google.

Pour votre site : Lorsque Google détecte du contenu dupliqué, il en sélectionne une version à référencer et ignore les autres. Vous risquez donc de perdre des positions dans les résultats de recherche si Google privilégie la copie d'un concurrent à votre contenu original.

Pour les utilisateurs: Personne n'apprécie de voir le même article répété cinq fois dans les résultats de recherche. Le contenu dupliqué nuit à l'expérience utilisateur.

Types de contenu dupliqué

Le contenu dupliqué se présente sous différentes formes. Comprendre chaque type vous aide à corriger les problèmes adéquats.

Contenu dupliqué interne

Il s'agit de contenu dupliqué sur votre propre site web.

Même contenu sur plusieurs URL

Exemple : Votre produit apparaît sur plusieurs pages avec des URL différentes :

yoursite.com/products/blue-shirt
yoursite.com/shop/clothing/blue-shirt
yoursite.com/mens/shirts/blue-shirt

Les trois pages présentent exactement la même description et le même contenu du produit.

Pourquoi cela se produit:

  • Médiocre structuration du site
  • Plusieurs façons d'accéder à la même page
  • Options de filtrage et de tri pour la création de nouvelles URL
  • Versions imprimables
  • URL avec www vs URL sans www

Impact: Google détecte trois pages en concurrence pour le même mot-clé. Il en choisit une et ignore les autres. La visibilité de votre contenu s'en trouve donc divisée.

Contenu standard

Qu'est-ce que c'est: Texte répété qui apparaît sur de nombreuses pages de votre site.

Exemples :

  • La même description de produit a été utilisée pour 50 produits similaires.
  • Mentions légales sur chaque page
  • Mentions légales standard sur chaque article
  • Texte du modèle répété partout

Pourquoi c'est un problème : Si 80 % du contenu de vos pages est identique d'une page à l'autre, Google les considère comme des doublons même si les 20 % restants diffèrent.

Solution: Rendez chaque page unique avec un contenu principal différent, même si des éléments standardisés sont conservés.

Identifiants de session dans les URL

Exemple :

yoursite.com/product?sessionid=12345
yoursite.com/product?sessionid=67890
yoursite.com/product?sessionid=24680

Même page, mais identifiants de session différents créent des URL différentes.

Pourquoi cela se produit: Certains sites web ajoutent des paramètres de suivi ou des codes de session aux URL.

Impact: Google voit des dizaines, voire des centaines d'URL pour une même page.

Navigation à facettes

Courant dans le commerce électronique :

yoursite.com/shoes
yoursite.com/shoes?color=red
yoursite.com/shoes?size=10
yoursite.com/shoes?color=red&size=10

Chaque combinaison de filtres crée une nouvelle URL au contenu similaire.

Le problème: Des centaines de combinaisons de filtres créent des milliers de pages quasi identiques.

Contenu dupliqué externe

Il s'agit de contenu dupliqué entre votre site web et d'autres sites web.

Contenu récupéré

Qu'est-ce que c'est: Quelqu'un copie votre contenu et le publie sur son site sans autorisation.

Comment ça se passe :

  • Les robots de vol de contenu copient automatiquement les articles
  • Les concurrents volent les descriptions de produits
  • Les fermes de contenu republient votre travail
  • Outils de récupération automatisés

Impact: Si le site du voleur bénéficie d'une meilleure autorité, sa copie volée risque d'être mieux référencée que votre site original. Vous perdez ainsi du trafic au profit des voleurs de contenu.

Contenu syndiqué

Qu'est-ce que c'est: Vous publiez intentionnellement votre contenu sur plusieurs sites.

Exemples :

  • Publier votre article sur Medium et votre blog
  • Publication d'un même article en tant qu'invité sur 5 sites différents
  • Communiqués de presse diffusés aux sites d'information
  • Descriptions des produits fournies par les fabricants

Est-ce toujours mauvais ? Pas nécessairement, si cela est fait correctement avec une attribution appropriée et des balises canoniques.

Descriptions de produits copiées

Problème commun: Boutiques en ligne utilisant les descriptions de produits standard des fabricants.

Exemple : 1 000 sites web vendant le même iPhone utilisent tous la description officielle d’Apple mot pour mot.

Résultat: Votre page produit est identique à 999 pages concurrentes. Google en choisit une pour le référencement, probablement pas la vôtre.

Licences et partenariats

Qu'est-ce que c'est: Vous êtes autorisé à republier du contenu provenant de partenaires ou de sources sous licence.

Exemple :

  • Les agrégateurs de nouvelles republient des articles
  • Sites Web de franchises partageant du contenu d'entreprise
  • Sites affiliés utilisant le contenu fourni

Défi : Même avec l'autorisation, Google le considère toujours comme du contenu dupliqué.

Comment le contenu dupliqué nuit au référencement naturel

Le contenu dupliqué engendre plusieurs problèmes de référencement (SEO).

Autorité de page diluée

Le problème: Lorsque plusieurs pages ont le même contenu, les liens retour sont répartis sur toutes les versions.

Exemple : Vous avez un contenu identique sur trois URL. Quelqu'un fait un lien vers la version A, quelqu'un d'autre vers la version B et un autre encore vers la version C.

Au lieu d'une page de qualité avec trois liens retour, vous avez trois pages de faible qualité avec un seul lien retour chacune.

Résultat: Aucune de vos pages n'est aussi bien référencée qu'elle le pourrait si tous les liens pointaient vers une seule version.

Google déroutant

Le problème de décision : Google doit choisir quelle version afficher dans les résultats de recherche.

Questions auxquelles Google est confronté :

  • Quelle est la version originale ?
  • Quelle version devrait être classée ?
  • Faut-il indexer toutes les versions ou seulement une ?
  • Quelle version correspond le mieux à la requête de recherche ?

Ton problème: Google pourrait choisir la mauvaise version, ou pire, aucune.

Budget de crawl gaspillé

Qu'est-ce qu'un budget de crawl ? Google n'explore pas toutes les pages de votre site chaque jour. Les sites importants disposent d'un « budget d'exploration » limité : le nombre de pages que Google explorera dans un laps de temps donné.

Les déchets : Si Google passe du temps à explorer 100 pages dupliquées, il risque de passer à côté de 100 pages uniques et précieuses.

Impact: Votre contenu nouveau ou mis à jour met plus de temps à être indexé et classé.

Pénalités (rares mais possibles)

Action manuelle : Si Google estime que vous créez délibérément du contenu dupliqué pour manipuler les classements, vous pourriez recevoir une pénalité manuelle.

Quand cela se produit :

  • Récupération intentionnelle du contenu d'autres sites
  • Création de centaines de pages d'entrée avec le même contenu
  • Réécriture automatique du contenu de mauvaise qualité

Important: La plupart des problèmes de contenu dupliqué n'entraînent pas de pénalités. Google choisit simplement de ne pas référencer les pages dupliquées.

Comment trouver du contenu en double

Utilisez ces méthodes pour détecter le contenu dupliqué sur votre site.

Méthode 1 : recherche Google

Consultez votre propre site :

Opérateur de recherche :

site:yoursite.com "exact phrase from your content"

Exemple :

site:yoursite.com "this unique sentence appears in my article"

Résultats: Si plusieurs pages de votre site apparaissent, vous avez des doublons internes.

Vérifier les copies externes :

Recherche d'expressions uniques :

"exact sentence from your article"

Supprimer le site : l’opérateur effectue une recherche sur l’ensemble d’Internet.

Résultats: Si d'autres sites web apparaissent, il est possible qu'ils aient copié votre contenu.

Méthode 2 : Copyscape (gratuit et payant)

Version gratuite:

  1. Rendez-vous sur copyscape.com
  2. Saisissez l'URL de votre page
  3. Cliquez sur « Go »
  4. Vérifiez si des copies existent en ligne.

Limites : La version gratuite ne vérifie qu'une page à la fois.

Version Premium (5 $/mois) :

  1. Abonnez-vous à Copyscape Premium
  2. Vérification par lots de plusieurs URL
  3. Obtenez des rapports détaillés
  4. Configurer les alertes de surveillance

Idéal pour : Trouver du contenu dupliqué externe (d'autres personnes vous copient).

Méthode 3 : Google Search Console

Vérifier la présence de contenu dupliqué :

  1. Connectez-vous à Search Console
  2. Consultez le rapport « Couverture ».
  3. Recherchez les avertissements « Doublon ».
  4. Cliquez pour voir les pages concernées

Qu'est-ce qu'il montre:

  • Pages que Google considère comme des doublons
  • Quelles pages sont exclues de l'indexation ?
  • Problèmes de balises canoniques

Vérifiez le classement des pages :

  1. Consultez le rapport « Performances ».
  2. Cliquez sur l'onglet « Pages ».
  3. Recherchez les URL similaires qui se positionnent sur les mêmes mots-clés.

Drapeaux rouges: Plusieurs URL de votre site se disputent les mêmes termes de recherche.

Méthode 4 : Screaming Frog SEO Spider

Mode d'emploi :

  1. Téléchargez Screaming Frog (gratuit jusqu'à 500 URL)
  2. Entrez l'URL de votre site Web
  3. Cliquez sur "Démarrer"
  4. Allez dans l'onglet « Contenu ».
  5. Cliquez sur la section « Dupliquer ».

Ce qu'il constate :

  • Titres en double
  • Descriptions en double
  • Contenu de page dupliqué
  • Balises H1 en double

Avantages:

  • Analyse l'intégralité de votre site en une seule fois.
  • Identifie les modèles
  • Exporter les données pour analyse

Méthode 5 : Siteliner

Outil en ligne facile à utiliser :

  1. Rendez-vous sur siteliner.com
  2. Entrez l'URL de votre site Web
  3. Veuillez patienter pendant la numérisation (quelques minutes).
  4. Examiner les résultats

Qu'est-ce qu'il montre:

  • Pourcentage de contenu dupliqué
  • Pages dupliquées internes
  • Contenu commun à plusieurs pages
  • Pages exactes contenant des doublons

Idéal pour : Aperçu rapide des problèmes de doublons internes.

Méthode 6 : Examen manuel

Vérifiez les zones problématiques courantes :

Pages produits:

  • Ouvrir 5 à 10 produits similaires
  • Comparer les descriptions
  • Recherchez un texte identique

Articles de blog:

  • Consultez les articles plus anciens
  • Vérifiez si vous avez réécrit les mêmes sujets.
  • Recherchez les sections de copier-coller

Pages de catégorie :

  • Consultez les catégories similaires
  • Recherchez les descriptions répétées
  • Combinaisons de filtres de consultation

Comment corriger le contenu dupliqué

Choisissez la solution adaptée à votre type de contenu dupliqué.

Solution 1 : Utiliser les balises canoniques (la meilleure dans la plupart des cas)

Ce qu'il fait: Indique à Google quelle version des pages dupliquées est la version « principale ».

Quand utiliser:

  • Même produit sur plusieurs pages de catégories
  • Versions imprimables
  • Pages similaires qui doivent exister

Comment mettre en œuvre :

Ajoutez ce code au <head> section des pages en double :

html
<link rel="canonical" href="https://yoursite.com/original-page" />

Exemple :

Vous avez trois URL affichant la même chemise bleue :

yoursite.com/products/blue-shirt (original)
yoursite.com/mens/blue-shirt (duplicate)
yoursite.com/clothing/shirts/blue-shirt (duplicate)

Sur les deux pages identiques, ajoutez :

html
<link rel="canonical" href="https://yoursite.com/products/blue-shirt" />

Sur la page originale, ajoutez une référence canonique autoréférentielle :

html
<link rel="canonical" href="https://yoursite.com/products/blue-shirt" />

Important:

  • Utilisez des URL absolues (incluez https://).
  • Indiquez la version que vous souhaitez classer.
  • À utiliser sur chaque page en double

Solution 2 : Redirections 301 (pour les pages dont vous n’avez pas besoin)

Ce qu'il fait: Redirige définitivement une URL vers une autre. Les utilisateurs et les moteurs de recherche ne voient que la page principale.

Quand utiliser:

  • Pages en double dont vous n'avez plus besoin
  • Les anciennes URL ont été remplacées par de nouvelles.
  • Plusieurs versions sans raison de conserver les deux

Comment mettre en œuvre :

Pour les serveurs Apache (fichier .htaccess) :

apache
Redirect 301 /old-page https://yoursite.com/new-page

Redirections multiples :

apache
Redirect 301 /products/old-shirt https://yoursite.com/products/blue-shirt
Redirect 301 /shop/old-shirt https://yoursite.com/products/blue-shirt

Pour WordPress : Utilisez un plugin comme :

  • Redirection (gratuite)
  • Yoast SEO (incluant un gestionnaire de redirections)
  • Rank Math (incluant une fonction de redirection)

Avantages:

  • Consolide l'autorité des liens
  • Réduit les déchets de la fosse septique
  • Structure du site plus propre

Solution 3 : Balise noindex (pour les pages dont les utilisateurs ont besoin)

Ce qu'il fait: Conserve la page sur votre site, mais indique à Google de ne pas l'indexer.

Quand utiliser:

  • Merci pages
  • Résultats de la recherche interne
  • Combinaisons de filtres dont les utilisateurs ont besoin mais qu'ils ne devraient pas classer
  • Pages de connexion/compte

Comment mettre en œuvre :

ajouter <head> section:

html
<meta name="robots" content="noindex, follow" />

Ce que cela veut dire:

  • noindex : Ne pas inclure dans les résultats de recherche
  • Suivre : Suivez toujours les liens sur cette page

Exemples de cas d'utilisation :

html
<!-- On search results page -->
<meta name="robots" content="noindex, follow" />

<!-- On thank you page -->
<meta name="robots" content="noindex, follow" />

<!-- On filtered pages -->
<meta name="robots" content="noindex, follow" />

Important: N'utilisez pas l'option noindex avec l'option canonical. Choisissez une seule solution.

Solution 4 : Gestion des paramètres dans la Search Console

Pour les URL dynamiques avec paramètres :

Exemple de problème :

yoursite.com/products?sort=price
yoursite.com/products?sort=name
yoursite.com/products?sort=rating

Solution:

  1. Accédez à la Search Console de Google
  2. Cliquez sur « Outils et rapports hérités »
  3. Accédez à « Paramètres d’URL »
  4. Cliquez sur « Ajouter un paramètre »
  5. Saisissez le nom du paramètre (par exemple, « trier »)
  6. Dites à Google comment gérer cela :
    • « N'affecte pas le contenu de la page » (recommandé pour le tri)
    • « Paginations »
    • « Réduit le contenu »

Avantages : Google comprend quels paramètres créent des doublons et les gère correctement.

Solution 5 : Consolider et réécrire

Pour les pages réellement dupliquées :

Le problème: Vous avez écrit trois articles similaires sur le même sujet.

Exemple :

  • « 10 conseils SEO pour débutants »
  • « Meilleurs conseils SEO pour les nouveaux sites web »
  • « Conseils SEO pour débutants »

Tous couvrent les mêmes informations.

Solution:

  1. Choisissez l'article le plus performant
  2. Combinez les informations uniques provenant d'autres personnes
  3. Créez un article complet
  4. Supprimez ou redirigez les autres.

Avantages:

  • Une page solide au lieu de trois pages faibles
  • Meilleure expérience utilisateur
  • Google est clairement gagnant pour le classement.

Solution 6 : Bloquer les paramètres d’URL dans le fichier robots.txt

Pour les paramètres que vous ne souhaitez jamais indexer :

Exemple :

# Block session IDs
Disallow: /*?sessionid=*

# Block certain filters
Disallow: /*?color=*

# Block sorting parameters
Disallow: /*?sort=*

Quand utiliser:

  • Paramètres de suivi de session
  • Combinaisons de filtres inutiles
  • Versions imprimées

Prudence : Cela empêche complètement le reptation. À utiliser avec parcimonie.

Solution 7 : Ajouter du contenu unique

Pour les pages produits contenant des descriptions du fabricant :

Le problème: Votre page produit est identique à celle de 500 sites concurrents.

Solution:

Ajoutez des éléments uniques :

  • Votre propre avis sur le produit (plus de 200 mots)
  • Retour de nos clients
  • Conseils d'utilisation
  • Comparaison avec des produits similaires
  • Vos photos et vidéos
  • section FAQ
  • Guides des tailles

Exemple de structure :

[Manufacturer description] (20% of content)
Your review and tips (40% of content)
Customer reviews (20% of content)
FAQ (20% of content)

Résultat: Votre page est désormais unique à 80 %, ce qui est suffisant pour vous différencier de vos concurrents.

Solution 8 : Supprimer le contenu récupéré

Si d'autres personnes ont copié votre contenu :

Étape 1 : Documenter le vol

  • Capture d'écran de leur page
  • Notez les dates de publication (la vôtre est antérieure).
  • Sauvegardez les URL et les preuves

Étape 2 : Contacter le propriétaire du site web

  • Trouver les coordonnées
  • Envoyez un courriel poli demandant la suppression
  • Fournissez la preuve que vous êtes l'auteur original

Étape 3 : Déposer une plainte DMCA S'ils ne répondent pas :

  • Soumettez une demande de retrait DMCA à leur fournisseur d'hébergement
  • Déposer une plainte DMCA auprès de Google
  • Rapport à Google Search Console

Étape 4 : Utiliser l’outil de Google

  1. Rendez-vous sur google.com/webmasters/tools/dmca-notice
  2. Remplissez le formulaire de déclaration d'infraction au droit d'auteur
  3. Fournissez les URL du contenu original et du contenu copié
  4. Soumettre

Google va : Examinez votre réclamation et supprimez éventuellement le contenu copié des résultats de recherche.

Prévenir le contenu dupliqué

Prévenez les problèmes de contenu dupliqué avant même qu'ils ne surviennent.

Stratégie de prévention 1 : Planifier la structure du site

Avant de créer votre site :

Créer une structure d'URL : Déterminez un modèle d'URL canonique pour chaque type de contenu.

Exemple pour les produits : ✓ Bon : votresite.com/produits/[nom-du-produit] ✗ À éviter : Plusieurs chemins vers un même produit

Architecture du site :

  • Hiérarchie de catégories claire
  • Aucune catégorie ne se chevauche
  • Chaque produit appartient à une catégorie principale

Avantages : Empêche l'utilisation de plusieurs URL dès le départ.

Stratégie de prévention 2 : Définir un domaine préféré

Choisissez avec ou sans www :

Dans Search Console :

  1. Aller aux paramètres
  2. Recherchez les paramètres du domaine
  3. Définir le domaine préféré

Dans le fichier .htaccess :

apache
# Redirect non-www to www
RewriteEngine On
RewriteCond %{HTTP_HOST} ^yoursite\.com [NC]
RewriteRule ^(.*)$ https://www.yoursite.com/$1 [L,R=301]

Avantages : Tous les liens pointent vers une seule version, évitant ainsi les contenus dupliqués.

Stratégie de prévention 3 : Rédiger des descriptions de produits originales

Ne copiez pas les descriptions du fabricant :

Écrivez plutôt :

  • Votre avis sur le produit
  • Des avantages uniques que vous avez remarqués
  • Comment cela résout des problèmes spécifiques
  • Comparaison avec des alternatives
  • Scénarios d'utilisation réels

Astuce pour gagner du temps : Créez un modèle, mais personnalisez-le pour chaque produit :

  • Caractéristiques (peuvent être similaires)
  • Votre avis (doit être unique)
  • Cas d'utilisation (varient selon le produit)

Stratégie de prévention 4 : Utiliser Rel="prev" et Rel="next" pour la pagination

Pour le contenu paginé :

À la page 1 :

html
<link rel="next" href="https://yoursite.com/blog?page=2" />

À la page 2 :

html
<link rel="prev" href="https://yoursite.com/blog" />
<link rel="next" href="https://yoursite.com/blog?page=3" />

En dernière page 3 :

html
<link rel="prev" href="https://yoursite.com/blog?page=9" />

Ce qu'il fait: Indique à Google que ces pages font partie d'une série et ne sont pas des doublons.

À noter: Google a abandonné cette fonctionnalité en 2019, mais la considère toujours comme un signal.

Stratégie de prévention 5 : Lignes directrices sur la syndication

Si vous republiez du contenu ailleurs :

Étape 1 : Attendez avant de syndiquer Publiez d'abord sur votre site, puis attendez 1 à 2 semaines que Google indexe l'information.

Étape 2 : Ajouter la balise canonique à la version syndiquée Demandez à l'éditeur d'ajouter :

html
<link rel="canonical" href="https://yoursite.com/original-article" />

Étape 3 : Ajouter la mention de l’auteur Incluez une signature avec un lien vers votre site.

Étape 4 : Évitez les copies conformes. Modifiez l'introduction ou ajoutez des éléments uniques.

Stratégie de prévention 6 : Versions pour imprimantes à blocs

Si vous avez des pages adaptées à l'impression :

Option 1 : Les désindexer

html
<meta name="robots" content="noindex, follow" />

Option 2 : Utiliser des balises canoniques Les versions imprimées sont renvoyées à la page principale.

Option 3 : Utiliser CSS pour l’impression Utilisez les styles d'impression CSS au lieu de pages séparées :

html
<link rel="stylesheet" href="print.css" media="print" />

Aucune URL séparée n'est nécessaire.

Stratégie de prévention 7 : Surveillance régulière

Configurer des alertes :

Alertes Google :

  1. Rendez-vous sur google.com/alerts
  2. Saisissez des phrases uniques extraites de votre contenu
  3. Réglez la fréquence sur « au fur et à mesure ».
  4. Recevez un courriel lorsque du contenu est mis en ligne.

Copyscape Premium :

  • Surveillance automatique
  • Rapports hebdomadaires
  • Alertes pour les nouveaux exemplaires

Vérifiez mensuellement :

  • Search Console pour les problèmes en double
  • Numérisation Siteliner
  • Examen manuel des nouvelles pages

Le contenu dupliqué est-il pénalisé par Google ?

Non, le contenu dupliqué n'est généralement pas pénalisé. Google choisit simplement une version à référencer et ignore les autres. Vous ne serez pas pénalisé sauf si vous manipulez délibérément le classement avec du contenu copié ou si vous créez des centaines de pages redirigeantes.

Le fait d'avoir la même barre latérale sur chaque page est-il considéré comme un doublon ?

Non. Google comprend que les modèles de sites web incluent des éléments répétés comme les en-têtes, les pieds de page, les barres latérales et la navigation. Ce qui compte, c'est que votre zone de contenu principale soit unique sur chaque page.

Google Search Console peut-elle afficher tous les problèmes de contenu dupliqué ?

Search Console affiche les doublons détectés par Google, mais pas tous. Elle se concentre sur les problèmes affectant l'indexation. Pour un audit interne complet, utilisez Screaming Frog ou Siteliner. Combinez plusieurs outils pour des résultats optimaux.

fusée

Automatisez votre référencement

Vous êtes à 1 clic d'augmenter votre trafic organique !

Commencez à optimiser maintenant !

Académie SEO

  1. AMP