Aller au contenu

Contenu dupliqué sur les fiches produit : ce qui compte vraiment

<> Infos utiles

Publié :
06.10.2026
Temps de lecture :
18 min
Catégorie :
E-commerce

<> Bonne lecture

Ce qu'il faut retenir

  • Aucune pénalité pour contenu dupliqué : la documentation Google sur la canonicalisation n’en mentionne aucune, John Mueller l’a démenti en 2017, en 2020 et en 2024, et le « seuil toléré de 20 à 30 % » n’existe nulle part.
  • Ce que Google fait à la place : il choisit l’URL à montrer, consolide les signaux dessus et évite de dépenser du crawl sur les doublons.
  • Quatre duplications, quatre correctifs : texte fournisseur, variantes internes, syndication marketplace, scraping. Deux vont en sens inverse, différencier d’un côté, consolider de l’autre.
  • Avec 8 000 fiches, la priorisation est tout le sujet : clics, impressions, marge et stade de vie décident. Une majorité du catalogue ne mérite aucune réécriture.
  • Les variantes se règlent avec ProductGroup : Google valide deux architectures et ne reconnaît que six propriétés dans variesBy.

Non, Google ne pénalise pas ton site parce que tes fiches produit reprennent la description du fournisseur. Il désigne une URL canonique parmi les pages qu’il juge équivalentes, consolide les signaux dessus, et arrête de dépenser du crawl sur les doublons. Le risque n’est pas une sanction, c’est de ne pas être l’URL retenue.

Reste le vrai problème : avec 8 000 fiches alimentées par un flux fournisseur, tu ne peux pas tout réécrire. C’est le chantier que je reprends le plus souvent en mission de consultant SEO e-commerce, et presque toujours parce qu’il a été attaqué dans le mauvais ordre. Cet article sépare les quatre duplications qu’on confond, donne la méthode de détection, et l’ordre dans lequel attaquer.

Il n’y a pas de pénalité pour contenu dupliqué

La documentation de Google sur la canonicalisation ne mentionne aucune pénalité. Elle la présente comme un outil d’optimisation, pas comme la correction d’une infraction. La nuance change tout le plan d’action : tu n’as rien à réparer, tu as un arbitrage à gagner.

John Mueller l’a démenti de façon répétée et documentée : un hangout en 2017, les SEO Office Hours en 2020, un message sur Mastodon en 2024. Sur les descriptions fournisseur en e-commerce, il va plus loin.

Le « seuil de tolérance de 20 à 30 % de similarité » qui circule depuis des années n’existe dans aucune source Google. Aucun pourcentage d’unicité n’est publié, ni à atteindre, ni à ne pas dépasser. Piloter une réécriture sur ce genre d’objectif, c’est piloter sur un chiffre inventé.

Une action manuelle reste possible, mais elle vise le contenu dupliqué trompeur ou manipulatoire : scraping massif, sites miroirs. Une description fournisseur recopiée de bonne foi n’entre pas dans ce cadre. L’absence de pénalité ne veut pas dire absence de conséquence.

Ce que Google fait : choisir une canonique

Google annonce trois objectifs à la canonicalisation : choisir l’URL à montrer, consolider les signaux (dont les liens) sur une seule URL, et éviter de dépenser du temps de crawl sur des pages dupliquées. Aucune sanction là-dedans. Mais tout y décide de quelle page capte ton trafic.

Comment Google choisit la canonique, et pourquoi pas toujours ta page

Sans indication de ta part, Google tranche seul : « Google will identify which version of the URL is objectively the best version to show to users in Search ». Le mot qui compte est objectively. Ni l’antériorité ni la propriété du texte n’entrent dans le critère.

Tu peux influencer ce choix, pas le dicter : le rel="canonical" est un signal, pas une directive. Google hiérarchise lui-même la force de ces signaux :

  • rel="canonical" : « a strong signal »
  • Une redirection : « a strong signal »
  • Une URL déclarée dans le sitemap : « a weak signal »

S’y ajoutent deux préférences documentées : HTTPS plutôt que HTTP, et les URL présentes dans les clusters hreflang. Tu peux donc poser une canonique impeccable et voir Google en retenir une autre.

L’effet réel sur le crawl et l’indexation

Ta fiche peut sortir de l’index au profit d’une autre page : une des tiennes en duplication interne, celle d’un concurrent ou d’une marketplace en duplication externe. Et ton budget de crawl part dans des doublons au lieu de tes nouveautés, puisque l’économie de crawl figure parmi les objectifs annoncés.

Les quatre duplications de fiche produit

Quatre causes produisent le même symptôme, des pages que Google juge équivalentes, et appellent quatre correctifs sans rapport entre eux. Deux vont même en sens inverse : différencier le contenu pour le texte fournisseur, le consolider sur une seule URL pour les variantes. Une exclusion avant de détailler : la duplication créée par les URL de filtre et de tri relève de la navigation à facettes et du traitement des pages catégories, pas de la fiche produit.

Type de duplicationSymptôme typiqueCe que ça coûteCorrectif
Texte fournisseurTa description exacte ressort sur des dizaines d’autres domainesGoogle retient un autre revendeur comme meilleure réponseRéécrire les fiches à enjeu commercial, laisser les autres en l’état
Variantes internesUn produit, 12 URL quasi identiques ; statut « Duplicate without user-selected canonical »Signaux éclatés sur 12 URL au lieu d’une, crawl disperséTrancher mono-page ou multi-pages, puis baliser en ProductGroup
Syndication marketplaceMême texte sur ta fiche et sur la marketplace, qui passe devantTu alimentes une page que tu ne contrôles pasTexte distinct sur ton site, aucune canonique vers la marketplace
Scraping par des tiersTon texte sur un site que tu ne connais pasLe plus souvent rien de mesurableVérifier quelle URL Google retient, demander le retrait si besoin

Le texte fournisseur que tous les revendeurs recopient

Le cas de loin le plus fréquent, et le seul qui mérite du budget de rédaction. Quand le même flux alimente tes confrères, tout le monde publie le même paragraphe sur la même référence. Google n’a aucune raison de te préférer.

La sortie, Mueller la donne : si la description est la même mais que le reste du site diffère, la situation est saine. La bonne question n’est donc pas « comment rendre ce paragraphe unique » mais « qu’est-ce que ma fiche a que les autres n’ont pas ».

Les variantes de taille, de couleur et de format

Ici le problème vient de ton propre site. Un produit en cinq coloris et quatre tailles génère vingt URL au texte et aux attributs interchangeables. Le correctif est l’inverse du précédent : réduire le nombre d’URL que Google doit traiter, ou rendre chacune réellement autonome. Jamais écrire vingt textes.

La syndication vers les marketplaces

Tu publies ta fiche sur ton site et sur une marketplace, avec le même texte issu du même flux. La sélection de canonique s’applique telle quelle, et la marketplace arrive avec des signaux largement supérieurs aux tiens. Attends-toi à ce que Google retienne sa page.

Mon arbitrage : n’envoie jamais sur une marketplace le texte que tu veux faire ranker chez toi. Version enrichie sur ton site, version courte dans le flux. Et si on te propose de pointer ta canonique vers la marketplace, refuse.

Le scraping de tes fiches par des sites tiers

Cas le plus anxiogène et, en pratique, le moins coûteux. Google ne cherche pas le propriétaire du texte, donc le scraper devient une URL de plus parmi les candidates, et le risque d’action manuelle est de son côté : c’est le scraping massif que Google sanctionne. Un seul scénario justifie d’agir, c’est quand le site tiers est retenu comme canonique à ta place sur une requête qui compte. Là, tu demandes le retrait.

Détecter le contenu dupliqué en 30 minutes

Trois sources suffisent : Search Console pour savoir ce que Google a déjà décidé, Screaming Frog pour mesurer la similarité interne réelle, une recherche à la main pour la duplication externe. Dans cet ordre, parce que la première te dit où regarder.

Les trois statuts « Duplicate » de Search Console

Dans le rapport d’indexation, trois libellés comptent. La documentation Google n’en donne pas de traduction officielle, donc les intitulés d’interface varient.

  • « Duplicate without user-selected canonical » : la page est un doublon, tu n’as déclaré aucune canonique, Google en a choisi une à ta place. Inspecte l’URL pour voir laquelle, déclare-la s’il s’est trompé, et surtout différencie substantiellement le contenu.
  • « Duplicate, Google chose different canonical than user » : tu as déclaré une canonique, Google l’a écartée. Vérifie que celle que tu déclares est réellement similaire à la page testée. C’est le statut qui trahit une canonique posée au hasard par un module.
  • « Alternate page with proper canonical tag » : la page pointe correctement vers sa canonique indexée. Google écrit noir sur blanc qu’il n’y a rien à faire.

Mesurer la similarité réelle avec Screaming Frog

Screaming Frog sépare deux niveaux. Les Exact Duplicates reposent sur un hachage MD5 de tout le HTML, donc des pages identiques au caractère près. Les Near Duplicates utilisent un algorithme minhash appliqué au texte, pas au HTML complet, avec un seuil par défaut à 90 %, configurable.

Trois réglages déterminent la fiabilité du résultat, et les chemins de menu bougent d’une version à l’autre :

  • Activer le stockage du contenu avant le crawl (Config > Content > Duplicates). Oublié, il faut tout recrawler.
  • Lancer la Crawl Analysis après le crawl (Crawl Analysis > Start). Les Exact Duplicates s’affichent en temps réel, les Near Duplicates non.
  • Restreindre la zone analysée (Config > Content > Area) pour inclure ou exclure balises, classes et identifiants. Nav et footer sont exclus par défaut, et c’est essentiel : sinon tout le site paraît dupliqué.

L’export se récupère dans Bulk Export > Content > Exact Duplicates / Near Duplicates.

Vérifier si ton texte circule déjà ailleurs

Prends une phrase complète du milieu d’une description fournisseur, entre guillemets, et cherche-la sur Google. Deux informations tombent d’un coup : combien de domaines distincts affichent ce texte, et lequel Google montre en premier. Pour passer à l’échelle, je sors une phrase par fiche sur l’échantillon prioritaire et je fais tourner les requêtes via DataForSEO.

Prioriser la réécriture de 8 000 fiches

C’est le cœur du sujet. Compte 20 à 30 minutes par fiche pour un travail correct, ordre de grandeur issu de mes projets : sur 8 000 fiches, tu es à plus de 3 000 heures de rédaction. Ce chantier ne se fait pas. Il se découpe.

Mon découpage s’appuie sur quatre variables disponibles immédiatement : les clics organiques sur 3 mois, les impressions et la position moyenne dans Search Console, la marge ou le panier moyen de la fiche, et le stade de vie du produit.

SegmentCritère de triAction
Fiches qui convertissent déjàClics organiques réguliers et ventes attribuéesNe pas y toucher. Au mieux, enrichir par ajout, jamais par remplacement
Fiches à portée de mainImpressions significatives, position moyenne entre 8 et 25Réécriture complète, priorité absolue. C’est là que le temps passé revient
Fiches à forte marge sans visibilitéMarge ou panier élevé, quasi zéro clicRéécriture, plus vérification de l’intention de recherche et du maillage
Références interchangeables par natureConsommables, visserie, pièces détachées en sériesRegrouper en une fiche à variantes plutôt que réécrire chaque déclinaison
Fiches sans demande ni margeZéro impression sur 6 à 12 mois, référence que personne ne cherche par son nomAucune réécriture. Garder le texte fournisseur, surveiller le crawl
Produits arrêtésPlus de stock, pas de réassort prévuSortie d’index ou suppression propre avec renvoi vers l’équivalent

Deux principes complètent ce tableau. Règle les variantes avant de rédiger quoi que ce soit : réécrire douze URL qui décrivent le même produit en douze coloris, c’est payer douze fois le même travail. Attaque ensuite le segment « à portée de main » : une fiche qui passe de la position 12 à la position 6 change ton chiffre d’affaires, une fiche sans impression ne changera rien.

Le second principe est le moins intuitif : accepte de ne rien faire sur une grande partie du catalogue. Une fiche sans demande de recherche, sans marge et sans concurrence n’a pas besoin d’un texte original. Elle a besoin d’exister, d’être atteignable, et de ne pas manger le crawl de tes pages qui comptent.

Pour celles qui n’auront pas de réécriture, quatre sorties : le regroupement sous une fiche à variantes, le noindex quand la page doit rester accessible aux visiteurs sans peser sur l’index, la canonique vers la fiche de référence quand les pages sont réellement équivalentes, la suppression avec redirection quand le produit a disparu. Une sortie par segment, pas fiche par fiche.

Ce qui change le classement d’une fiche

Une réécriture utile ne cherche pas à rendre le texte différent. Elle cherche à rendre la page meilleure à montrer que celle des autres revendeurs, puisque c’est le critère annoncé par Google. La nuance décide de tout ce qui suit.

Ce qui ne sert à rien

  • Paraphraser la description fournisseur. Trois mots changés ne rendent pas ta page plus utile à montrer, et Google ne cherche pas le propriétaire du texte.
  • Viser un pourcentage d’unicité. Aucun seuil n’est publié par Google. Un objectif de ce type donne un indicateur rassurant et aucun résultat.
  • Allonger pour allonger. Passer de 80 à 600 mots avec des généralités sur la catégorie ajoute du volume, aucune information de décision.
  • Réécrire une fiche sans demande de recherche. Un texte original sur une référence que personne ne cherche ne produit rien de mesurable.

Ce qui marche

Reprends la phrase de Mueller à l’envers : si la description est la même mais que le reste du site diffère, ça passe. Donc travaille le reste. Ce qui différencie une fiche, ce sont les informations que seul toi peux produire : tes photos du produit en situation, tes mesures prises en entrepôt, tes compatibilités vérifiées, tes conditions de retour, les questions que ton SAV reçoit sur cette référence.

Ajoute ce qui aide à décider et que le fournisseur n’écrit jamais : avec quoi ce produit se combine dans ton catalogue, pour quel usage il ne convient pas, ce qu’il faut acheter en plus. Les avis clients réels produisent du texte unique en continu, sans budget rédaction.

Côté technique, deux points suffisent : un mot-clé cible exclusif par fiche, repris dans le title et le H1 pour que deux références proches ne se cannibalisent pas, et un title qui porte la référence exacte du produit.

Variantes produit : une ou plusieurs fiches

Google documente une classe ProductGroup faite exactement pour ça, avec les propriétés variesBy, hasVariant et productGroupID. Le hasVariant contient les variantes sous forme d’entités Product. La seule propriété requise sur le ProductGroup est name ; brand, description, productGroupID et aggregateRating sont recommandées.

Premier point à connaître, il évite des heures perdues : seules six propriétés sont reconnues par Google dans variesBy. Color, size, suggestedAge, suggestedGender, material, pattern. Ta variante de contenance, de longueur de câble ou de puissance n’entre dans aucune des six, et aucun balisage ne la fera entrer.

Deuxième point, le plus important : Google valide deux architectures, pas une.

  • Mono-page. Une seule URL canonique pour l’ensemble du ProductGroup, les variantes étant présélectionnables par paramètre (?size=small&color=green). Google écrit qu’il doit y avoir une seule URL canonique distincte pour tout le ProductGroup.
  • Multi-pages. Pas d’URL canonique au niveau du ProductGroup. Chaque page variante est autonome, et Google précise que chaque page doit porter un balisage complet et autonome.

Dans les deux cas, trois exigences communes : chaque variante doit avoir un identifiant distinct (SKU, GTIN), être atteignable par une URL qui la présélectionne, et afficher sa propre image, son prix et sa disponibilité.

La pratique la plus répandue sur Shopify ou WooCommerce ne fait partie d’aucune des deux : laisser vivre une URL par variante en pointant toutes les canoniques vers la fiche parente. Ça fonctionne, la canonique étant un signal fort, mais tu gardes des dizaines d’URL que Googlebot doit explorer pour comprendre qu’elles sont des doublons.

Mon critère de décision tient en une question : la variante a-t-elle une demande de recherche propre ? « Veste de travail bleue » se cherche, « veste de travail taille M » non. Couleur et matière justifient souvent des pages autonomes, taille et format quasi jamais.

{
  "@context": "https://schema.org",
  "@type": "ProductGroup",
  "name": "Veste de travail Artisan",
  "brand": { "@type": "Brand", "name": "Nom de la marque" },
  "description": "Veste de travail en coton renforcé, 5 coloris, du S au XXL.",
  "productGroupID": "VT-ARTISAN",
  "variesBy": ["https://schema.org/color", "https://schema.org/size"],
  "hasVariant": [
    {
      "@type": "Product",
      "sku": "VT-ARTISAN-BLEU-M",
      "color": "Bleu",
      "size": "M",
      "image": "https://www.exemple.fr/img/vt-artisan-bleu.jpg",
      "offers": {
        "@type": "Offer",
        "url": "https://www.exemple.fr/veste-artisan/?color=bleu&size=m",
        "priceCurrency": "EUR",
        "price": "79.00",
        "availability": "https://schema.org/InStock"
      }
    }
  ]
}

Deux façons de structurer ce balisage : les variantes imbriquées sous le ProductGroup, forme compacte et recommandée, ou des variantes séparées qui pointent vers le parent via isVariantOf. Place le tout dans le HTML initial plutôt qu’en JavaScript, puis valide au Rich Results Test.

Automatiser la réécriture sans bouillie

Un modèle de langage à qui tu donnes la description fournisseur en demandant un texte unique te rendra une paraphrase. Tu auras dépensé du temps pour reproduire exactement le problème que tu voulais régler. L’automatisation n’a de valeur que si elle injecte de la donnée que le fournisseur n’a pas.

Le pipeline que j’utilise part des données, pas du texte : attributs produit réels (dimensions, matière, compatibilités, poids, garantie), requêtes Search Console sur lesquelles la fiche reçoit déjà des impressions, questions récurrentes du service client. Un gabarit par famille de produits, pas pour tout le catalogue, puis génération par lots avec relecture humaine.

Le garde-fou se pose avant la mise en production. Tu crawles ton échantillon généré avec Screaming Frog en Near Duplicates, et tu regardes la similarité des fiches entre elles.

Contenu dupliqué et moteurs IA

Soyons honnêtes sur le niveau de preuve : il existe très peu de données solides publiées sur la façon dont les moteurs génératifs traitent le contenu dupliqué. Ce qui suit est un raisonnement, pas une mesure.

Le mécanisme de fond ne change probablement pas de nature. Un moteur qui doit citer une source sur une référence produit affronte le même arbitrage que Google : plusieurs pages, un texte identique, une seule à retenir. Si ton paragraphe est celui de quarante revendeurs, rien ne désigne ta page.

Ce qui en découle rejoint le SEO classique. Les informations que seul ton site porte, en texte visible dans le HTML, sont la seule chose qui puisse rendre ta fiche citable plutôt que celle du voisin. Je ne connais pas d’étude qui le chiffre.

Auditer ton catalogue avant de réécrire

Sur un catalogue de plusieurs milliers de fiches, l’erreur coûteuse n’est pas de mal réécrire. C’est de réécrire les mauvaises fiches, ou de le faire avant d’avoir réglé les variantes. Un diagnostic te donne la liste triée : quelles fiches réécrire, lesquelles regrouper, lesquelles sortir de l’index, et dans quel ordre.

Consultant SEO freelance depuis 5 ans, j’ai accompagné plus de 35 clients, dont une majorité d’e-commerces, sans aucune sous-traitance. C’est l’un des chantiers que je traite systématiquement en accompagnement SEO e-commerce : crawl complet, segmentation du catalogue, plan d’action priorisé. Un premier appel de 30 minutes suffit à savoir si c’est ta priorité du moment.

<> Bio de l'expert SEO

Abdelghani Ennadif

Consultant SEO freelance basé à Paris. Depuis cinq ans, j'accompagne les entreprises sur leurs enjeux d'acquisition organique et de rentabilité, avec une vraie spécialisation sur l'UX et la conversion de leur trafic.

<> Partager l'article

Consultant SEO e-commerce

Fais auditer ton catalogue avant de tout réécrire

Contacter Abdel
Écrire à Abdel