Sur le marché noir du web, un commentaire de recommandation sur Reddit se négocie à 9,99 dollars l’unité. Le pack de cent s’affiche à 699,99 dollars. Équipé d’un modèle de reconnaissance d’entités nommées (NER) affiné sur mesure, l’amateur de coutellerie Peter Vijeh a passé au crible 51 129 commentaires issus des forums spécialisés de Reddit, espérant prendre les campagnes d’astroturfing en flagrant délit grâce aux statistiques.
Une nouvelle collecte extrait 50 000 commentaires authentiques
Peter Vijeh anime New Knife Day, une plateforme dédiée aux collectionneurs de couteaux haut de gamme. Il connaît intimement le réflexe de l’internaute contemporain : pour acheter une lame — ou quasiment n’importe quel produit —, on tape l’objet de sa recherche sur Google en y adjoignant le mot-clé « reddit ». Il a ainsi sélectionné six subreddits de référence : r/knives, r/knifeclub, r/chefknives, r/japaneseknives, r/FixedBladeEdc et r/KnifeSteels, regroupant un total de 6 675 publications. À l’origine, son robot d’indexation capturait les fils de discussion immédiatement après leur mise en ligne. Mais cette première analyse n’a rien donné. Dans les plus de 800 fils initiaux de demandes de conseils d’achat, les mentions de marques étaient trop rares : la concentration des comptes suspects atteignait 7,6 %, un résultat indiscernable des 7,1 % prévus par la simple loi du hasard.
Cet échec initial, logique en apparence, méconnaissait la dynamique réelle des communautés en ligne. Les discussions du type « Que devrais-je acheter ? » ne provoquent pas d’afflux instantané de réponses ; les avis qualitatifs s’y accumulent au contraire lentement au cours des 24 à 48 heures suivantes. Sur le forum le plus fréquenté, r/knives, une publication fraîchement postée ne recueillait en moyenne que 1,5 commentaire.
Vijeh a donc entrepris de réindexer 3 607 discussions publiées depuis plus de 48 heures. Le corpus a alors bondi d’une vingtaine de milliers de messages à 51 129 commentaires. Ce décalage temporel a enfin permis d’extraire la véritable substance des avis d’achat. Parmi ces 50 000 contributions, 987 auteurs avaient posté au moins dix fois. À l’aide d’expressions régulières, Vijeh a ciblé les fils de conseil d’achat contenant des tournures telles que « should I buy », « recommend » ou « best knife ». Dans ce périmètre restreint, ces 987 utilisateurs totalisaient 1 471 mentions de marques.
En classant les auteurs selon leur « intensité de marque » — la proportion de leurs messages citant une marque, pondérée par la propension à mettre en avant de manière répétée le même fabricant —, les 5 % en tête ont été définis comme des comptes de queue de distribution (tail accounts), soit 49 profils au total.
1 000 permutations aléatoires mettent au jour une concentration anormale
Afin de vérifier si ces 49 comptes présentaient une véritable concentration délibérée ou s’il s’agissait d’une simple coïncidence probabiliste, Vijeh a conçu un test de permutation de Monte-Carlo. Il a conservé chaque mention de marque à son emplacement exact — fil et fabricant inchangés — en se contentant de redistribuer au hasard les noms des auteurs sur ces mentions. Il a réitéré cette opération 1 000 fois.
Selon une distribution purement aléatoire, ces 5 % d’utilisateurs auraient dû rédiger environ 7,9 % des recommandations de marques, l’immense majorité des simulations se situant entre 6,3 % et 10,1 %. Or, dans les faits observés, leur part grimpait à 11,3 %. Sur 1 000 tirages aléatoires, ce niveau n’a été atteint que deux fois seulement. En clair : environ un conseil d’achat sur neuf émanait de ces 49 comptes, là où le hasard en prévoyait un sur treize. Près de 50 recommandations ciblées supplémentaires avaient ainsi surgi au sein de l’échantillon.
En ventilant les données par fabricant, le décalage devenait saisissant. Pour une marque spécifique de couteaux de cuisine, la concentration des recommandations atteignait un vertigineux 31,2 %, contre une attente probabiliste de 8,0 %. Deux autres marques affichaient respectivement 26,1 % contre 8,2 % et 20,4 % contre 11,8 %. Seule une marque majeure s’inscrivait en deçà du hasard à 8,1 % contre 9,5 %, tandis que les trois autres marques étudiées ne présentaient aucun signal statistique notable.
Par ailleurs, l’anomalie ne touchait pas les subreddits de façon uniforme. Sur r/chefknives, le taux montait à 14,9 % contre 7,7 % attendu ; sur r/japaneseknives, il s’établissait à 15,2 % contre 14,3 %. En revanche, sur le grand forum généraliste r/knives, le chiffre n’était que de 6,7 % contre 6,4 %, collant presque parfaitement à la moyenne probabiliste. Si l’ensemble de la communauté subissait une manipulation industrielle globale, tous les sous-forums dépasseraient l’espérance mathématique. Cette forte concentration sur des rubriques ciblées suggère une action locale et chirurgicale.
Par souci de rigueur déontologique, Vijeh a masqué l’identité des marques sous des codes neutres. Une concentration statistique atteste seulement qu’une poignée d’utilisateurs fait la promotion acharnée de quelques noms ; elle ne prouve en aucun cas que ces marques ont rétribué ces recommandations. De fait, le fabricant affichant le signal le plus aigu bénéficie naturellement d’une communauté de fidèles particulièrement virulente.
Anatomie d’un historique complet : les mercenaires payés et les fans purs et durs ont le même visage
À la seule lecture des contributions au sein de ces six forums de coutellerie, les comptes suspects présentaient un profil étonnamment squelettique : une médiane de 12 commentaires seulement et un score médian d’un point par message, indiquant une absence quasi totale de plébiscite par la communauté. En matière de contenu, leur ferveur était sans partage : les deux tiers de leurs mentions de marques visaient invariablement le même atelier.
Pour percer ce mystère, Vijeh a extrait l’historique intégral sur Reddit des 23 comptes de queue liés aux trois marques en alerte statistique. Cet examen incluait jusqu’à 2 000 commentaires, leurs publications, la date d’inscription et leur capital de karma. En miroir, il a tiré au sort un groupe témoin de 23 comptes ordinaires présentant un volume d’activité équivalent.
Le résultat a balayé tous les présupposés intuitifs sur les mercenaires du web. L’âge médian des comptes était rigoureusement identique dans les deux groupes : 4,5 ans. Les comptes de queue ne consacraient que 3,2 % de leurs commentaires globaux aux six forums de couteaux, contre 10,3 % pour le groupe témoin. Leurs interventions couvraient une médiane de 66 subreddits différents, contre 47 pour le groupe de référence. Sur l’ensemble de leur parcours, les comptes suspects avaient cité en médiane 7 marques différentes de coutellerie (contre 12 pour les témoins), et la proportion de liens renvoyant vers des boutiques commerciales ne dépassait pas 0,3 % (contre 0,2 % dans le groupe témoin).
Au terme d’un test de Mann-Whitney, aucune variable n’a permis de dissocier les deux populations au seuil p < 0,05. Fait plus frappant encore, 8 profils suspects et 7 profils témoins avaient rendu leur historique inaccessible, avaient été suspendus ou avaient purement et simplement supprimé leur compte. Ancienneté respectable, présence organique dans des dizaines de niches, absence de liens promotionnels abusifs : tous les gages de crédibilité étaient réunis avec une perfection déconcertante chez ces 23 comptes.
Ce tableau correspond précisément aux standards de service affichés par les officines de marketing clandestin.
Image : Grille tarifaire de REDcmts : un commentaire 9,99 $, dix 89,99 $, cent 699,99 $, septembre 2026. Source : Rapport d’enquête de Peter Vijeh
Le faux avis rémunéré répond à des règles de marché limpides. L’agence REDCmts facture 9,99 dollars la réponse et 699,99 dollars les cent messages, en se targuant d’opérer avec de « vrais comptes anciens » (aged accounts). Une autre société, Soar, revendique ouvertement une période de « maturation manuelle » (warming) de plusieurs semaines avant la moindre citation de marque. Quant à Bazzly, la plateforme propose même des répliques automatisées ciblant chaque fil où transparaît une intention d’achat.
Image : Page marketing de Soar décrivant la maturation manuelle des comptes avant toute publication sponsorisée. Source : Rapport d’enquête de Peter Vijeh
Ces vitrines commerciales apportent la preuve tangible que des officines d’astroturfing sophistiquées sont à l’œuvre. Toutefois, comme l’insiste Vijeh, aucun élément n’établit de passerelle directe entre ces prestataires et les profils identifiés dans les forums de couteaux. Sur les courbes statistiques, un profil rémunéré façonné pendant quatre ans et demi pour placer un produit ressemble trait pour trait à un passionné authentique, flânant sur des dizaines de centres d’intérêt, mais jurant fidélité éternelle à un unique forgeron.
Les données circonscrivent les soupçons, mais ne jugent pas l’intention
Pour une poignée de fabricants, il est désormais avéré qu’un quart à un tiers des recommandations d’achat proviennent de contributeurs à la préférence monomaniaque. Cependant, après avoir disséqué leurs historiques complets, Peter Vijeh penche prudemment pour l’hypothèse de simples passionnés inconditionnels — tout en conservant une réserve salutaire.
Pour le simple lecteur, cette étude offre un réflexe d’autodéfense pragmatique : lorsqu’un compte inconnu recommande chaudement un modèle dans un fil de conseils, ouvrez son profil et observez s’il a déjà mentionné une autre marque un jour. Dans cette base de plus de 51 000 commentaires, cette unique question a permis d’isoler les comptes suspects bien plus sûrement que l’examen du score de karma. Mais face à un compte réel, patiemment entretenu et activé dans le cadre d’un contrat de sponsoring feutré, le lecteur lambda reste totalement désarmé.
En conclusion de ses travaux, Vijeh pointe loyalement les limites de son approche : la détection des marques reposait sur un modèle générique sans contrôle manuel systématique ; le repérage des fils d’achat s’appuyait sur des expressions régulières ; et les déductions relatives à des marques précises ne reposaient en définitive que sur 15 à 20 comptes. En outre, ses conflits d’intérêts en tant qu’administrateur d’un site spécialisé et l’usage d’une IA pour la rédaction de certains passages préparatoires figurent en toute transparence dans le document.
Les données ouvertes démontrent sans équivoque que la prescription d’achat se concentre massivement entre les mains d’une poignée d’acteurs. L’analyse statistique sait délimiter les zones de doute et chiffrer une anomalie tous les neuf avis, mais elle est incapable de sonder les cœurs et les portefeuilles. L’agent d’influence rétribué et le supporter dévoué projettent rigoureusement la même ombre sur les diagrammes. Confrontée à des comptes irréprochables cumulant 4,5 ans d’existence et essaimant sur 66 communautés, la science des données heurte sa frontière physique.
Liens de référence :
- Rapport d’enquête de Peter Vijeh