Astroturfing auf Reddit: 5 % der Accounts verfassen 31 % der Kaufempfehlungen – doch bezahlte Trolle bleiben unsichtbar

Astroturfing auf Reddit: 5 % der Accounts verfassen 31 % der Kaufempfehlungen – doch bezahlte Trolle bleiben unsichtbar

RedditDatenanalyseAstroturfing

Quellen:Peter Vijeh 调查报告

Ein einzelner Empfehlungskommentar auf Reddit kostet auf dem Schwarzmarkt 9,99 Dollar. Ein Paket von hundert Beiträgen wird für 699,99 Dollar gehandelt. Ausgerüstet mit einem feinabgestimmten Named-Entity-Recognition-Modell (NER) durchforstete der Messerliebhaber Peter Vijeh 51.129 Kommentare in einschlägigen Reddit-Foren, in der festen Erwartung, verdecktem Astroturfing mit statistischen Methoden auf die Schliche zu kommen.

Ein erneuter Abruf filtert 50.000 echte Kommentare heraus

Peter Vijeh betreibt New Knife Day, eine Plattform für Sammler hochwertiger Messer. Er kennt die gängige Praxis genau: Wer ein Messer – oder fast jedes andere Konsumgut – kaufen möchte, gibt den Suchbegriff bei Google ein und hängt das Wort „reddit“ an. Er wählte sechs zentrale Subreddits aus: r/knives, r/knifeclub, r/chefknives, r/japaneseknives, r/FixedBladeEdc sowie r/KnifeSteels, die zusammen 6.675 Diskussionsfäden umfassten. Ursprünglich war der Web-Scraper so konfiguriert, dass er Beiträge unmittelbar nach der Veröffentlichung erfasste. Diese erste Prüfung brachte jedoch keinerlei verwertbare Auffälligkeiten zutage. In den anfänglich gesammelten über 800 Kaufberatungsthreads wurden schlicht zu wenige Markennamen genannt. Die Konzentration verdächtiger Accounts lag bei 7,6 % und war von der reinen Zufallserwartung (7,1 %) statistisch nicht zu unterscheiden.

Es handelte sich um einen Fehlschlag, der zwar menschlicher Intuition entsprach, aber die Dynamik einer Online-Community verkannte. Kaufberatungsthreads explodieren nicht sofort nach dem Posting. Hochwertige Empfehlungen wachsen typischerweise erst im Laufe der folgenden 24 bis 48 Stunden heran. Im größten Subreddit, r/knives, lagen unmittelbar nach der Veröffentlichung durchschnittlich nur 1,5 Antworten vor.

Vijeh beschloss daher, 3.607 Diskussionsfäden, die älter als 48 Stunden waren, erneut abzurufen. Dadurch schwoll der Korpus von gut 20.000 auf 51.129 Kommentare an. Erst dieses zeitliche Zeitfenster ermöglichte es, echte Kaufberatungen verlässlich zu erfassen. Unter diesen mehr als 50.000 Kommentaren gab es 987 Accounts, die mindestens zehn Beiträge verfasst hatten. Mittels regulärer Ausdrücke filterte Vijeh Beratungsbeiträge heraus, deren Titel oder Text Phrasen wie „should I buy“, „recommend“ oder „best knife“ enthielten. In diesem spezifischen Teilbereich steuerten jene 987 Nutzer insgesamt 1.471 Markennennungen bei.

Sortiert nach der sogenannten Markendichte – dem Anteil der Kommentare, die einen Markennamen enthalten, gewichtet nach der wiederholten Nennung derselben Marke – wurden die oberen 5 % als sogenannte Tail-Accounts (Randgruppen-Accounts) definiert: insgesamt 49 Profile.

1.000 Zufallspermutationen entlarven anomale Konzentrationen

Um zu überprüfen, ob diese 49 Accounts tatsächlich systematisch bestimmte Marken pushten oder ob lediglich ein statistischer Zufall vorlag, führte Vijeh einen Monte-Carlo-Permutationstest durch. Er beließ jede Markennennung an ihrem ursprünglichen Platz – faden- und markengenau – und verwürfelte lediglich die Autorennamen über diese Nennungen hinweg nach dem Zufallsprinzip. Diesen Vorgang wiederholte er 1.000 Mal.

Gemäß einer statistischen Zufallsverteilung hätten diese 5 % der Accounts etwa 7,9 % der Markenempfehlungen beisteuern müssen; die überwiegende Mehrheit der Durchläufe bewegte sich zwischen 6,3 % und 10,1 %. In den realen Daten schrieben sie jedoch 11,3 %. In 1.000 Zufallspermutationen wurde dieser Wert lediglich zweimal erreicht. Anschaulicher ausgedrückt: Etwa jede neunte Kaufempfehlung stammte von diesen 49 Accounts, während der statistische Zufall nur jede dreizehnte prognostiziert hatte. Im Datensatz tauchten somit rund 50 zusätzliche, gezielte Empfehlungen gleichsam aus dem Nichts auf.

Wurden die Zahlen auf einzelne Marken aufgeschlüsselt, fielen die Abweichungen noch dramatischer aus. Bei einer Kochmessermarke lag die Empfehlungskonzentration bei beachtlichen 31,2 %, während die Zufallserwartung lediglich 8,0 % betrug. Zwei weitere Marken erreichten 26,1 % (Erwartung 8,2 %) sowie 20,4 % (Erwartung 11,8 %). Lediglich eine etablierte Großmarke blieb mit 8,1 % gegenüber 9,5 % unter der Zufallslinie, während die verbleibenden drei Marken keinerlei statistisches Signal aufwiesen.

Auch über die Subreddits hinweg war die Anomalie ungleich verteilt. In r/chefknives erreichte der Wert 14,9 % gegenüber erwarteten 7,7 %; in r/japaneseknives lag er bei 15,2 % gegenüber 14,3 %. Im größten Sammelforum r/knives hingegen betrug der Anteil 6,7 % gegenüber 6,4 % und schmiegte sich fast deckungsgleich an die Zufallskurve an. Wäre die gesamte Messer-Community flächendeckend manipuliert worden, hätten sämtliche Subreddits über der Zufallsgrenze liegen müssen. Die markante Konzentration in bestimmten Fachforen deutet vielmehr auf gezielte, lokale Aktionen hin.

Aus Gründen methodischer Sorgfalt anonymisierte Vijeh die untersuchten Markennamen. Eine statistische Häufung belegt lediglich, dass eine Handvoll Nutzer bestimmte Hersteller überproportional häufig empfiehlt; sie beweist keineswegs, dass dafür Geld geflossen ist. Ausgerechnet die Marke mit dem stärksten statistischen Ausschlag verfügt über eine ausgesprochen lautstarke Fangemeinde.

Vollständige Profile im Vergleich: Bezahlte Trolle und treue Fans teilen dasselbe Gesicht

Betrachtet man ausschließlich die Aktivitäten innerhalb der sechs Messerforen, wiesen die 49 Tail-Accounts auffallend dünne Profile auf: Der Median lag bei lediglich 12 Beiträgen, und der Medianwert der Upvotes betrug exakt 1 – sie genossen in den Communities praktisch kein nennenswertes Ansehen. Inhaltlich agierten sie extrem fokussiert: Zwei Drittel aller Markennennungen entfielen auf ein und denselben Hersteller.

Um der Sache auf den Grund zu gehen, rief Vijeh die vollständige Reddit-Historie jener 23 Tail-Accounts ab, die hinter den drei auffälligen Marken standen. Dies umfasste bis zu 2.000 Kommentare, Einreichungen, das Registrierungsdatum sowie Karma-Punkte. Als Kontrollgruppe wählte er nach dem Zufallsprinzip 23 reguläre Accounts aus, die in dieselbe Beitragsspanne fielen.

Das Ergebnis warf sämtliche intuitiven Annahmen über bezahltes Astroturfing über den Haufen. Das mediane Accountalter lag in beiden Gruppen bei 4,5 Jahren. Die Tail-Accounts verfassten lediglich 3,2 % ihrer gesamten Kommentare in den sechs Messer-Subreddits – bei der Kontrollgruppe waren es 10,3 %. Ihre Aktivitäten verteilten sich im Median über 66 verschiedene Subreddits, verglichen mit 47 bei der Kontrollgruppe. Über ihre gesamte Plattform-Historie hinweg nannten die Tail-Accounts im Median 7 verschiedene Messermarken (Kontrollgruppe: 12), und Verlinkungen zu Online-Shops machten lediglich 0,3 % der Beiträge aus (Kontrollgruppe: 0,2 %).

Beim Mann-Whitney-U-Test trennte kein einziges Merkmal die beiden Gruppen auf einem Signifikanzniveau von p < 0,05. Hinzu kam ein bemerkenswerter Umstand: 8 Profile der Tail-Gruppe und 7 der Kontrollgruppe hatten ihren Verlauf verborgen, waren gesperrt oder gänzlich gelöscht worden. Langjährige Registrierung, organische Aktivität in Dutzenden von Nischen und das Vermeiden plumper Werbelinks: Sämtliche Indikatoren für hohe Glaubwürdigkeit wurden von den 23 verdächtigen Accounts makellos erfüllt.

Genau dies entspricht den Leistungsversprechen professioneller Dienstleister im Untergrund.

Screenshot der REDcmts-Preisliste: ein Kommentar 9,99 $, zehn 89,99 $, einhundert 699,99 $, September 2026 Abb.: Screenshot der REDcmts-Preisliste: ein Kommentar 9,99 $, zehn 89,99 $, einhundert 699,99 $, September 2026. Quelle: Peter Vijeh Untersuchungsbericht

Meinungsmache hat klare Marktpreise. REDCmts bietet einzelne Antworten für 9,99 Dollar und Hundertpakete für 699,99 Dollar an und wirbt ausdrücklich mit „echten, gereiften Accounts“ (aged accounts). Die Agentur Soar erklärt offen, dass ihre Konten vor der ersten Markennennung über mehrere Wochen hinweg manuell „aufgewärmt“ und organisch gepflegt werden. Plattformen wie Bazzly offerieren gar automatisierte Antworten auf jeden Beitrag, der nach einer Kaufabsicht aussieht.

Screenshot der Soar-Marketingseite, der das bezahlte „Aufwärmen“ von Accounts beschreibt Abb.: Screenshot der Soar-Marketingseite, der das bezahlte „Aufwärmen“ von Accounts beschreibt. Quelle: Peter Vijeh Untersuchungsbericht

Diese öffentlich einsehbaren Angebote belegen die Existenz hochentwickelter Tarnmethoden. Wie Vijeh jedoch nachdrücklich betont, gibt es keinerlei handfeste Beweise dafür, dass jene Agenturen mit den identifizierten Accounts in den Messerforen in Verbindung stehen. Im statistischen Diagramm sieht ein 4,5 Jahre alter, handwerklich aufgewärmter Account exakt so aus wie ein echter Enthusiast, der in zahlreichen Subreddits mitliest, bei Messern aber bedingungslos einer einzigen Schmiede die Treue hält.

Daten markieren Verdachtszonen, können aber keine Absichten beweisen

Bei einer kleinen Gruppe von Marken stammt ein Viertel bis ein Drittel der Kaufempfehlungen nachweislich von Nutzern mit einer ausgeprägten Einseiten-Präferenz. Nach der Sichtung der vollständigen Verläufe neigt Vijeh jedoch vorsichtig zu der Einschätzung, dass es sich überwiegend um überzeugte Fans handelt – wenngleich er diesen Eindruck mit gebotener Zurückhaltung formuliert.

Für normale Leser liefert die Untersuchung dennoch eine einfache, wirkungsvolle Faustregel: Wer in einem Beratungsthread auf eine auffällige Empfehlung stößt, sollte das Profil des Verfassers aufrufen und prüfen, ob dieser jemals eine andere Marke erwähnt hat. In einem Korpus von über 51.000 Beiträgen trennte diese eine Frage verdächtige Accounts weitaus verlässlicher von regulären Nutzern als jede Betrachtung des Karma-Werts. Gegen professionell aufgebaute Accounts, die für verdeckte Kampagnen bezahlt werden, bleibt der einzelne Nutzer jedoch weitgehend machtlos.

Am Ende seines Berichts benennt Vijeh offen methodische Schwächen: Die Erkennung von Marken basierte auf einem Standardmodell ohne manuelle Nachvalidierung; die Einordnung von Kaufberatungsbeiträgen erfolgte rein über reguläre Ausdrücke; und die markenspezifischen Auswertungen stützen sich letztlich auf die Daten von lediglich 15 bis 20 Accounts. Hinzu kommen die offengelegten Interessenkonflikte durch seine eigene Sammlerplattform sowie der redaktionelle Einsatz von KI bei früheren Entwürfen.

Öffentlich zugängliche Daten belegen zweifelsfrei, dass sich Kaufempfehlungen auf eine winzige Gruppe von Accounts konzentrieren. Statistische Tests können Verdachtszonen präzise markieren und nachweisen, dass in jeder neunten Empfehlung eine statistische Abweichung steckt. Doch die Motivation dahinter können sie nicht entschlüsseln. Bezahlte Auftragschreiber und leidenschaftliche Fans hinterlassen im mathematischen Modell dieselbe Silhouette. Sobald Datenanalysten auf 4,5 Jahre alte, in 66 Foren aktive Vorzeige-Accounts treffen, stoßen statistische Verfahren an ihre harte Grenze.

Referenzlinks:

  • Peter Vijeh Untersuchungsbericht