Vue lecture

Reddit utilise l’IA pour se protéger du spam généré par IA

Fight fire with fire
Reddit utilise l’IA pour se protéger du spam généré par IA

Reddit affirme que ses outils de modération automatisés, sous-tendus par des grands modèles de langage, parviennent à endiguer une part significative des contenus promotionnels et du spam généré par IA.

Reddit et l’IA, c’est un peu je t’aime moi non plus. Très virulente lorsqu’il s’agit de défendre ses droits face à l’exploitation de ses contenus pour l’entraînement des grands modèles de langage (LLM), l’entreprise exploite massivement les capacités d’automatisation de l’intelligence artificielle pour servir ses propres desseins.

Après avoir généralisé l’usage de la traduction automatisée, notamment pour faire ressortir des contenus anglophones dans la version française de Google, la plateforme affirme avoir considérablement musclé ses capacités de modération face au spam et aux contenus publicitaires.

« Un nouveau front dans une guerre ancienne »

Pour Reddit, créée en 2005, le spam et le détournement à des fins marketing n’ont rien de nouveau, mais l’avènement de l’IA générative a, comme ailleurs sur le Web, considérablement accentué le phénomène. « Dans la mesure où les tactiques des acteurs malveillants ont évolué, nos systèmes ont évolué pour les arrêter », résume l’entreprise. Steve Huffman, CEO de Reddit, a décrit le phénomène (incarné notamment par la vague du GEO, le référencement via les LLM) comme « un nouveau front dans une guerre ancienne ».

Reddit explique ainsi avoir mis en œuvre des outils IA pour accélérer la détection des comptes et contenus dédiés au spam :

« Nous analysons les signaux dès la création d’un compte afin de bloquer les acteurs suspects avant même qu’ils ne publient quoi que ce soit. Pour ceux qui le font malgré tout, nous utilisons des modèles de langage (LLM) pour détecter les schémas subtils et coordonnés de faux comportements et de surenchère artificielle que les anciens systèmes ne parvenaient pas à repérer ».

Sur les derniers mois, la plateforme estime avoir réussi à bloquer l’équivalent de 23 millions d’affichages de spam par jour, en agissant donc de façon proactive avant que les contenus concernés aient été vus par un internaute. Pour ce faire, elle supprimerait 25 000 posts ou commentaires par jour, et indique avoir révoqué (supprimé) 2 millions de votes considérés comme non authentiques sur les trois derniers mois.

Comme souvent, le système ne va pas sans quelques heurts. Sur r/reddithelp, le canal dédié aux demandes d’aide, on a ainsi vu se multiplier ces dernières semaines les messages interrogeant des décisions de modération automatisées.

La modération assistée par IA s’étend également aux contenus non publicitaires, mais relevant des discours de haine ou des messages violents. Sur ce volet, Reddit affirme que ses systèmes automatisés sont capables d’intervenir « en moins de cinq secondes », ce qui permettrait de limiter de 40 % l’exposition des internautes, avec une baisse de plus de 40 % du nombre de faux positifs.

« Notre objectif est simple : limiter l’impact des personnes malveillantes et la diffusion de leurs contenus. Nous n’attendons pas que le contenu atteigne la communauté pour déterminer s’il est nuisible. Notre action la plus efficace se déroule avant même qu’un utilisateur ne voie une publication », estime la plateforme.

Pour Reddit, cette modération automatisée ne va pas à l’encontre des grands principes de fonctionnement de la plateforme, à savoir une visibilité conditionnée par les votes des utilisateurs (flèches vers le haut ou vers le bas) et surtout une importante modération humaine assurée bénévolement, souvent par des internautes impliqués dans une communauté donnée.

C’est d’ailleurs vers cette communauté de modérateurs que Reddit se tourne pour traiter un phénomène plus diffus que connaissent bien les adeptes de LinkedIn : la prolifération de posts à faible valeur ajoutée publiés par des humains avec l’aide de l’IA.

Reddit bientôt désignée comme VLOP par la Commission européenne ?

Entre juillet et décembre 2025, la modération a posteriori (après publication) a concerné 154 millions de publications et commentaires. Les actions se répartissaient à 52,7 % entre les modérateurs bénévoles et à 44,7 % pour les équipes internes à l’entreprise, d’après le rapport de transparence annuel de Reddit. La modération automatisée représentait 3,9 millions d’actions, soit 2,5 % des contenus supprimés. La plateforme a, sur cette période, enregistré quelque 2,2 milliards de nouveaux posts et commentaires.

L’entreprise voit une forme d’impératif dans la mise en place d’outils automatisés supplémentaires. Chaque trimestre, elle rappelle dans le chapitre « risques » de sa communication financière à quel point sa santé dépend de son attractivité pour les annonceurs et donc de sa capacité à lutter efficacement contre les contenus problématiques ou illégaux.

En Europe, Reddit se prépare par ailleurs à devoir faire face aux obligations spécifiques liées au règlement sur les services numériques (DSA) : au détour d’une publication réglementaire (PDF), elle révèle en effet avoir déclaré en février dernier à la Commission européenne le franchissement du seuil des 45 millions d’utilisateurs mensuels qui qualifie les très grandes plateformes (VLOP, pour Very large online platform). « Si la Commission européenne désigne Reddit comme une VLOP, nous serons soumis à des règles et obligations de conformité supplémentaires », prévient-elle.

  •  

Reddit utilise l’IA pour se protéger du spam généré par IA

Fight fire with fire
Reddit utilise l’IA pour se protéger du spam généré par IA

Reddit affirme que ses outils de modération automatisés, sous-tendus par des grands modèles de langage, parviennent à endiguer une part significative des contenus promotionnels et du spam généré par IA.

Reddit et l’IA, c’est un peu je t’aime moi non plus. Très virulente lorsqu’il s’agit de défendre ses droits face à l’exploitation de ses contenus pour l’entraînement des grands modèles de langage (LLM), l’entreprise exploite massivement les capacités d’automatisation de l’intelligence artificielle pour servir ses propres desseins.

Après avoir généralisé l’usage de la traduction automatisée, notamment pour faire ressortir des contenus anglophones dans la version française de Google, la plateforme affirme avoir considérablement musclé ses capacités de modération face au spam et aux contenus publicitaires.

« Un nouveau front dans une guerre ancienne »

Pour Reddit, créée en 2005, le spam et le détournement à des fins marketing n’ont rien de nouveau, mais l’avènement de l’IA générative a, comme ailleurs sur le Web, considérablement accentué le phénomène. « Dans la mesure où les tactiques des acteurs malveillants ont évolué, nos systèmes ont évolué pour les arrêter », résume l’entreprise. Steve Huffman, CEO de Reddit, a décrit le phénomène (incarné notamment par la vague du GEO, le référencement via les LLM) comme « un nouveau front dans une guerre ancienne ».

Reddit explique ainsi avoir mis en œuvre des outils IA pour accélérer la détection des comptes et contenus dédiés au spam :

« Nous analysons les signaux dès la création d’un compte afin de bloquer les acteurs suspects avant même qu’ils ne publient quoi que ce soit. Pour ceux qui le font malgré tout, nous utilisons des modèles de langage (LLM) pour détecter les schémas subtils et coordonnés de faux comportements et de surenchère artificielle que les anciens systèmes ne parvenaient pas à repérer ».

Sur les derniers mois, la plateforme estime avoir réussi à bloquer l’équivalent de 23 millions d’affichages de spam par jour, en agissant donc de façon proactive avant que les contenus concernés aient été vus par un internaute. Pour ce faire, elle supprimerait 25 000 posts ou commentaires par jour, et indique avoir révoqué (supprimé) 2 millions de votes considérés comme non authentiques sur les trois derniers mois.

Comme souvent, le système ne va pas sans quelques heurts. Sur r/reddithelp, le canal dédié aux demandes d’aide, on a ainsi vu se multiplier ces dernières semaines les messages interrogeant des décisions de modération automatisées.

La modération assistée par IA s’étend également aux contenus non publicitaires, mais relevant des discours de haine ou des messages violents. Sur ce volet, Reddit affirme que ses systèmes automatisés sont capables d’intervenir « en moins de cinq secondes », ce qui permettrait de limiter de 40 % l’exposition des internautes, avec une baisse de plus de 40 % du nombre de faux positifs.

« Notre objectif est simple : limiter l’impact des personnes malveillantes et la diffusion de leurs contenus. Nous n’attendons pas que le contenu atteigne la communauté pour déterminer s’il est nuisible. Notre action la plus efficace se déroule avant même qu’un utilisateur ne voie une publication », estime la plateforme.

Pour Reddit, cette modération automatisée ne va pas à l’encontre des grands principes de fonctionnement de la plateforme, à savoir une visibilité conditionnée par les votes des utilisateurs (flèches vers le haut ou vers le bas) et surtout une importante modération humaine assurée bénévolement, souvent par des internautes impliqués dans une communauté donnée.

C’est d’ailleurs vers cette communauté de modérateurs que Reddit se tourne pour traiter un phénomène plus diffus que connaissent bien les adeptes de LinkedIn : la prolifération de posts à faible valeur ajoutée publiés par des humains avec l’aide de l’IA.

Reddit bientôt désignée comme VLOP par la Commission européenne ?

Entre juillet et décembre 2025, la modération a posteriori (après publication) a concerné 154 millions de publications et commentaires. Les actions se répartissaient à 52,7 % entre les modérateurs bénévoles et à 44,7 % pour les équipes internes à l’entreprise, d’après le rapport de transparence annuel de Reddit. La modération automatisée représentait 3,9 millions d’actions, soit 2,5 % des contenus supprimés. La plateforme a, sur cette période, enregistré quelque 2,2 milliards de nouveaux posts et commentaires.

L’entreprise voit une forme d’impératif dans la mise en place d’outils automatisés supplémentaires. Chaque trimestre, elle rappelle dans le chapitre « risques » de sa communication financière à quel point sa santé dépend de son attractivité pour les annonceurs et donc de sa capacité à lutter efficacement contre les contenus problématiques ou illégaux.

En Europe, Reddit se prépare par ailleurs à devoir faire face aux obligations spécifiques liées au règlement sur les services numériques (DSA) : au détour d’une publication réglementaire (PDF), elle révèle en effet avoir déclaré en février dernier à la Commission européenne le franchissement du seuil des 45 millions d’utilisateurs mensuels qui qualifie les très grandes plateformes (VLOP, pour Very large online platform). « Si la Commission européenne désigne Reddit comme une VLOP, nous serons soumis à des règles et obligations de conformité supplémentaires », prévient-elle.

  •  

L’intégration des IA génératives dans les réseaux sociaux influence l’opinion

L'influence d'un battement d'aile d'un papillon généré par IA...
L’intégration des IA génératives dans les réseaux sociaux influence l’opinion

Avec une simulation, des chercheuses et chercheurs montrent que les petites suggestions des IA génératives lors de la rédaction de posts peuvent vraiment biaiser les conversations, influencer le débat sur les réseaux sociaux et avoir de réelles conséquences sur les débats politiques.

On le sait, les outils d’IA générative incorporent des biais. Mais comment leurs biais influencent-ils l’opinion collective au sein d’un réseau social lorsqu’il est utilisé pour faciliter la communication ?

C’est déjà le cas sur LinkedIn, qui propose depuis 2024 une option permettant de modifier ses posts avec une IA générative avant de les publier. Sur X, Grok propose de fournir du contexte censé permettre de mieux comprendre les contenus publiés par d’autres. Des chercheuses et chercheurs se sont intéressés à cette dynamique.

Leur étude, publiée sur la plateforme de prépublication arXiv et acceptée à la conférence scientifique ICML 2026 selon un communiqué de presse de l’université d’Oxford. Elle montre que « les biais introduits par l’IA dans la communication entre humains peuvent être amplifiés par le réseau et faire basculer l’opinion collective dans leur sens ».

Dans leur article, ils mettent en condition le lecteur :

« Imaginez que vous vous rendiez sur une plateforme de réseaux sociaux pour partager votre point de vue sur l’utilisation de l’IA dans l’éducation. Vous y êtes favorable et rédigez un court message soutenant cette idée : « L’IA pourrait être un outil utile pour personnaliser l’éducation des élèves ». Avant de le publier, vous décidez de cliquer sur le bouton « Améliorer mon message », et un grand modèle de langage (LLM) fourni par la plateforme vous propose une version peaufinée et exprimant plus explicitement votre soutien : « Tirons parti du potentiel de l’IA pour personnaliser l’apprentissage et révolutionner l’éducation pour chaque élève ! » Vous trouvez cette version plus convaincante que celle que vous aviez rédigée, vous acceptez donc simplement la modification et la publiez. Une simple incitation [nudge, en anglais]. Mais que se passerait-il si ce même LLM incitait des millions d’utilisateurs à aller dans la même direction ? »

Des modélisations informatiques et mathématiques

D’abord, ils ont vérifié sur des modèles de langage ouverts qu’en leur demandant de rédiger et d’améliorer des publications sur les réseaux sociaux concernant 13 sujets politiques, à partir d’arguments originaux et de publications rédigées par des humains, tous les LLM étudiés introduisent des biais.

La plupart du temps, ces biais coïncident avec ceux visibles dans une simple conversation avec le LLM. Mais parfois, ce n’est pas le cas : « En ce qui concerne l’athéisme, par exemple, les modèles expriment une opinion favorable, mais ont tendance à introduire des biais à son encontre lorsqu’ils améliorent des publications rédigées par des humains sur ce sujet ».

Ensuite, ils ont appliqué un modèle mathématique établi [PDF] en 1990 pour simuler les réseaux d’influences interpersonnelles et leurs influences sur les opinions individuelles à la dynamique des opinions influencée par l’IA. C’est cette simulation mathématique qui montre de façon théorique que ce genre de fonctionnalités peut amplifier le biais introduit par la modification du texte via l’IA générative.

Ensuite, ils ont simulé le problème sur de vieilles données puisées en 2012 dans Twitter, Facebook et Google+ (oui, ce réseau social a existé, rappelez-vous) avec le modèle gemma-3-12b-it de Google et en prenant le thème de l’avortement. Ainsi, dans leur simulation, avec une population plutôt anti-avortement mais des suggestions générées par IA, l’opinion devient plutôt pro-choix (alors qu’elle reste anti-avortement sans les suggestions).

Le prompt de Grok influence sans en avoir l’air

Enfin, ils ont étudié plus finement la fonction réellement implémentée sur X « explique ce message ». En effet, l’entreprise d’Elon Musk a publié le prompt qui guide son IA pour cette fonctionnalité. Simplement en le lisant, il est impossible d’affirmer qu’il biaise la discussion sur le sujet de l’avortement.

Mais en utilisant ce prompt avec grok-4-1-fast-reasoning via l’API officielle, les chercheuses et chercheurs ont observé que la majorité des affirmations générées par Grok étaient anti-avortement, « une large portion [était] neutre »  et que seulement 4 % étaient pro-avortement. Pourtant, quand ils ont fait la même expérience sans le prompt, ils n’ont observé « ni biais en faveur ni biais en défaveur statistiquement significatifs […] ce qui fait de ces directives un choix de conception déterminant, responsable du biais anti-avortement de Grok dans les affirmations contextuelles qu’il génère ».

Interrogée par le Guardian, l’une des autrices de l’étude, Sandra Wachter, compare les effets de l’introduction des biais des IA génératives dans les réseaux sociaux à « la pollution de la forêt ». « Le prix à payer, c’est que nous prenons pour vraies les opinions des autres alors qu’elles ne reflètent pas leur pensée réelle », affirme-t-elle :

« Le langage est l’un des éléments qui font de nous des êtres humains, et tout à coup, un intermédiaire s’immisce dans ce processus. L’IA s’impose comme gardienne de la connaissance et de la compréhension. »

  •  

L’intégration des IA génératives dans les réseaux sociaux influence l’opinion

L'influence d'un battement d'aile d'un papillon généré par IA...
L’intégration des IA génératives dans les réseaux sociaux influence l’opinion

Avec une simulation, des chercheuses et chercheurs montrent que les petites suggestions des IA génératives lors de la rédaction de posts peuvent vraiment biaiser les conversations, influencer le débat sur les réseaux sociaux et avoir de réelles conséquences sur les débats politiques.

On le sait, les outils d’IA générative incorporent des biais. Mais comment leurs biais influencent-ils l’opinion collective au sein d’un réseau social lorsqu’il est utilisé pour faciliter la communication ?

C’est déjà le cas sur LinkedIn, qui propose depuis 2024 une option permettant de modifier ses posts avec une IA générative avant de les publier. Sur X, Grok propose de fournir du contexte censé permettre de mieux comprendre les contenus publiés par d’autres. Des chercheuses et chercheurs se sont intéressés à cette dynamique.

Leur étude, publiée sur la plateforme de prépublication arXiv et acceptée à la conférence scientifique ICML 2026 selon un communiqué de presse de l’université d’Oxford. Elle montre que « les biais introduits par l’IA dans la communication entre humains peuvent être amplifiés par le réseau et faire basculer l’opinion collective dans leur sens ».

Dans leur article, ils mettent en condition le lecteur :

« Imaginez que vous vous rendiez sur une plateforme de réseaux sociaux pour partager votre point de vue sur l’utilisation de l’IA dans l’éducation. Vous y êtes favorable et rédigez un court message soutenant cette idée : « L’IA pourrait être un outil utile pour personnaliser l’éducation des élèves ». Avant de le publier, vous décidez de cliquer sur le bouton « Améliorer mon message », et un grand modèle de langage (LLM) fourni par la plateforme vous propose une version peaufinée et exprimant plus explicitement votre soutien : « Tirons parti du potentiel de l’IA pour personnaliser l’apprentissage et révolutionner l’éducation pour chaque élève ! » Vous trouvez cette version plus convaincante que celle que vous aviez rédigée, vous acceptez donc simplement la modification et la publiez. Une simple incitation [nudge, en anglais]. Mais que se passerait-il si ce même LLM incitait des millions d’utilisateurs à aller dans la même direction ? »

Des modélisations informatiques et mathématiques

D’abord, ils ont vérifié sur des modèles de langage ouverts qu’en leur demandant de rédiger et d’améliorer des publications sur les réseaux sociaux concernant 13 sujets politiques, à partir d’arguments originaux et de publications rédigées par des humains, tous les LLM étudiés introduisent des biais.

La plupart du temps, ces biais coïncident avec ceux visibles dans une simple conversation avec le LLM. Mais parfois, ce n’est pas le cas : « En ce qui concerne l’athéisme, par exemple, les modèles expriment une opinion favorable, mais ont tendance à introduire des biais à son encontre lorsqu’ils améliorent des publications rédigées par des humains sur ce sujet ».

Ensuite, ils ont appliqué un modèle mathématique établi [PDF] en 1990 pour simuler les réseaux d’influences interpersonnelles et leurs influences sur les opinions individuelles à la dynamique des opinions influencée par l’IA. C’est cette simulation mathématique qui montre de façon théorique que ce genre de fonctionnalités peut amplifier le biais introduit par la modification du texte via l’IA générative.

Ensuite, ils ont simulé le problème sur de vieilles données puisées en 2012 dans Twitter, Facebook et Google+ (oui, ce réseau social a existé, rappelez-vous) avec le modèle gemma-3-12b-it de Google et en prenant le thème de l’avortement. Ainsi, dans leur simulation, avec une population plutôt anti-avortement mais des suggestions générées par IA, l’opinion devient plutôt pro-choix (alors qu’elle reste anti-avortement sans les suggestions).

Le prompt de Grok influence sans en avoir l’air

Enfin, ils ont étudié plus finement la fonction réellement implémentée sur X « explique ce message ». En effet, l’entreprise d’Elon Musk a publié le prompt qui guide son IA pour cette fonctionnalité. Simplement en le lisant, il est impossible d’affirmer qu’il biaise la discussion sur le sujet de l’avortement.

Mais en utilisant ce prompt avec grok-4-1-fast-reasoning via l’API officielle, les chercheuses et chercheurs ont observé que la majorité des affirmations générées par Grok étaient anti-avortement, « une large portion [était] neutre »  et que seulement 4 % étaient pro-avortement. Pourtant, quand ils ont fait la même expérience sans le prompt, ils n’ont observé « ni biais en faveur ni biais en défaveur statistiquement significatifs […] ce qui fait de ces directives un choix de conception déterminant, responsable du biais anti-avortement de Grok dans les affirmations contextuelles qu’il génère ».

Interrogée par le Guardian, l’une des autrices de l’étude, Sandra Wachter, compare les effets de l’introduction des biais des IA génératives dans les réseaux sociaux à « la pollution de la forêt ». « Le prix à payer, c’est que nous prenons pour vraies les opinions des autres alors qu’elles ne reflètent pas leur pensée réelle », affirme-t-elle :

« Le langage est l’un des éléments qui font de nous des êtres humains, et tout à coup, un intermédiaire s’immisce dans ce processus. L’IA s’impose comme gardienne de la connaissance et de la compréhension. »

  •  
❌