# Modération des commentaires par IA sur WordPress : pièges et bonnes pratiques

> Trier automatiquement les commentaires toxiques ou indésirables avec une IA soulage la modération, mais mal calibrée, elle censure aussi des avis légitimes. Voici comment doser.

- Auteur : Clément Hadrot
- Publié le : 2024-01-16
- Mis à jour le : 2024-01-16
- Catégorie : IA &amp; MCP
- URL : https://wpmoderne.dev.wordpress-developpement.fr/ia-mcp/moderation-commentaires-ia-wordpress/

## L’essentiel

- L'IA de modération classe, elle ne doit jamais décider seule de la suppression
- Les faux positifs pèsent lourd sur un site à trafic modéré
- Une file d'attente humaine reste indispensable pour les cas ambigus

Akismet filtre le spam sur WordPress depuis des années avec un système de règles et de signaux statistiques éprouvé. La nouveauté qu'apportent les modèles de langage début 2024 se situe ailleurs : au-delà du spam pur, il devient possible de détecter automatiquement le ton agressif, les propos haineux ou le hors-sujet dans un commentaire, des cas que les filtres traditionnels basés sur des listes de mots interdits gèrent mal. Cette capacité intéresse particulièrement les sites à forte audience, où la modération manuelle de chaque commentaire devient impraticable.

Mais automatiser cette étape comporte un risque spécifique : la censure de commentaires légitimes mais mal formulés, ou traitant de sujets sensibles sans intention malveillante. Cet article détaille une approche qui exploite l'IA sans lui laisser la décision finale.

## Où s'insère la vérification dans le cycle WordPress

Le hook `comment_post` se déclenche juste après l'enregistrement d'un commentaire, avant sa publication effective si la modération est activée. C'est le point d'entrée naturel pour déclencher une analyse : le contenu du commentaire est envoyé à l'API de modération, et le résultat détermine le statut appliqué au commentaire via `wp_set_comment_status()`.

```
add_action( 'comment_post', 'mon_extension_analyser_commentaire', 10, 2 );

function mon_extension_analyser_commentaire( $comment_id, $comment_approved ) {
    $commentaire = get_comment( $comment_id );
    $score = mon_extension_appel_moderation( $commentaire->comment_content );

    if ( is_wp_error( $score ) ) {
        return; // en cas d'échec de l'API, on laisse le statut par défaut
    }

    if ( $score['toxicite'] > 0.8 ) {
        wp_set_comment_status( $comment_id, 'spam' );
    } elseif ( $score['toxicite'] > 0.4 ) {
        wp_set_comment_status( $comment_id, 'hold' );
    }
}
```

Ce découpage en trois zones — rejet automatique au-delà d'un seuil très élevé, mise en attente pour les cas intermédiaires, publication directe en dessous — limite le risque de censure abusive tout en absorbant une bonne partie de la charge de modération.

## Le vrai risque : les faux positifs

Un commentaire qui critique vivement un produit, qui emploie de l'ironie, ou qui aborde un sujet sensible avec un vocabulaire cru mais légitime, peut obtenir un score de toxicité élevé sans être réellement problématique. Sur les tests menés sur plusieurs sites clients, le taux de faux positifs observé sur une modération entièrement automatique, sans validation humaine des cas limites, se situe généralement entre cinq et quinze pour cent selon la tonalité habituelle des commentaires du site.

> L'essentiel à retenir : L'IA de modération classe, elle ne doit jamais décider seule de la suppression ; Les faux positifs pèsent lourd sur un site à trafic modéré ; Une file d'attente humaine reste indispensable pour les cas ambigus

Ce taux, appliqué à un site qui reçoit plusieurs centaines de commentaires par mois, représente un nombre non négligeable de contributeurs légitimes silencieusement mis en attente ou rejetés sans explication. C'est ce point qui justifie de ne jamais confier la décision finale de rejet définitif à l'IA seule, en particulier sur les scores intermédiaires.

## Une file d'attente humaine pour les cas ambigus

Plutôt que de tout rejeter ou tout publier automatiquement selon un seuil unique, une modération efficace place les commentaires au score intermédiaire dans la file d'attente standard de WordPress, visible depuis l'écran **Commentaires** de l'administration, avec le score affiché en méta-information pour aider le modérateur humain à prioriser. L'IA agit alors comme un système de tri qui accélère le travail humain, sans jamais s'y substituer entièrement.

- Rejet automatique réservé aux cas extrêmes, sans ambiguïté possible (spam évident, contenu manifestement haineux)
- Mise en attente pour modération humaine sur tous les cas intermédiaires
- Publication directe pour les scores faibles, avec possibilité de signalement a posteriori
- Conservation du score dans les métadonnées du commentaire pour affiner les seuils dans le temps

> Une modération automatique qui ne se trompe jamais n'existe pas ; l'objectif est de rendre les erreurs récupérables, pas de les éliminer.

## En résumé

La modération de commentaires par IA apporte un vrai soulagement sur les sites à volume important, en particulier pour détecter les tons agressifs que les filtres traditionnels laissent passer. Mais son efficacité dépend entièrement du dosage des seuils et du maintien d'une file de validation humaine pour les cas ambigus. Automatiser entièrement la décision, sans zone intermédiaire, expose à une censure silencieuse de commentaires légitimes qui finit par nuire à la vitalité des échanges sur le site.
