Un site peut accueillir des visiteurs, des moteurs de recherche et des agents IA sans pour autant laisser ses contenus, ses comptes clients ou ses stocks à la disposition de n’importe quel robot. C’est tout l’enjeu de l’« open web » : rester accessible, sans transformer chaque page en libre-service. L’état des lieux 2026 publié par DataDome souligne l’urgence du sujet : le trafic des bots malveillants a augmenté de 124 % en un an, soit neuf fois plus vite que le trafic humain. Pourtant, près de deux sites testés sur trois ne bloquent aucun des bots évalués.
Le problème dépasse le simple pillage de contenus. Les bots ciblent aussi les connexions, les créations de comptes, les paniers et les paiements, tandis que des agents IA légitimes peuvent apporter des visiteurs intéressés. Pour une boutique en ligne, un média ou une PME, la bonne question n’est donc pas seulement « faut-il bloquer les bots ? », mais qui accède à quoi, dans quel but et avec quel niveau de vérification. Les chiffres de DataDome, issus de plus de 1 000 milliards de requêtes et de tests sur plus de 20 000 sites, donnent des repères concrets pour reprendre la main sans fermer la porte aux usages utiles.
En bref
-
Le trafic des bots malveillants a progressé de 124 % en douze mois, tandis que le scraping représente 71 % du trafic malveillant observé par DataDome.
-
Un nom de bot ou un user-agent ne suffit pas à prouver l’identité d’un crawler : certains se déguisent en agents IA connus.
-
Les pages de connexion, de création de compte et de paiement nécessitent des contrôles plus stricts que les pages publiques.
-
Le fichier robots.txt indique une préférence, mais ne bloque pas les robots qui choisissent de l’ignorer.
-
La première étape consiste à mesurer le trafic automatisé, puis à sécuriser les zones sensibles avec des mesures adaptées.
Bots IA sur les sites web : distinguer le scraping des usages utiles
Le mot « bot » recouvre des comportements très différents. Un crawler qui parcourt des pages publiques pour indexer ou résumer des contenus n’a pas le même impact qu’un outil qui copie des milliers de fiches produits, teste des mots de passe volés ou rafle des articles en édition limitée.
Dans l’étude de DataDome, le scraping représente 71 % du trafic de bots malveillants, avec une hausse de 185,2 % sur la période analysée. Les crawlers déclarés de grands acteurs de l’IA sont, eux, identifiables dans les données : 52,7 milliards de requêtes d’agents IA et de crawlers LLM ont été recensées sur douze mois. Ces volumes ne permettent toutefois pas de confondre trafic annoncé et trafic abusif : une part importante des agents ne s’identifie pas correctement, et certains usurpent même l’identité de robots connus.
Imaginez une boutique de chaussures. Un agent qui compare trois modèles pour aider une personne à choisir peut apporter une visite qualifiée. Un robot qui aspire 50 000 fiches en une heure, ou tente de réserver des dizaines d’exemplaires d’une édition limitée, fait peser un coût sur le site et ses clients. Le rythme, la quantité de pages consultées et l’action visée comptent autant que l’étiquette affichée par le bot.
|
Type de bot ou d’activité |
Ce qu’il fait |
Risque principal |
|---|---|---|
|
Scraper |
Extrait automatiquement des contenus à grande échelle |
Copie de données, surcharge, perte de contrôle éditorial |
|
Credential stuffing |
Teste des couples identifiant-mot de passe volés |
Prise de contrôle de comptes et fraude |
|
Scalper |
Achète rapidement des articles rares pour les revendre |
Stocks captés et expérience client dégradée |
|
Agent IA légitime |
Explore des pages ou agit pour un utilisateur |
Risque variable selon les accès et les actions autorisées |
Pour faire la différence, les équipes peuvent croiser plusieurs signaux : signature numérique, plages d’adresses IP, DNS inversé, fréquence des requêtes et comportement sur le site. Le nom annoncé dans le user-agent, à lui seul, n’est pas une carte d’identité fiable.
Cette distinction devient encore plus importante lorsque les agents IA ne se contentent plus de lire une page, mais se connectent au nom d’un utilisateur.
Protéger les pages de connexion contre les bots IA et le credential stuffing
Les pages de connexion sont devenues une cible majeure. Selon les mesures de DataDome, les requêtes mensuelles de bots IA vers ces pages sont passées de 11,9 millions en janvier à 99,7 millions en juin 2026. Les connexions représentent désormais 51,7 % du trafic IA dirigé vers des pages sensibles, contre 23 % l’année précédente.
Pourquoi cette concentration ? Les attaquants automatisent le credential stuffing, c’est-à-dire l’essai massif de mots de passe déjà compromis sur différents services. Mais des agents légitimes peuvent aussi se connecter pour réaliser une tâche à la demande d’un client. Un identifiant correct ne garantit donc pas une intention fiable : il faut observer ce qui se passe pendant la session, puis après l’authentification.
Une PME peut commencer par des mesures simples et utiles : imposer une authentification multifacteur, limiter les tentatives répétées, repérer les connexions inhabituelles et empêcher l’utilisation de mots de passe déjà exposés. Il est également pertinent de surveiller les créations de comptes et les changements soudains de comportement après connexion. Les contrôles doivent se renforcer au moment où l’accès donne davantage de pouvoir au visiteur.
Les fuites de données alimentent directement ces campagnes. DataDome rapporte 43,4 millions de comptes piratés en France entre janvier et juin 2026, tandis que les identifiants compromis peuvent être réutilisés sur d’autres sites. Le mécanisme est connu : une fuite fournit des listes, puis des scripts testent ces combinaisons à grande échelle. Une protection efficace ne peut donc pas reposer uniquement sur le secret du mot de passe.
Bloquer les bots IA sans fermer l’accès aux agents utiles
Tout bloquer peut sembler rassurant, mais ce choix risque aussi de couper des visites qui ont une réelle valeur. Entre janvier et juin 2026, DataDome a mesuré 89,4 millions de visites redirigées depuis des assistants IA vers les sites de ses clients, dont 83,4 % depuis ChatGPT. Ces visiteurs peuvent arriver avec une intention claire, par exemple comparer un produit ou trouver une information précise.
À l’inverse, laisser passer chaque requête au nom de l’ouverture expose les sites au scraping, à la fraude et aux abus de stock. La stratégie la plus solide consiste à définir une politique d’accès graduée : quelles catégories d’agents sont autorisées, sur quelles pages, à quel rythme et pour quelles actions ? Un catalogue public peut rester accessible à certains agents, tandis qu’un compte client ou un paiement exige une vérification renforcée et un lien avec un utilisateur réel.
Des solutions comme les pare-feu applicatifs (WAF) ou les outils de gestion des bots permettent d’analyser des signaux techniques et comportementaux. Les règles de serveur peuvent compléter ces dispositifs, mais elles doivent être testées : un filtre trop large risque de bloquer de vrais clients, tandis qu’une règle fondée uniquement sur le nom déclaré du robot se contourne facilement.
La hausse de 82 % du trafic lié à l’IA rapportée par DataDome mêle usages utiles et nuisibles. L’objectif n’est donc pas d’opposer ouverture et sécurité, mais de contrôler les accès en fonction de leur impact. Cela vaut aussi pour les serveurs MCP, qui connectent des agents IA aux services d’une entreprise : s’ils sont exposés, ils doivent être surveillés et protégés comme les API et les pages sensibles.
Un agent qui consulte un catalogue public n’a pas besoin des mêmes autorisations qu’un agent qui lit des données personnelles ou déclenche un achat. Plus l’action peut affecter un compte, un paiement ou un stock, plus l’identité et le comportement doivent être vérifiés.
Robots.txt, WAF et règles serveur : quelles protections contre les bots ?
Le fichier robots.txt reste utile pour publier les consignes destinées aux crawlers coopératifs. Il peut préciser quelles zones ne doivent pas être explorées, mais il ne constitue pas une barrière technique : un bot malveillant peut l’ignorer. Il ne protège ni une page de connexion ni un contenu privé.
Les règles côté serveur, les pare-feu applicatifs et les services de gestion des bots apportent des niveaux de contrôle différents. Un site peut combiner ces moyens, à condition de vérifier leur efficacité sur les parcours qui comptent vraiment : connexion, création de compte, formulaires, panier et paiement. Les tests de DataDome montrent le décalage : 65 % des sites évalués n’ont bloqué aucun des dix types de bots testés, et seulement 2,4 % les ont tous arrêtés.
-
Cartographier le trafic : examiner les journaux serveur et les statistiques pour repérer les volumes, les pages ciblées et les pics inhabituels.
-
Protéger les actions sensibles : activer l’authentification multifacteur, limiter les essais de connexion et sécuriser les paiements.
-
Vérifier les agents annoncés : ne pas accorder un accès sur la seule base d’un user-agent comme GPTBot ou ClaudeBot.
-
Tester les règles régulièrement : contrôler qu’elles bloquent les comportements abusifs sans empêcher les visiteurs légitimes d’acheter ou de consulter les contenus.
Pour une petite équipe, l’ordre compte plus que la sophistication. Commencer par comprendre ce qui se passe, puis sécuriser les points les plus sensibles permet d’éviter de déployer une solution coûteuse sans savoir quel problème elle doit résoudre.
Scalping et bots de revente : protéger les stocks et les clients
Le scalping ne concerne plus seulement quelques lancements très médiatisés. DataDome observe une progression de 290,7 % et un volume quotidien médian presque quadruplé. Billetterie, sneakers, consoles, cartes à collectionner et éditions limitées attirent des revendeurs qui automatisent l’achat dès l’ouverture des ventes.
Les outils sont devenus accessibles : certains services de bots sont proposés sans code, parfois avec des proxys résidentiels, et des scripts peuvent être adaptés rapidement. Le phénomène n’est donc plus réservé aux profils techniques. Dans les tests cités par DataDome, 64,2 % des sites de billetterie n’étaient pas protégés contre les bots évalués.
Pour un site marchand, la défense peut combiner file d’attente, plafonds d’achat, surveillance des créations de comptes et analyse des comportements lors d’un lancement. Ces contrôles doivent être calibrés : une limite trop stricte peut frustrer les acheteurs légitimes, mais une vente sans garde-fou laisse les stocks les plus convoités aux automatismes les plus rapides. Une sortie réussie se mesure aussi à la capacité des vrais clients à acheter.
À retenir pour cette semaine : choisissez une page sensible, vérifiez ses protections actuelles et observez les requêtes automatisées qui y arrivent. Ce petit audit donne une base concrète pour décider quoi autoriser, quoi ralentir et quoi bloquer.
Questions fréquentes sur les bots IA et la protection des sites
Le fichier robots.txt suffit-il à bloquer les bots IA ?
Non. Le robots.txt communique des consignes aux crawlers qui choisissent de les respecter, mais un bot malveillant peut les ignorer. Pour contrôler réellement les accès, il faut aussi des mesures techniques côté serveur, un WAF ou une solution de gestion des bots.
Faut-il bloquer tous les crawlers et agents IA ?
Pas nécessairement. Certains agents peuvent générer des visites qualifiées ou rendre des contenus plus accessibles. Définissez une politique selon les pages et les actions : l’accès à un catalogue public peut être différent de l’accès à un compte ou à un paiement.
Comment reconnaître un bot IA malveillant ?
Ne vous fiez pas uniquement au nom déclaré dans le user-agent. Croisez des indices comme la signature numérique, les adresses IP, le DNS inversé, la fréquence des requêtes et les actions réalisées sur le site.
Quelles pages protéger en premier sur un petit site ?
Commencez par la connexion, la création de compte, les formulaires, le panier et le paiement. Activez notamment l’authentification multifacteur, limitez les tentatives répétées et surveillez les comportements inhabituels.