Aller au contenu
Business Process Outsourcing
Actualités

Faut-il autoriser PerplexityBot dans son fichier robots.txt ?

perplexitybot-robots
Par Setraniaina Andrianajason Publié le 6 août 2026
5 min de lecture
Partager

Beaucoup de fichiers robots.txt ont été écrits en 2023, quand bloquer les robots d’intelligence artificielle passait pour une précaution raisonnable. Trois ans plus tard, la plupart n’ont jamais été rouverts.

Perplexity a clarifié sa position en juillet 2026 : PerplexityBot ne récupère plus le contenu, complet ou partiel, d’une page dont l’exploration est interdite. La question n’est donc plus de savoir si le robot obéit, mais ce qu’une entreprise perd en lui fermant la porte.

L’arbitrage mérite d’être posé, plutôt qu’hérité.

En bref

PerplexityBot n’exploite plus le contenu d’une page interdite dans robots.txt, mais le nom de domaine, le titre et un bref résumé factuel peuvent subsister. Perplexity indique ne pas construire de modèle de fondation : bloquer son robot ne protège donc pas contre un entraînement. Le blocage par répertoire reste préférable au blocage global.

 

Ce que Perplexity s’engage à faire

La documentation de la plateforme pose quatre points. PerplexityBot n’indexe pas le contenu textuel, complet ou partiel, d’un site qui l’interdit. Une page bloquée peut conserver son nom de domaine, son titre et un bref résumé factuel. La possibilité de demander un résumé direct d’une URL bloquée a été désactivée pour éviter les abus. Perplexity indique enfin ne pas construire de modèles de fondation, ce qui exclut tout pré-entraînement.

Ce dernier point sépare deux sujets régulièrement confondus. Une entreprise qui bloque pour empêcher l’entraînement d’un modèle bloque, dans ce cas précis, un robot de recherche. Elle perd des citations sans rien protéger.

Ce que le blocage retire réellement

Interdire PerplexityBot retire les pages concernées des réponses de la plateforme. Pas partiellement.

Une recherche conduite par les universités Rutgers et Wharton, publiée en décembre 2025, chiffre l’effet global : les éditeurs qui bloquent les robots d’intelligence artificielle ont vu leur trafic total reculer de 23,1 %, sans réduction fiable de leur taux de citation. L’échantillon dépasse le seul cas de Perplexity, mais la logique vaut pour l’ensemble des robots de recherche générative.

Le raisonnement rejoint celui déjà appliqué à l’accessibilité des sites aux agents IA : un contenu qu’une machine ne peut pas lire n’existe pas pour elle.

Une règle de décision par répertoire

Objectif poursuivi Décision recommandée
Maximiser la visibilité générative Autoriser PerplexityBot sur l’ensemble du site
Protéger un contenu payant ou premium Interdire les répertoires concernés, pas le domaine
Empêcher l’entraînement d’un modèle Viser les robots d’entraînement, distincts des robots de recherche

 

Le blocage global se révèle rarement justifié. Le blocage par répertoire protège les archives payantes tout en laissant les pages d’acquisition éligibles à la citation. Ce découpage suppose une architecture d’URL propre, ce qui n’est pas toujours le cas sur les sites anciens.

La limite du fichier robots.txt

Un rappel utile avant de trancher : robots.txt est une consigne, pas un mur.

Perplexity documente deux agents. PerplexityBot alimente l’index. Perplexity-User récupère une page à la demande d’un utilisateur, et la plateforme a défendu la position selon laquelle ce second agent, déclenché par une personne, n’est pas tenu de suivre robots.txt. Cloudflare a publié en août 2025 un rapport sur des explorations non déclarées, avec rotation d’identifiants et d’adresses IP.

Une protection effective se joue au niveau du serveur ou du pare-feu applicatif. Le fichier robots.txt exprime une politique, il ne l’applique pas.

Trois questions avant de refermer le fichier

Quelles pages ont intérêt à être citées ? Lesquelles doivent rester fermées ? La configuration actuelle correspond-elle à ces réponses ?

Un fichier antérieur à 2024 répond presque toujours non à la troisième. Le sujet croise celui de la manière dont les internautes cherchent désormais l’information.

 

Sources et références

La position officielle est documentée dans le centre d’aide de Perplexity consacré au traitement de robots.txt, qui précise le sort des pages bloquées, la désactivation du résumé d’URL et le recours à des explorateurs partenaires. La recherche menée par Rutgers et Wharton en décembre 2025 est reprise par Pixis dans son audit des configurations robots.txt. Le rapport Cloudflare d’août 2025 et la distinction entre PerplexityBot et Perplexity-User sont analysés par Soar Agency. Une matrice de décision robot par robot est proposée par Digital Applied, et le cadre technique du fichier reste celui défini par la norme RFC 9309 sur le protocole d’exclusion des robots.

FAQ : PerplexityBot, robots.txt et visibilité générative

Bloquer PerplexityBot empêche-t-il l’entraînement d’un modèle ?

Non. Perplexity indique ne pas construire de modèles de fondation, donc son robot de recherche ne sert pas au pré-entraînement. Le blocage retire les pages des réponses sans protéger sur ce terrain.

Une page bloquée disparaît-elle totalement de Perplexity ?

Pas totalement. Le nom de domaine, le titre et un bref résumé factuel peuvent subsister. Le contenu de la page, lui, n’est plus exploité.

Peut-on encore faire résumer une URL bloquée ?

Non, cette fonction a été désactivée pour éviter les abus. PerplexityBot n’explore désormais que les contenus conformes au fichier robots.txt.

Faut-il bloquer tout le site ou certains répertoires ?

Le blocage par répertoire convient dans la plupart des cas. Il protège les contenus payants tout en laissant les pages d’acquisition éligibles aux citations.

Le fichier robots.txt suffit-il à protéger un contenu sensible ?

Non, c’est une consigne que le robot choisit de suivre. Pour un contenu réellement sensible, la protection passe par le serveur, le pare-feu applicatif ou une authentification.

Par Setraniaina Andrianajason

Je suis Setraniaina, fondateur de LAPLUME.MG et consultant SEO/GEO indépendant via Red Island SEO, depuis Madagascar. Passionné de nouvelles technologies, d'IA et de marketing digital, je partage sur ExternFlow mes analyses sur l'externalisation, le BPO et le référencement.

Dernières actualités

Restez connectés avec ExternFlow