Sur 56 centres d'aide d'éditeurs SaaS français mesurés le 28 septembre 2026, 47 pages sur 48 lues se lisent sans JavaScript, et aucun des 42 robots.txt exploitables ne bloque les principaux robots d'IA. Les centres d'aide sont donc ouverts aux robots d'IA. Ce qui les prépare vraiment, comme un llms.txt, dépend surtout de la plateforme choisie.
Nous avons testé sept points sur chaque centre d'aide, avec de simples requêtes HTTP. Cet article donne les résultats avec leur effectif, la méthode et ses limites, puis ce que vous pouvez en tirer pour votre propre documentation. Les résultats sont agrégés, aucun éditeur n'est nommé.
En bref · cinq chiffres résument la mesure.
- 47 sur 48 (98 %) des pages lues contiennent leur texte dans le HTML brut, sans JavaScript.
- 0 sur 42 robots.txt exploitables ne bloque GPTBot, ClaudeBot, Google-Extended, PerplexityBot ou CCBot.
- 28 sur 51 (55 %) exposent un llms.txt, dont 26 sur 29 des centres d'aide GitBook et seulement 2 sur 22 des autres plateformes.
- 7 sur 7 centres d'aide Zendesk ont répondu à notre requête par un contrôle anti-robot (HTTP 403).
- 14 sur 48 (29 %) affichent un widget de chat dans leur HTML, et 5 sur 29 des centres GitBook ont une recherche IA activée.
Sommaire
Résultats par plateforme
Plus de la moitié de l'échantillon (29 centres sur 56, soit 52 %) tourne sur GitBook. Viennent ensuite Zendesk et Intercom (7 chacun), Crisp (6), Help Scout et Freshdesk (3 chacun) et Notion (1).
Le tableau ci-dessous donne, pour chaque plateforme, le nombre de centres où la mesure est positive sur le nombre de centres où elle a pu être faite.
| Plateforme | Centres | Texte lisible sans JavaScript | llms.txt | Widget de chat |
|---|---|---|---|---|
| GitBook | 29 | 29 sur 29 | 26 sur 29 | 0 sur 29 |
| Intercom | 7 | 7 sur 7 | 2 sur 2 (5 centres sur un hôte partagé, non mesurables) | 7 sur 7 |
| Zendesk | 7 | non mesurable (7 contrôles anti-robot) | 0 sur 7 | non mesurable |
| Crisp | 6 | 6 sur 6 | 0 sur 6 | 6 sur 6 |
| Help Scout | 3 | 3 sur 3 | 0 sur 3 | 1 sur 3 |
| Freshdesk | 3 | 2 sur 2 (1 accueil en erreur 404) | 0 sur 3 | 0 sur 2 |
| Notion | 1 | 0 sur 1 | 0 sur 1 | 0 sur 1 |
| Total | 56 | 47 sur 48 | 28 sur 51 | 14 sur 48 |
Une remarque évite les fausses lectures. Ces chiffres décrivent surtout des choix de plateforme, pas des décisions d'éditeurs. Un centre GitBook expose un llms.txt parce que GitBook le génère, un centre Crisp affiche un chat parce que Crisp l'intègre.
47 pages sur 48 se lisent sans JavaScript
Le texte d'un article d'aide est présent dans le HTML brut pour 47 pages lues sur 48 (98 %). Une requête HTTP simple, sans navigateur, suffit donc à récupérer le contenu de presque tous les centres d'aide de l'échantillon.
Pour 41 de ces 47 pages, le corps de l'article dépasse 500 caractères de texte visible. Les 6 autres sont des articles courts (entre 100 et 499 caractères) que nous avons vérifiés à la main. Ce sont de vrais articles rendus côté serveur, par exemple une vidéo accompagnée de deux phrases, pas des coquilles JavaScript vides.
La seule page illisible est un espace Notion, dont l'accueil ne contient que 6 caractères de texte dans le HTML brut. Ce cas unique ne dit rien de Notion en général, il rappelle seulement qu'un site construit entièrement par JavaScript ne se lit pas avec une requête simple.
Le cas des 7 centres Zendesk
Sur 7 centres Zendesk, 7 ont répondu HTTP 403 à notre requête, avec une page de vérification anti-robot (« Just a moment » ou « Security check », typique d'un contrôle de type Cloudflare). Nous n'avons donc pas pu lire d'article sur ces sept centres.
Attention à l'interprétation. Notre requête utilisait un agent utilisateur honnête, sans navigateur. Nous ne savons pas comment ces centres traitent GPTBot ou ClaudeBot avec leurs propres adresses IP. Nous constatons seulement qu'un client HTTP ordinaire reçoit une page de contrôle et non le contenu.
Les autres échecs sont rares. Un accueil Freshdesk a répondu 404 (soit 1 sur 56) et 5 centres sur 56 hébergés sur un domaine Intercom partagé n'ont pas pu être mesurés pour le robots.txt et le llms.txt, comme expliqué plus bas.
0 robots.txt sur 42 ne bloque les robots d'IA
Aucun des 42 robots.txt exploitables n'interdit tout le site (Disallow: /) à GPTBot, ClaudeBot, Google-Extended, PerplexityBot ou CCBot, ni par une règle nommée, ni par la règle générale User-agent: *. Ces cinq robots peuvent donc, sur le plan de robots.txt, lire l'intégralité de ces centres d'aide.
Nous avons mesuré 51 hôtes. Les 5 centres hébergés sur le domaine partagé d'Intercom sont exclus, car le robots.txt de ce domaine appartient à la plateforme et non à l'éditeur.
| Robot | Bloque tout le site | Autorise | Pas de robots.txt exploitable |
|---|---|---|---|
| GPTBot | 0 | 42 | 9 |
| ClaudeBot | 0 | 42 | 9 |
| Google-Extended | 0 | 42 | 9 |
| PerplexityBot | 0 | 42 | 9 |
| CCBot | 0 | 42 | 9 |
Les 9 hôtes sans fichier exploitable se répartissent ainsi. 5 ont répondu 404, 3 ont renvoyé une page HTML à la place du fichier et 1 n'a pas répondu dans les 15 secondes. Sans fichier, rien n'est interdit.
Un détail ressort. Sur 26 des 42 fichiers (62 %), tous sur GitBook, la ligne Content-Signal: ai-train=yes, search=yes, ai-input=yes est présente. C'est un réglage par défaut de la plateforme, pas un choix de l'éditeur, et il déclare l'inverse d'un blocage.
Ce que ces documents disent des robots eux-mêmes se trouve à la source. OpenAI décrit GPTBot comme le robot qui collecte du contenu pour entraîner ses modèles, et précise que les sites peuvent l'exclure par robots.txt. Anthropic distingue trois robots (ClaudeBot pour l'entraînement, Claude-User et Claude-SearchBot). Selon la documentation de Google, le jeton Google-Extended contrôle l'usage du contenu pour Gemini et n'affecte pas le classement dans la recherche.
Notre test porte sur le blocage total. Nous n'avons pas analysé les blocages partiels par dossier, et nous ne testons pas Claude-User ni Claude-SearchBot.
28 centres d'aide sur 51 exposent un llms.txt
28 hôtes sur 51 (55 %) servent un fichier llms.txt en texte ou en Markdown à la racine. Hors GitBook, la proportion tombe à 2 sur 22 (9 %).
Le llms.txt est une proposition de Jeremy Howard, publiée en septembre 2024. Le fichier est un document Markdown qui contient un titre, un résumé et des liens vers les pages utiles. Ce n'est pas une norme, et nous n'avons pas mesuré si les moteurs d'IA l'utilisent.
La répartition est très tranchée.
- GitBook avec 26 fichiers sur 29. Tous ont la même structure (titre, sections, liens vers les versions Markdown des pages), ce qui indique une génération automatique par la plateforme.
- Intercom sur domaine propre avec 2 fichiers sur 2. Les 5 centres sur le domaine partagé ne sont pas mesurables.
- Zendesk, Crisp, Help Scout, Freshdesk et Notion avec 0 fichier sur 20. Chez Zendesk, un des sept hôtes a répondu 403 au lieu de 404.
Nous avons compté un fichier comme valide s'il répondait HTTP 200 avec du texte brut ou du Markdown. Une page d'erreur HTML ne compte pas.
14 centres sur 48 affichent un chat, 5 GitBook sur 29 une recherche IA
14 pages lues sur 48 (29 %) contiennent un widget de chat dans leur HTML. Ce sont 7 Intercom Messenger, 6 Crisp et 1 Help Scout Beacon. Les 34 autres pages n'en contiennent aucun.
Là encore, la plateforme décide. Le widget est présent sur 7 centres Intercom sur 7 et 6 centres Crisp sur 6, aucun sur les 29 centres GitBook et sur les 2 Freshdesk lus. Nous ne mesurons pas ici les widgets chargés par un gestionnaire de balises, ni ceux qui apparaissent après un clic.
Un point que le HTML ne montre pas. Nous ne pouvons pas savoir si Intercom Fin est activé, ni ce qu'un widget Crisp ou Zendesk répond derrière son bouton. Pour Intercom, nous rapportons seulement « Messenger présent ».
Pour GitBook, la page expose un paramètre aiMode dans ses données. Il vaut none sur 24 centres sur 29 et search (que nous lisons comme le mode de recherche IA) sur 5 sur 29 (17 %). Aucun centre GitBook n'a le mode assistant.
Autrement dit, la grande majorité de ces éditeurs propose encore à ses utilisateurs une recherche par mots-clés ou un widget de contact, pas une réponse rédigée à partir de leur documentation. C'est l'espace qu'occupe un assistant comme celui décrit dans notre article sur le chatbot IA pour éditeur SaaS.
Méthodologie et limites
Nous avons voulu une mesure reproductible plutôt qu'une opinion. Voici comment l'échantillon a été construit et ce qui a été testé.
L'échantillon
L'échantillon compte 56 centres d'aide ou documentations publiques d'éditeurs SaaS français. Ils ont été repérés par des recherches Google sur les domaines des plateformes de documentation (GitBook, Intercom, Zendesk, Crisp, Help Scout, Freshdesk, Notion), en ne gardant que des éditeurs français avec une documentation utilisateur publique.
Nous visions environ 50 centres. Nous avons gardé l'effectif réel de 56, sans complément ni sélection après coup.
Les mesures
Toutes les requêtes ont été faites le 28 septembre 2026 avec curl, l'agent utilisateur Mozilla/5.0 (compatible; HeeyaStudy/1.0; +https://heeya.fr), un délai maximal de 15 secondes et le suivi des redirections. Elles ont été envoyées une par une, avec une seconde de pause entre chaque, soit 228 requêtes au total.
- Plateforme, déduite du domaine et des signatures HTML.
- Statut HTTP de l'accueil et d'un article, choisi parmi les liens de la page d'accueil (ou d'une rubrique).
- Lisibilité sans JavaScript, au moins 500 caractères de texte visible dans la balise main ou article du HTML brut. Entre 100 et 499, la page est classée article court.
- robots.txt de l'hôte, lu par robot, avec la règle nommée puis la règle générale.
- llms.txt à la racine de l'hôte, valide si HTTP 200 et contenu texte ou Markdown.
- Widget de chat et paramètre
aiModede GitBook, cherchés dans le HTML de l'accueil et de l'article. - Langue, déduite de la balise de langue, des balises hreflang et du texte de l'article.
Les limites
Six limites sont à garder en tête avant de citer ces chiffres.
- Biais de sélection. Ce sont des éditeurs repérés par des recherches sur les plateformes de documentation, et qui ont une documentation publique. Ils ne représentent pas tous les éditeurs SaaS français.
- Un seul instantané. Une seule mesure, à une seule date, sans suivi dans le temps.
- Une page par centre. Nous avons lu un article par centre, pas l'ensemble du site.
- HTML brut uniquement. Fin, les widgets chargés par script différé et les réglages internes n'y sont pas visibles.
- Hôtes partagés ou filtrés. 5 centres Intercom sur domaine partagé n'ont pas de robots.txt ni de llms.txt mesurables, et 7 centres Zendesk ont répondu par un contrôle anti-robot.
- Blocage total seulement. Nous ne détectons pas les interdictions partielles de dossiers.
Une mesure est restée trop fragile pour avoir sa section, la langue. Elle est indéterminée pour 11 centres sur 56 (aucune page lue, ou article trop court). Elle donne 41 centres en français et 4 bilingues sur les 45 où elle est mesurable, aucun en anglais seul.
Ce que cela change pour vous
Quatre décisions ressortent de la mesure. Aucune ne demande de gros chantier.
Servir du vrai HTML
Faites le test que nous avons fait. Ouvrez un article, affichez le code source (ou lancez curl -sL sur l'adresse) et cherchez une phrase du texte. Si elle n'y est pas, votre centre d'aide dépend de JavaScript, et tout outil qui lit le HTML statique ne verra rien. C'est le cas d'un import par URL, comme celui de Heeya, qui récupère le HTML sans exécuter de script.
Décider sa politique robots.txt pour les robots d'IA
Aucun éditeur de l'échantillon n'a bloqué ces robots. Nous ne savons pas si c'est un choix ou une absence de choix. Décidez-le en connaissance de cause, robot par robot, selon ce que vous voulez permettre (entraînement, recherche, réponse à la demande d'un utilisateur). Et si un pare-feu ou un CDN filtre les robots, vérifiez qu'il ne bloque pas ceux que vous autorisez.
Envisager un llms.txt
Si vous êtes sur GitBook, vous en avez probablement déjà un. Sinon, ce fichier reste facile à produire, à condition de le maintenir aligné avec votre documentation. Ce n'est pas un standard et son effet n'est pas mesuré ici, ne lui accordez pas plus de temps qu'à vos titres, vos liens internes et vos données structurées (voir notre guide sur le schema.org FAQ et HowTo).
Garder une seule source de vérité
Votre centre d'aide sert vos utilisateurs, mais aussi les assistants qui s'en nourrissent. Une seule version à jour, avec une date de mise à jour visible sur chaque article, évite qu'un assistant cite une procédure périmée. Pour la rédaction, notre article sur la base de connaissances IA détaille la méthode, et le comparatif des logiciels de centre d'aide aide à choisir la plateforme.
Si vous voulez tester un assistant sur cette documentation, la page chatbot documentation produit explique comment Heeya s'appuie sur vos pages, vos PDF et vos fichiers Word. Le plan Gratuit permet un premier essai, les tarifs détaillent les autres plans.
FAQ centres d'aide SaaS, robots.txt et llms.txt
Combien de centres d'aide SaaS ont un llms.txt ?
Dans notre mesure du 28 septembre 2026 sur 56 centres d'aide d'éditeurs SaaS français, 28 hôtes sur 51 mesurables (55 %) servent un llms.txt. Ce sont 26 centres GitBook sur 29 et 2 centres Intercom sur domaine propre. Aucun des 20 centres Zendesk, Crisp, Help Scout, Freshdesk ou Notion n'en a un.
Faut-il bloquer GPTBot dans le robots.txt de son centre d'aide ?
Cela dépend de ce que vous voulez permettre. Selon OpenAI, GPTBot collecte du contenu pour entraîner ses modèles et peut être exclu par robots.txt. Dans notre échantillon, 0 robots.txt sur 42 le bloque. Décidez robot par robot, en sachant que Google indique que Google-Extended n'affecte pas le classement dans la recherche.
Un centre d'aide doit-il être lisible sans JavaScript ?
Oui, si vous voulez que les outils qui lisent le HTML statique trouvent votre texte. Dans notre étude, 47 pages lues sur 48 (98 %) contiennent leur contenu dans le HTML brut. La seule exception est un espace Notion dont l'accueil ne contient que 6 caractères de texte.
Qu'est-ce qu'un llms.txt ?
C'est une proposition de Jeremy Howard, publiée en septembre 2024, qui consiste à placer à la racine d'un site un fichier Markdown avec un titre, un résumé et des liens vers les pages utiles, pour aider les IA à s'y retrouver. Ce n'est pas une norme, et nous n'avons pas mesuré si les moteurs d'IA l'utilisent.
Comment tester son centre d'aide comme dans cette étude ?
Lancez curl sur un article et cherchez une phrase du texte dans la réponse. Ouvrez ensuite /robots.txt et /llms.txt à la racine de l'hôte, et cherchez les lignes User-agent de GPTBot, ClaudeBot, Google-Extended, PerplexityBot et CCBot. Faites-le avec un agent utilisateur explicite, une requête à la fois.
Un assistant IA peut-il répondre à partir de mon centre d'aide ?
Oui, si le texte de vos pages est présent dans le HTML. Heeya importe des pages web publiques par leur URL (récupération de HTML statique, donc les pages construites par JavaScript ne sont pas lues), ainsi que des PDF et des fichiers Word, puis répond à partir du contenu importé. Le plan Gratuit permet de tester, avec 20 000 caractères d'IA.
Conclusion
Les centres d'aide des éditeurs SaaS français sont lisibles et ouverts, presque par défaut. 47 pages sur 48 se lisent sans JavaScript, aucun robots.txt n'écarte les robots d'IA, et l'existence d'un llms.txt dépend surtout de la plateforme. Ce qui manque encore, ce sont des décisions prises en connaissance de cause et un assistant qui exploite cette documentation.
Pour aller plus loin
- Logiciel de centre d'aide, comparatif GitBook, Zendesk, Intercom, Crisp
- Base de connaissances IA, bien écrire sa documentation
- Chatbot IA pour éditeur SaaS, onboarding et support
- Schema.org FAQ et HowTo pour les AI Overviews
- Tarifs Heeya
Importez l'adresse d'un article de votre centre d'aide et posez-lui vos questions les plus fréquentes.
Créer mon agent gratuitement Voir les tarifs