Les IA citent-elles les documents PDF ?
Publié le
Rarement, comparé aux pages web. Chez ChatGPT, les PDF représentent 16 à 21 % des résultats ramenés par ses recherches, mais ils sont cités 2 à 5 fois moins souvent que les autres pages, sur tous nos corpus. Claude ramène très peu de PDF, environ 3 % de ses résultats au plus. Nous n’avons trouvé aucune étude publiée qui mesure la citation des PDF par les IA : ces chiffres sont les nôtres. Un document important publié seulement en PDF a donc moins de chances d’être cité qu’une page web équivalente.
Pour quel type de question ? Tout dépend de la question. Si l’utilisateur cherche un document précis, une norme, une fiche technique ou un rapport, l’IA peut aller le chercher en PDF. Sur une question d’information ou de marché, elle cite plutôt des pages web.
Ce que nous avons mesuré chez ChatGPT
Nous avons compté, dans les résultats ramenés par les recherches de ChatGPT, les adresses de documents PDF, puis la part de ces documents effectivement cités. Les PDF sont nombreux dans ce que ChatGPT trouve : 21 % des résultats sur une dizaine de secteurs en français, 20 % sur ces secteurs en anglais, 19 % sur le dépannage de logiciels, 17 % sur nos questions sur la visibilité dans les IA.
Ils sont pourtant peu cités : 5,7 % des PDF ramenés contre 12,1 % des autres pages sur les secteurs en français, 5,2 % contre 10,1 % en anglais, 4,9 % contre 11,8 % sur le dépannage, et 2,1 % contre 10,8 % sur nos questions du 15 septembre 2026. Un PDF est donc cité 2 à 5 fois moins souvent qu’une page web trouvée par la même IA. Nos premiers corpus, sur le génie climatique et l’intelligence artificielle, donnaient déjà un écart de 3 à 4 fois.
Claude ramène très peu de PDF
Chez Claude, les PDF sont presque absents des résultats : entre 0,5 et 3 % de ce que sa recherche ramène selon le corpus. C’est trop peu pour mesurer un taux de citation fiable. La différence avec ChatGPT tient donc d’abord à ce que chaque moteur de recherche renvoie, avant même le choix des sources à citer.
Chez Gemini, l’API ne distingue pas les pages trouvées des pages citées et ne donne que le domaine des sources, ce qui ne permet pas de mesurer la part des PDF. Là encore, une règle unique pour « les IA » n’est pas possible : ChatGPT trouve beaucoup de PDF et les écarte, Claude en trouve peu.
Pourquoi un PDF est moins cité
Nous observons plusieurs obstacles, sans pouvoir dire lequel pèse le plus. Un PDF n’a souvent ni balise de titre exploitable, ni structure en paragraphes lisible par une machine : lors de nos propres relevés, des PDF ont été lus comme un seul bloc de texte de plusieurs dizaines de milliers de mots, et d’autres n’ont pas pu être lus du tout. Or le passage cité par une IA est un paragraphe développé, repérable, qui reprend les mots de sa recherche.
Un PDF est aussi souvent long et général, rapport annuel, guide complet, catalogue, là où l’IA cherche un passage qui répond à une question précise. Ces explications restent des hypothèses : nous mesurons l’écart de citation, pas sa cause.
Ce que disent Google et les études publiées
Google indexe les documents PDF : le format figure dans la liste des types de fichiers qu’il peut indexer, mise à jour le 3 février 2026. Et sa documentation sur les fonctions IA indique qu’une page indexée et éligible à un extrait peut servir de source, sans exigence supplémentaire. Rien n’exclut donc un PDF des réponses IA de Google.
Nous n’avons trouvé aucune étude publiée, ni aucune documentation d’OpenAI, d’Anthropic ou de Google, qui traite spécifiquement de la citation des PDF par les IA. C’est l’un des sujets sur lesquels nos mesures sont, à notre connaissance, les seules disponibles.
Ce que cela change pour une entreprise
Un livre blanc, une fiche technique ou une étude publiés seulement en PDF sont trouvés, mais rarement cités. Pour qu’un contenu important puisse être repris par une IA, il vaut mieux le publier aussi en page web, découpé en pages ou en sections qui répondent chacune à une question précise, avec des paragraphes développés, et garder le PDF en téléchargement.
La page web porte la question dans son titre et son adresse, répond dès les premières lignes et renvoie vers le document complet. Le PDF reste utile pour le lecteur qui veut tout lire ; la page web est ce que l’IA peut citer.
Ce que nous ne savons pas
Un document est compté comme PDF quand son adresse se termine par « .pdf » ; un PDF servi sous une autre adresse n’est pas compté. Chez ChatGPT, les documents cités sont repérés dans les liens de la réponse. Nos mesures portent sur l’API des modèles, et ne distinguent pas les types de PDF.
Sources
- Google Search Central — types de fichiers indexables par Google, .
- Google Search Central — « AI features and your website », .
- Mesures FaireDuBruit, du 4 au 16 septembre 2026 — voir « Comment nous avons mesuré ».
Questions voisines
- Quel passage d’une page une IA cite-t-elle ?
- Les IA préfèrent-elles les contenus récents ?
- Le balisage schema.org est-il nécessaire pour être cité par les IA ?
- Le titre d’une page compte-t-il pour être cité par une IA ?
Toutes les questions sur la visibilité dans les IA · Notre offre · Tester mon site