Comment Perplexity sélectionne ses sources
Perplexity sélectionne ses sources via un pipeline en plusieurs étapes — recherche hybride (mots-clés + sens), reranking par machine learning, puis citation — et ne retient en général que 3 à 4 sources sur la dizaine récupérée : c’est le moteur le plus documenté sur son fonctionnement, un bon laboratoire pour comprendre le GEO.
Un pipeline en plusieurs étapes
Perplexity traite chaque requête en plusieurs temps : analyse de l’intention, récupération de pages via une recherche hybride (BM25 lexical + vectorielle dense), puis reclassement par un modèle propriétaire. Sur une requête standard, il récupère une soixantaine de sources candidates avant filtrage ; le mode Deep Research en traite des centaines. Seule une fraction survit à la réponse finale.
Un modèle binaire, pas un classement graduel
Contrairement à Google, Perplexity fonctionne en logique largement binaire : une source passe tous les filtres et devient citable, ou reste invisible. Il n’y a pas de « page 2 ». Conséquence GEO : il ne suffit pas d’être « moyen », il faut franchir chaque étape du filtre.
PerplexityBot : le prérequis technique
Si PerplexityBot est bloqué (robots.txt ou pare-feu), votre contenu n’entre pas dans le pipeline, quelle que soit sa qualité. À vérifier avant toute optimisation — voir robots.txt pour les IA.
Les facteurs qui augmentent les citations
- Une réponse directe dans les 100 premiers mots (format BLUF) ;
- Une fraîcheur récente : Perplexity favorise les pages mises à jour dans les 12-18 derniers mois ;
- Une autorité thématique sur le sujet précis, plus qu’une autorité de domaine générale ;
- Pour le commercial, une présence sur des plateformes d’avis tierces.
| Facteur | Effet observé |
|---|---|
| Réponse directe en tête | Retrouvée dans la majorité des passages cités |
| Contenu récent (12-18 mois) | Nettement favorisé au reclassement |
| Blocage de PerplexityBot | Exclusion totale du pipeline |
La limite : un taux d’erreur documenté
La Columbia Journalism Review a mesuré 37 % d’erreurs sur les réponses citées de Perplexity, entre mauvaise attribution et fabrication. Être cité ne garantit pas d’être cité fidèlement : surveillez régulièrement comment votre marque est représentée — voir le chapitre mesure.
Tenez vos pages à jour plutôt que de multiplier les publications : Perplexity valorise fortement la fraîcheur. Une page ancienne mais actualisée bat souvent une page neuve peu approfondie. Datez visiblement vos mises à jour.
Combien de sources Perplexity cite-t-il ?
Généralement 3 à 4 par réponse standard, parmi une cinquantaine récupérées. Le mode Deep Research en explore des centaines.
Perplexity favorise-t-il les gros sites ?
Pas systématiquement : l’autorité thématique sur un sujet précis pèse davantage que l’autorité de domaine, laissant place aux sites spécialisés.
Le format FAQ aide-t-il sur Perplexity ?
Il facilite la compréhension, mais la clarté rédactionnelle (réponse directe autonome) prime sur le balisage seul.
Comparez avec ChatGPT. Mécanisme : RAG et grounding. Retour au chapitre, au chapitre mesure et au guide GEO.
Poursuivre ce chapitre
Les articles de « Comment fonctionnent les moteurs IA »
- 01Comment fonctionne un LLM
- 02RAG et grounding : comment les IA citent
- 03Comment ChatGPT choisit ses sources
- 04Comment Perplexity sélectionne ses sources
- 05Comment fonctionnent les AI Overviews