# robots.txt — soralva.com # Politique explicite : tout est ouvert, aux moteurs de recherche comme aux robots d'IA. # Choix assumé : Soralva vend la visibilité dans Google ET dans les IA, il serait # incohérent d'interdire aux robots d'IA de lire son propre site. # # LISTE VÉRIFIÉE LE 2026-08-28, agent par agent, dans la documentation de son # opérateur, pas de mémoire ni depuis une liste recopiée. Sources : # Anthropic support.claude.com, article 8896518 # OpenAI developers.openai.com/api/docs/bots # Google developers.google.com/search/docs/crawling-indexing/google-common-crawlers # Mistral docs.mistral.ai/robots # Meta developers.facebook.com/docs/sharing/webmasters/web-crawlers # Amazon developer.amazon.com/amazonbot # DuckDuckGo duckduckgo.com/duckduckgo-help-pages/results/duckassistbot # # CE QUE CETTE LISTE CHANGE, ET CE QU'ELLE NE CHANGE PAS. La règle générique en # fin de fichier autorise déjà tout : aucun agent nommé ici n'est autorisé « en # plus », et aucun agent absent n'est bloqué. Cette liste ne sert donc à rien # fonctionnellement. Elle sert à deux choses réelles : ce fichier est livré aux # clients de Soralva, et il est la pièce qu'un prospect ouvre pour vérifier que # le prestataire connaît son sujet. Un agent périmé s'y voit. # # PROCHAINE RÉVISION : à chaque trimestre, et à toute annonce d'un opérateur. # Le domaine bouge vite : entre le 25/08 et le 28/08, trois manques sont apparus # sur ce seul fichier (Claude-Web retiré par Anthropic, Mistral passé de 1 à 3 # agents, Meta passé de 1 à 3 agents utiles). # --- Moteurs de recherche classiques --- User-agent: Googlebot Allow: / User-agent: Bingbot Allow: / User-agent: DuckDuckBot Allow: / # Qwant, moteur français. Une part de marché modeste, mais c'est le marché # de Soralva, et le coût de la ligne est nul. User-agent: Qwantify Allow: / # --- Anthropic (Claude) --- # Corrigé le 28/08. Le fichier déclarait « Claude-Web », qu'Anthropic ne # documente plus, et omettait les DEUX agents qui décident réellement d'une # citation dans Claude. Chaque agent se contrôle séparément : autoriser # ClaudeBot n'autorise ni Claude-User ni Claude-SearchBot. User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Claude-SearchBot Allow: / # --- OpenAI (ChatGPT) --- User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / # --- Google (Gemini, AI Overviews, Vertex) --- # Google-Extended ne gouverne QUE l'usage génératif ; l'indexation reste # gouvernée par Googlebot, plus haut. GoogleOther et Google-CloudVertexBot # ajoutés le 28/08, ils manquaient. User-agent: Google-Extended Allow: / User-agent: GoogleOther Allow: / User-agent: Google-CloudVertexBot Allow: / # --- Mistral (Le Chat) --- # Les trois agents ajoutés le 28/08 : le fichier n'en déclarait qu'un. # C'est l'opérateur le plus important de cette liste après Google et OpenAI # pour une clientèle française, et MistralAI-Index est celui qui décide si # une page existe seulement dans son index de recherche. User-agent: MistralAI-User Allow: / User-agent: MistralAI-Index Allow: / User-agent: MistralAI-Training Allow: / # --- Perplexity --- User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / # --- Apple (Siri, Apple Intelligence) --- User-agent: Applebot Allow: / User-agent: Applebot-Extended Allow: / # --- Meta (Meta AI dans WhatsApp, Instagram, Messenger) --- # meta-webindexer et meta-externalfetcher ajoutés le 28/08. # facebookexternalhit n'est pas un robot d'IA : c'est lui qui fabrique # l'aperçu d'un lien partagé dans WhatsApp. Or Soralva envoie son adresse # par WhatsApp à chaque prospect. S'il ne lit pas la page, le lien part sans # titre et sans image. C'est la ligne la plus concrètement utile du fichier. User-agent: facebookexternalhit Allow: / User-agent: meta-externalagent Allow: / User-agent: meta-externalfetcher Allow: / User-agent: meta-webindexer Allow: / # --- DuckDuckGo (réponses assistées) --- # Agent distinct de DuckDuckBot, et il cite ses sources en clair. User-agent: DuckAssistBot Allow: / # --- Amazon (Alexa, Rufus) --- User-agent: Amazonbot Allow: / User-agent: Amzn-SearchBot Allow: / User-agent: Amzn-User Allow: / # --- Jeux de données ouverts et autres modèles --- User-agent: CCBot Allow: / # Bytespider est documenté comme ignorant robots.txt. Le déclarer ne coûte # rien et ne garantit rien. Même remarque pour meta-externalfetcher et # facebookexternalhit ci-dessus, que Meta documente comme pouvant passer # outre. Ces trois lignes disent une intention, pas une contrainte. User-agent: Bytespider Allow: / # --- Ce qui n'est volontairement PAS listé --- # Les agents de validation publicitaire (OAI-AdsBot, meta-externalads) sont # documentés mais n'ont aucun rapport avec la citation d'une page. Soralva ne # diffuse aucune publicité. Les lister ferait une liste plus longue et moins # juste. La règle générique ci-dessous les autorise déjà, sans rien promettre. # --- Tout le reste --- User-agent: * Allow: / Sitemap: https://soralva.com/sitemap.xml