Comment consulter un énorme manuel ? Parcourir l'index. Eh bien : il y a un élément qui est le véritable résumé de votre site Web…
Les codes de programmation vont devenir de plus en plus sophistiqués
La seule façon d'entrer en contact avec l'araignée du moteur de recherche, ou le chenilles, se fait par le biais d'un fichier appelé Robots.txt. Ou mieux. Lorsque vous soumettez votre proposition de site Web à Google, il est confronté à une quantité d'informations tout simplement colossale.
Comment consulter un manuel si volumineux qu'on a l'impression de ne jamais trouver tout ce dont on a besoin ? Vous consultez l'index. Et bien : le fichier robots.txt est l'index de votre site web.
Il s'agit d'un document facile à remplir qui indique au robot d'exploration du moteur de recherche ce qu'il doit rechercher. En bref : vous l'aiderez à comprendre de quoi est composé votre site, afin que l'algorithme puisse vous donner un classement adapté au travail que vous avez effectué.
Quelqu'un peut-il écrire un fichier robots.txt ?
La reponse courte est oui. La réponse honnête est non. Bien que la grammaire d'un fichier robots.txt soit extrêmement simple, et que sa composition se compose de quelques lignes, mieux vaut s'en remettre aux soins d'un webmaster expert qui sait où mettre les mains. Après tout, une petite erreur suffit à compromettre le positionnement de votre site web, et donc à stopper toutes les opérations de référencement avant même de commencer.
Avant de commencer, sachez une chose : n'importe qui peut consulter le fichier robots.txt de n'importe quel site en écrivant un /robots.txt après le domaine. Vous pouvez même consulter Google !
Vous pouvez écrire un tel fichier sans télécharger de logiciel spécial. En fait, il suffit d'utiliser votre bloc-notes et d'enregistrer, devinez quoi, au format .txt.
Ecrivons ensemble un robots.txt : le header
Commençons par le début, car il est toujours logique de le faire. L'ouverture du fichier, ou l'en-tête, est entièrement dédiée au nom de l'araignée, précédé d'un petit libellé toujours le même. Supposons que vous vouliez vous faire remarquer par Google. Ainsi la première ligne sera :
Agent utilisateur: Googlebot
Cette chaîne très courte indique à Google que tout ce qui va suivre l'intéressera certainement. Dans le cas où vous souhaitez que tous les crawlers lisant ce type de fichier puissent consulter le document, remplacez Googlebot par un simple *, un Asterisco.
Maintenant que vous avez indiqué quelle araignée, c'est-à-dire QUI, vous devez indiquer aussi CE qu'il devra lire.
Chaque ligne de code, par définition, correspond à une action de la machine. Il va sans dire que chaque commande du fichier robots.txt correspond à ce que la machine ne doit pas faire. Et c'est la clé qui vous permet d'en écrire un vraiment efficace. Nous parlons de la commande DISALLOW.
Qu'est-ce que la commande REFUSER ?
Il interdire la commande permet de raisonner par exclusion. Autrement dit, quand on dit que c'est d'abord dire ce qu'il ne faut pas faire, eh bien, vous raisonnez par exclusion. En plus de l'interdiction, il y a aussi l'autorisation, qui est l'exception au blocage.
Si vous voulez écrire un bon fichier robots, vous devrez penser à l'inverse, vous devrez donc dire à Google ce qu'il ne doit pas lire. Si vous écrivez :
Disallow:
L'araignée lira l'intégralité de votre site, sans aucun frein.
Si après « Disallow : » vous insérez un slash (donc Disallow : /), le site ne sera pas rentré dans les moteurs de recherche, point final.
Interdire : /répertoires/
Remplacez le mot répertoire par le dossier que vous souhaitez exclure de la vue araignée. Vous pouvez faire la même chose avec un fichier spécifique.
Interdire : /monfichier.html
Attention à ponctuation et lettres, majuscule ou minuscule. Ce type de dossier tient en haute estime ce genre de " bagatelles ", mais elles font une grande différence.
Pourquoi empêcheriez-vous Google de lire une grande partie de votre site ? Lorsque vous écrivez un fichier de ce type, il est important de comprendre quels fichiers ne doivent pas apparaître sur le moteur de recherche, mais sans en abuser. Cependant, sachez que toute personne connaissant l'adresse exacte de ce fichier particulier pourra y accéder dans tous les cas.
Qu'est-ce que la commande AUTORISER ?
Dans le fichier, vous pouvez ajouter une exception avec la commande PERMETTRE. La grammaire est identique, mais elle va créer quelques exceptions au DISALLOW qui vont permettre d'ouvrir des marges d'exploration intéressantes pour l'araignée.
Un petit exemple de fichier :
Agent utilisateur: Googlebot
Interdire : /images/
Autoriser : /images/holidays.jpg
Fondamentalement, nous avons dit au Googlebot de ne pas considérer le dossier d'images, à l'exception d'une photo particulière à l'intérieur, à savoir celle des vacances.
Et ça, les gars, c'est ça. Nous avons écrit notre premier fichier robots.txt. Bien sûr, ce que nous allons faire pour le site réel peut être légèrement différent, mais pas de beaucoup. En cas de doute, demandez toujours conseil à un webmaster spécialisé. Nous vous conseillons d'essayer de le rédiger vous-même, dans un premier temps, et de le lui envoyer pour vérification, afin d'en maîtriser les rudiments et de mieux comprendre le fonctionnement de votre site.
Quelle est la corrélation entre robots.txt et sitemaps ?
Le plan du site est un fichier généré par des plugins spéciaux qui contient tous les liens du site. Lorsque l'araignée entre sur le site, elle lit d'abord les robots, puis parcourt le site. Si pendant l'exploration le robot trouve l'adresse du sitemap, l'ensemble du processus sera beaucoup plus facile.
Ajoutez ce qui suit au code ci-dessus :
Plan du site: http://www.ilnomedeltuositobellissimo.com/sitemap.xml
En conclusion
Tous les fichiers robots sont identiques. Cela signifie qu'un fichier Robots écrit pour Google fonctionnera également très bien pour Bing et suivra la même grammaire.
Un fichier robots.txt bien organisé vous permet de faire gagner du temps au robot d'exploration. Ne vous découragez pas : c'est le premier pas vers le succès !
Voici trois idées qui pourraient vous intéresser :
L'évolution des moteurs de recherche : l'impact de l'IA, le rôle de Google
Google Maps encore plus vert, à la découverte des… parcs nationaux
Voici comment l'intelligence artificielle de Google remporte tous les défis
Google est le moteur de recherche le plus puissant sur Internet



