# Robots d'exploration

**URL:** https://meta.discourse.org/t/web-crawlers/271767
**Category:** Data & reporting
**Created:** [Juillet 16, 2023, 6:41 UTC](https://meta.discourse.org/t/web-crawlers/271767 "2023-07-16T06:41:00Z")
**Posts on this page:** 13
**Page:** 1

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 16, 2023, 6:41 UTC](https://meta.discourse.org/t/web-crawlers/271767/1 "2023-07-16T06:41:00Z")

</div>

J’ai entendu sur un autre fil de discussion que @simon mentionnait qu’il y avait un réglage pour arrêter/écraser les robots d’exploration, je ne trouve pas ce réglage, comment faire, quelqu’un sait où il se trouve et comment il fonctionne ?

J’ai eu une augmentation inhabituelle de 48 robots d’exploration sur mon site le 14 juillet, je n’aime pas ces petites saletés, que font-ils ?

 ![graph](https://global.discourse-cdn.com/meta/original/4X/6/f/9/6f9d72df186cb2a7e34e1af8d96e134af0f49ed9.png)

---

<div class="post-metadata">

### Author: ![pfaffman](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/pfaffman/32/120154_2.png) [@pfaffman](https://meta.discourse.org/u/pfaffman)
#### Post date: [Juillet 16, 2023, 9:57 UTC](https://meta.discourse.org/t/web-crawlers/271767/2 "2023-07-16T09:57:46Z")

</div>

Recherchez les paramètres du site pour «&nbsp;crawler&nbsp;». Vous pouvez bloquer ou ralentir par agent utilisateur.

> [@anon65426961](#):
>
> Je n’aime pas ces petites bestioles, qu’est-ce qu’elles font&nbsp;?

Au moins, certains indexent votre site pour qu’il apparaisse dans les moteurs de recherche. Vous aimez probablement ça.

---

<div class="post-metadata">

### Author: ![simon](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/simon/32/339122_2.png) [@simon](https://meta.discourse.org/u/simon)
#### Post date: [Juillet 16, 2023, 1:48 UTC](https://meta.discourse.org/t/web-crawlers/271767/3 "2023-07-16T13:48:35Z")

</div>

De plus, consultez le rapport « Agents utilisateurs du robot d’exploration Web » pour obtenir le nom du robot qui cause le problème&nbsp;:

 ![image](https://global.discourse-cdn.com/meta/original/4X/f/2/f/f2f2f68d6b194f9e038d2a1bbd38f869377f7f20.png)

---

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 16, 2023, 6:16 UTC](https://meta.discourse.org/t/web-crawlers/271767/4 "2023-07-16T18:16:28Z")

</div>

Merci, j’ai trouvé cela maintenant. Je vois qu’il y a cinq noms de robots d’exploration bloqués par défaut, je suppose que ce sont des robots connus pour causer des problèmes.

Il semble y avoir une option pour utiliser une liste d’autorisation pour les bons robots d’exploration, qui, si elle est utilisée, refuse automatiquement l’entrée à tous les autres “êtres insectoïdes électriques”. Je ne sais pas quels pourraient être les bons ?

J’ai trouvé les rapports d’agents utilisateurs de robots d’exploration web, les principaux sont "YandexBox/3.0 et CensysInspect/1.1 [https://about.censys.io/](https://about.censys.io/)

Ce serait bien d’apparaître sur certains moteurs de recherche pour les clients qui en ont besoin.

J’ai reçu beaucoup d’appels de sociétés de marketing qui facturent un service d’abonnement pour obtenir de l’aide à ce sujet et pour la création de sites web, ce qui pourrait être bien, mais c’est un peu ennuyeux tous ces appels à ce sujet.

---

<div class="post-metadata">

### Author: ![Ed\_S](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/ed_s/32/134015_2.png) [@Ed\_S](https://meta.discourse.org/u/Ed_S)
#### Post date: [Juillet 16, 2023, 6:58 UTC](https://meta.discourse.org/t/web-crawlers/271767/5 "2023-07-16T18:58:17Z")

</div>

Il convient de noter que les agents utilisateurs sont très faciles à usurper. S’il s’agit de Google, vous pouvez être à peu près sûr qu’il le dira. Mais ce n’est pas parce qu’il dit que c’est Google que cela signifie quoi que ce soit.

(Même situation que robots.txt, ce sont des mécanismes qui supposent la confiance. Les parties non fiables peuvent simplement jouer selon des règles différentes.)

---

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 16, 2023, 7:06 UTC](https://meta.discourse.org/t/web-crawlers/271767/6 "2023-07-16T19:06:14Z")

</div>

Des imposteurs sournois, pires que des belettes, peuvent être :

[https://yandex.com/support/webmaster/robot-workings/check-yandex-robots.html](https://yandex.com/support/webmaster/robot-workings/check-yandex-robots.html)

« # Comment vérifier qu’un robot appartient à Yandex

Certains robots peuvent se faire passer pour des robots Yandex en indiquant l’User Agent approprié. Vous pouvez vérifier l’authenticité d’un robot à l’aide d’une recherche DNS inversée.

Suivez simplement ces étapes :

1. Déterminez l’adresse IP de l’[agent utilisateur en question](https://yandex.com/support/webmaster/robot-workings/check-yandex-robots.html#robot-in-logs) à l’aide des journaux de votre serveur.

2. Utilisez une recherche DNS inversée de l’adresse IP pour déterminer le nom d’hôte du domaine.

3. Vérifiez si l’hôte appartient à Yandex. Tous les noms de robots Yandex se terminent par [yandex.ru](http://yandex.ru), [yandex.net](http://yandex.net) ou [yandex.com](http://yandex.com). Si le nom d’hôte a une terminaison différente, le robot n’appartient pas à Yandex.

4. Assurez-vous que le nom est correct. Utilisez une recherche DNS directe pour obtenir l’adresse IP correspondant au nom d’hôte. Elle doit correspondre à l’adresse IP utilisée dans la recherche DNS inversée. Si les adresses IP ne correspondent pas, cela signifie que le nom d’hôte est faux. »

---

<div class="post-metadata">

### Author: ![JammyDodger](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jammydodger/32/254611_2.png) [@JammyDodger](https://meta.discourse.org/u/JammyDodger)
#### Post date: [Juillet 17, 2023, 7:20 UTC](https://meta.discourse.org/t/web-crawlers/271767/7 "2023-07-17T07:20:51Z")

</div>

Il y a aussi un guide auquel vous pouvez vous référer ici :

> [@Controlling Web Crawlers For a Site](https://meta.discourse.org/t/controlling-web-crawlers-for-a-site/244925):
>
> bookmark This guide explains how to manage web crawlers on your Discourse site. person_raising_hand Required user level: Administrator Web crawlers can significantly impact your site’s performance by increasing pageviews and server load. When a site notices a spike in their pageviews it’s important to check how web crawlers fit into the mix. Checking for crawler activity To see if crawlers are affecting your site, navigate to the Consolidated Pageviews report (/admin/reports/consolid…

---

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 26, 2023, 3:58 UTC](https://meta.discourse.org/t/web-crawlers/271767/8 "2023-07-26T15:58:22Z")

</div>

> [@pfaffman](#):
>
> Au moins, indexez votre site pour qu’il apparaisse dans les moteurs de recherche.

Savez-vous si les robots d’exploration Web indexent les sites pour les systèmes de recherche vocale ?

Je reçois quelques appels automatisés chaque jour concernant ma société qui n’est pas enregistrée auprès des principaux moteurs de recherche vocale par IA. Il semble qu’il s’agisse uniquement de sociétés tierces qui font cela et je ne suis pas sûr que ce qu’elles font soit légitime.

Plus précisément : facturer un service d’abonnement pour « enregistrer » une entreprise dans la recherche, ou aider les entreprises à apparaître en première page des résultats de recherche.

---

<div class="post-metadata">

### Author: ![pfaffman](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/pfaffman/32/120154_2.png) [@pfaffman](https://meta.discourse.org/u/pfaffman)
#### Post date: [Juillet 26, 2023, 4:13 UTC](https://meta.discourse.org/t/web-crawlers/271767/9 "2023-07-26T16:13:51Z")

</div>

> [@anon65426961](#):
>
> Savez-vous si les robots d’exploration tels que ceux-ci indexent les sites pour les systèmes de recherche vocale ?

Je ne sais pas. J’en doute.

> [@anon65426961](#):
>
> Spécifiquement : facturer un service d’abonnement pour « enregistrer » une entreprise dans la recherche, ou aider les entreprises à apparaître en première page des résultats de recherche.

J’ai interagi avec des personnes qui, je pense, peuvent réellement aider à cela, certaines utilisant des méthodes légitimes. Elles semblent être l’exception, à mon avis.

---

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 26, 2023, 7:49 UTC](https://meta.discourse.org/t/web-crawlers/271767/10 "2023-07-26T19:49:37Z")

</div>

Je n’y connais rien non plus en matière de recherche vocale, et je ne souhaite même pas nécessairement que mon entreprise soit un jour indexée par celles-ci.

---

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 26, 2023, 8:28 UTC](https://meta.discourse.org/t/web-crawlers/271767/11 "2023-07-26T20:28:49Z")

</div>

> [@Ed\_S](#):
>
> Les parties non fiables peuvent simplement jouer selon des règles différentes.

C’est important de s’en souvenir, surtout de nos jours, les escrocs deviennent de plus en plus sophistiqués.

Les appels que je reçois disent souvent « votre fiche Google a été signalée pour examen », ce qui suggère que c’est Google qui appelle, mais Google n’appelle jamais. Certaines entreprises s’appellent elles-mêmes une « société partenaire de Google », je ne suis pas sûr de ce que cela signifie si cela existe même.

---

<div class="post-metadata">

### Author: ![anon65426961](https://avatars.discourse-cdn.com/v4/letter/a/34f0e0/32.png) [@anon65426961](https://meta.discourse.org/u/anon65426961)
#### Post date: [Juillet 31, 2023, 7:57 UTC](https://meta.discourse.org/t/web-crawlers/271767/12 "2023-07-31T19:57:34Z")

</div>

J’ai entendu dire par un représentant qu’il y a environ/au moins 40 entreprises différentes qui font cela, appellent les startups pour les enregistrer sur des plateformes de recherche vocale, ce qui explique le grand nombre d’appels.

---

<div class="post-metadata">

### Author: ![system](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/system/32/443519_2.png) [@system](https://meta.discourse.org/u/system)
#### Post date: [Août 30, 2023, 7:58 UTC](https://meta.discourse.org/t/web-crawlers/271767/13 "2023-08-30T19:58:26Z")

</div>

This topic was automatically closed 30 days after the last reply. New replies are no longer allowed.
