# Google ha cambiato il modo in cui elabora robots.txt in Discourse?

**URL:** https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064
**Category:** Support
**Created:** [11 Maggio 2020, 3:37pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064 "2020-05-11T15:37:06Z")
**Posts on this page:** 20
**Page:** 1

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [11 Maggio 2020, 3:37pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/1 "2020-05-11T15:37:06Z")

</div>

La mia bacheca è stata collegata dal mio sito da un paio di settimane e ho inviato l’URL a Google. Ho ricevuto un avviso di ‘no index’, ma sembra riguardare le pagine dei profili, il che è positivo.

Eppure non appare ancora nulla su Google: c’è qualcosa che devo fare dal lato della bacheca, o è semplicemente una questione di aspettare che Google la scansioni?

---

<div class="post-metadata">

### Author: ![satonotdead](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/satonotdead/32/447830_2.png) [@satonotdead](https://meta.discourse.org/u/satonotdead)
#### Post date: [11 Maggio 2020, 4:30pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/2 "2020-05-11T16:30:22Z")

</div>

Forse puoi provare [https://search.google.com/search-console/](https://search.google.com/search-console/)?

---

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [12 Maggio 2020, 7:00am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/3 "2020-05-12T07:00:14Z")

</div>

Sembra che stia dicendo che le pagine dei post sono bloccate da robots.txt, ma non è qualcosa che ho fatto io. C’è un’impostazione in Discourse che devo modificare per sbloccarle? Grazie.

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [12 Maggio 2020, 7:11am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/4 "2020-05-12T07:11:45Z")

</div>

> [@jackjjw](#):
>
> Sembra che stia dicendo che le pagine dei post sono bloccate da robots.txt, ma non è qualcosa che ho fatto io,

C’è un’impostazione del sito: cerca `allow index in robots txt` nelle impostazioni del tuo sito; dovrebbe essere abilitata (è abilitata di default).

---

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [12 Maggio 2020, 7:13am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/5 "2020-05-12T07:13:48Z")

</div>

Grazie, Sam, quella impostazione è selezionata, è corretto?

Scusa, mi sto confondendo, sembra che gli URL bloccati siano le equivalenti dei feed RSS.

Immagino sia solo una questione di aspettare che Google aggiorni o scansioni il sito, poi.

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [12 Maggio 2020, 7:22am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/6 "2020-05-12T07:22:09Z")

</div>

> [@jackjjw](#):
>
> sembra che gli URL bloccati siano le equivalenti feed RSS.

Sì, questo continua a ripetersi e continua a causare problemi di supporto.

Googlebot è un po’ fastidioso. Non puoi dirgli nel file robots.txt che non vuoi che qualcosa venga indicizzato. Stiamo lavorando a una soluzione per accontentare Googlebot, ma ci vorrà del tempo prima che venga implementata.

- Diciamo a Googlebot nel file robots.txt: “Ehi… non andare a indicizzare tutte le pagine .rss del sito”

- Googlebot trova da qualche parte un link a un file `.rss` sul sito

- Googlebot poi si lamenta con gli amministratori del sito dicendo che c’è un file `.rss` sul sito, ma non riesce a capire cosa fare con il link perché non gli è permesso indicizzarlo. A volte include anche questo contenuto nei risultati di ricerca.

- Gli amministratori del sito poi si lamentano su meta

La nostra soluzione generale qui è semplicemente permettere a Googlebot di scansionare ogni pagina del sito e utilizzare i link canonici e i suggerimenti di indicizzazione negli header HTTP per indirizzarlo verso la soluzione ottimale.

Sto lavorando con @jomaxro su questo e abbiamo già fatto buoni progressi.

(fyi @codinghorror)

---

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [12 Maggio 2020, 7:29am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/7 "2020-05-12T07:29:22Z")

</div>

Grazie per l’aggiornamento, Sam. Ha tutto il senso e capisco la tua situazione. Non sono un esperto di SEO, ma ho gestito siti web più grandi e ho lavorato con team di SEO; sui forum era spesso molto complicato!

---

<div class="post-metadata">

### Author: ![jomaxro](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jomaxro/32/126216_2.png) [@jomaxro](https://meta.discourse.org/u/jomaxro)
#### Post date: [12 Maggio 2020, 4:59pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/8 "2020-05-12T16:59:50Z")

</div>

> [@jackjjw](#):
>
> sui forum era spesso molto complicato

Per essere chiari, questo non ha nulla a che fare con il fatto di essere un forum di discussione. È legato al… interessante… modo in cui Google tratta robots.txt. Vedi [Robots.txt Introduction and Guide | Google Search Central &nbsp;|&nbsp; Documentation &nbsp;|&nbsp; Google for Developers](https://support.google.com/webmasters/answer/6062608?hl=en#robotted-but-indexed)

> **Una pagina bloccata da robots.txt può comunque essere indicizzata se collegata da altri siti**  
> Sebbene Google non scansioni né indicizzi il contenuto bloccato da robots.txt, potremmo comunque trovare e indicizzare un URL non consentito se è collegato da altre parti del web. Di conseguenza, l’indirizzo URL e, potenzialmente, altre informazioni pubblicamente disponibili come il testo di ancoraggio nei collegamenti alla pagina, possono comunque apparire nei risultati di ricerca di Google. Per impedire correttamente che il tuo URL appaia nei risultati di Ricerca Google, dovresti [proteggere con password i file sul tuo server](https://support.google.com/webmasters/answer/93708) o [utilizzare il meta tag noindex o l’intestazione di risposta](https://support.google.com/webmasters/answer/93710) (oppure rimuovere completamente la pagina).

Da tempo includiamo le pagine che non vogliamo indicizzate nel file robots.txt predefinito di ogni sito Discourse. In precedenza questo funzionava perfettamente. In un momento sconosciuto del passato ciò non è stato più sufficiente: Google ha deciso di indicizzare le pagine collegate da altre fonti, anche se disabilitate tramite robots.txt.

Quindi all’inizio di quest’anno abbiamo iniziato a testare l’inclusione di intestazioni `noindex` su determinate pagine. Questo avrebbe funzionato benissimo, tranne per il fatto che ora ci troviamo di fronte a un conflitto tra robots.txt e l’intestazione. Vedi [Block Search Indexing with noindex | Google Search Central &nbsp;|&nbsp; Documentation &nbsp;|&nbsp; Google for Developers](https://support.google.com/webmasters/answer/93710)

> Importante! Affinché la direttiva `noindex` sia efficace, la pagina **non deve** essere bloccata da un file robots.txt. Se la pagina è bloccata da robots.txt, il crawler non vedrà mai la direttiva `noindex` e la pagina potrebbe comunque apparire nei risultati di ricerca, ad esempio se altre pagine la collegano.

Ciò ci porta a oggi. Stiamo testando la rimozione di alcune pagine da robots.txt. Dobbiamo fare attenzione, poiché stiamo apportando tutte queste modifiche sulla base della documentazione di Google, quindi sappiamo che siamo conformi a Googlebot, ma dobbiamo anche verificare gli altri principali crawler per assicurarci di non causare problemi.

---

<div class="post-metadata">

### Author: ![codinghorror](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/codinghorror/32/110067_2.png) [@codinghorror](https://meta.discourse.org/u/codinghorror)
#### Post date: [13 Maggio 2020, 7:04am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/9 "2020-05-13T07:04:13Z")

</div>

> [@jomaxro](#):
>
> Prima funzionava perfettamente. In un momento imprecisato del passato, questo non è stato più sufficiente: Google ha deciso di indicizzare le pagine collegate da altre fonti anche se bloccate tramite un robots.txt.

Citato per enfasi. Google ha modificato il proprio comportamento, non noi, quindi ci vorrà un po’ di tempo per adattarci.

---

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [25 Giugno 2020, 1:28pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/10 "2020-06-25T13:28:35Z")

</div>

Ciao Jeff, ha tutto senso per me e ho capito. Volevo solo verificare di non aver fatto qualcosa per nascondere le pagine dei thread dalla mia configurazione su Google? La pagina principale e le categorie appaiono su Google, ma nessuna delle pagine dei thread è indicizzata, sono passati alcuni mesi. Questo è il mio sito: [https://community.jackwallington.com/](https://community.jackwallington.com/)

---

<div class="post-metadata">

### Author: ![codinghorror](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/codinghorror/32/110067_2.png) [@codinghorror](https://meta.discourse.org/u/codinghorror)
#### Post date: [25 Giugno 2020, 5:20pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/11 "2020-06-25T17:20:23Z")

</div>

Credo che abbiamo apportato tutte le modifiche necessarie dal nostro lato per adattarci ai recenti cambiamenti nel comportamento di Google… forse @jomaxro può confermare? Dovresti essere sull’ultima versione di Discourse.

---

<div class="post-metadata">

### Author: ![jomaxro](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jomaxro/32/126216_2.png) [@jomaxro](https://meta.discourse.org/u/jomaxro)
#### Post date: [25 Giugno 2020, 5:27pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/12 "2020-06-25T17:27:07Z")

</div>

> [@codinghorror](#):
>
> forse @jomaxro può confermare?

Non sono certo, dovrò verificare. Credo che abbiamo apportato alcune modifiche manuali al robots.txt (solo su Meta) durante i test…

---

<div class="post-metadata">

### Author: ![jomaxro](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jomaxro/32/126216_2.png) [@jomaxro](https://meta.discourse.org/u/jomaxro)
#### Post date: [25 Giugno 2020, 5:32pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/13 "2020-06-25T17:32:05Z")

</div>

Guardando [discourse/app/controllers/robots\_txt\_controller.rb at main · discourse/discourse · GitHub](https://github.com/discourse/discourse/blob/master/app/controllers/robots_txt_controller.rb#L10) sembra che le modifiche siano locali (solo Meta). Lo correggerò; abbiamo ancora alcune test di lunga durata in corso, ma sono abbastanza sicuro.

---

<div class="post-metadata">

### Author: ![jomaxro](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jomaxro/32/126216_2.png) [@jomaxro](https://meta.discourse.org/u/jomaxro)
#### Post date: [25 Giugno 2020, 7:15pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/14 "2020-06-25T19:15:31Z")

</div>

Modifiche necessarie apportate in base a

> <https://github.com/discourse/discourse/commit/b52143feff8c32f21ed53033b6a0a65ee45dce0e>
>
> Google no longer supports the use of robots.txt to block indexing.
> See https://s…upport.google.com/webmasters/answer/6062608 and
> https://support.google.com/webmasters/answer/93710
> 
> Previous commits have added the \`noindex\` header to appropriate pages,
> now we need to remove the paths from robots.txt so the pages can be
> crawled.
> 
> Follow up to:
> 13f229808a22db9e1032832a313ab701b66614c8
> b6765aac4b532c026418a7ffd9effd0741ab8a37
> 676be3a853454a33cf627c3d570feb37d3bb0bfd
> 07b728c5e557c9aae91c51f3eaac5c32d479f2a2
> c94e6a9a66757ea48d99e3ee8d880523871cb6f4

---

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [25 Giugno 2020, 7:31pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/15 "2020-06-25T19:31:32Z")

</div>

Potrebbe essere che abbia impostato un no index da qualche parte per le pagine dei post? Anche se Google dice che ora lo ignorano.

---

<div class="post-metadata">

### Author: ![jomaxro](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jomaxro/32/126216_2.png) [@jomaxro](https://meta.discourse.org/u/jomaxro)
#### Post date: [25 Giugno 2020, 7:40pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/16 "2020-06-25T19:40:26Z")

</div>

A meno che tu non abbia installato un plugin per aggiungerlo, non riesco a pensare a un modo in cui tale intestazione possa essere aggiunta. Google non ignora l’intestazione noindex. Google ignora robots.txt quando altri siti puntano alla tua pagina. Google lo rispetta invece durante la scansione, motivo per cui il commit sopra rimuove le voci di robots.txt a favore delle intestazioni `noindex` aggiunte in precedenza.

Ti suggerisco di registrarti a Google Search Console in modo da poter vedere direttamente cosa vede Google. Forse c’è un altro problema che impedisce l’indicizzazione degli argomenti.

---

<div class="post-metadata">

### Author: ![jackjjw](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jackjjw/32/120460_2.png) [@jackjjw](https://meta.discourse.org/u/jackjjw)
#### Post date: [25 Giugno 2020, 7:54pm UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/17 "2020-06-25T19:54:23Z")

</div>

Grazie, Joshua. Google Search Console sembra soddisfatta e indica che tutti i thread sono elencati. È molto strano: quando li cerco, le pagine dei thread non compaiono, ma quelle della home e delle categorie sì.

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [22 Dicembre 2020, 5:17am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/18 "2020-12-22T05:17:41Z")

</div>

Tornerò indietro e renderò esplicita questa condizione per Googlebot.

Googlebot è un crawler molto intelligente, ma molti altri crawler non lo sono altrettanto.

---

<div class="post-metadata">

### Author: ![jomaxro](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jomaxro/32/126216_2.png) [@jomaxro](https://meta.discourse.org/u/jomaxro)
#### Post date: [22 Dicembre 2020, 5:22am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/19 "2020-12-22T05:22:29Z")

</div>

Va bene. Tieni presente che c’è anche un commit successivo da annullare.

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [22 Dicembre 2020, 6:01am UTC](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064/20 "2020-12-22T06:01:49Z")

</div>

Ho creato questa PR per risolvere il problema:

> <https://github.com/discourse/discourse/pull/11553>
>
> Googlebot handles no-index headers very elegantly. It advises to leave as many r…outes as possible open and uses headers for high fidelity rules regarding indexes.
> 
> Discourse adds special \`x-robot-tags\` noindex headers to users, badges, groups, search and tag routes.
> 
> Following up on b52143feff8c32f2 we now have it so Googlebot gets special handling.
> 
> Rest of the crawlers get a far more aggressive disallow list to protect against excessive crawling.

Google mantiene la sua regola speciale e noi distribuiamo una protezione migliore per vari bot meno sofisticati. Il file robots predefinito ora appare così:

```plaintext
# Vedi http://www.robotstxt.org/robotstxt.html per la documentazione su come utilizzare il file robots.txt
#
User-agent: mauibot
Disallow: /

User-agent: semrushbot
Disallow: /

User-agent: ahrefsbot
Disallow: /

User-agent: blexbot
Disallow: /

User-agent: seo spider
Disallow: /

User-agent: *
Disallow: /admin/
Disallow: /auth/
Disallow: /assets/browser-update*.js
Disallow: /email/
Disallow: /session
Disallow: /user-api-key
Disallow: /*?api_key*
Disallow: /*?*api_key*
Disallow: /badges
Disallow: /u
Disallow: /my
Disallow: /search
Disallow: /tags
Disallow: /g
Disallow: /t/*/*.rss
Disallow: /tags/*.rss
Disallow: /c/*.rss

User-agent: Googlebot
Disallow: /admin/
Disallow: /auth/
Disallow: /assets/browser-update*.js
Disallow: /email/
Disallow: /session
Disallow: /user-api-key
Disallow: /*?api_key*
Disallow: /*?*api_key*

```

[Next page](https://meta.discourse.org/t/google-changed-how-they-process-robots-txt-in-discourse/151064.md?page=2)
