# Enviar encabezado de enlace canónico en lugar de encabezado noindex

**URL:** https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213
**Category:** Development
**Created:** [6 Marzo, 2022 17:07 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213 "2022-03-06T17:07:02Z")
**Posts on this page:** 7
**Page:** 1

<div class="post-metadata">

### Author: ![rrit](https://avatars.discourse-cdn.com/v4/letter/r/b5ac83/32.png) [@rrit](https://meta.discourse.org/u/rrit)
#### Post date: [6 Marzo, 2022 17:07 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/1 "2022-03-06T17:07:02Z")

</div>

Envía un encabezado de enlace `canonical` en lugar de un encabezado `noindex`.

> <https://github.com/discourse/discourse/pull/16113>
>
> The html response \*body\* already has a canonical link-tag.
> 
> This might save cr…awler resources for non-canonical pages:
> If the crawler trusts the additional canonical link response \*header\*, it does not need to parse/handle the html response \*body\*.

Enviar un encabezado `canonical` probablemente tiene la misma ventaja en el presupuesto de rastreo que enviar un encabezado `noindex`, sin las implicaciones de SEO de excluir URL que podrían tener backlinks a través de `noindex`.

> [@Falco](#):
>
> No esperes cambios drásticos en el rastreo y los resultados de búsqueda de la noche a la mañana, pero en los próximos meses deberías ver una disminución de los rastreos y los resultados de búsqueda en las páginas específicas de las publicaciones, lo que resultará en más tiempo de rastreo dedicado a los nuevos temas de tu sitio y al contenido que aún no se indexaba debido a las limitaciones del presupuesto de rastreo en tu dominio.

* * *

Consulta también [How to Specify a Canonical with rel="canonical" and Other Methods | Google Search Central &nbsp;|&nbsp; Documentation &nbsp;|&nbsp; Google for Developers](https://developers.google.com/search/docs/advanced/crawling/consolidate-duplicate-urls?hl=en#rel-canonical-header-method)

> Si puedes configurar tu servidor, puedes usar un encabezado HTTP `rel="canonical"` (en lugar de una etiqueta HTML) para indicar la URL canónica de un documento admitido por la Búsqueda, incluidos documentos no HTML como archivos PDF.

- 👍 Podemos configurar nuestro servidor.
- ¿`usar un encabezado HTTP rel="canonical" en lugar de una etiqueta HTML` enfatiza una preferencia por la solución del encabezado HTTP?

De [#11553](https://github.com/discourse/discourse/pull/11553)

> Googlebot maneja los encabezados `no-index` de manera muy elegante. Aconseja dejar tantas rutas como sea posible abiertas y utiliza encabezados para reglas de alta fidelidad con respecto a los índices.

Quizás Google maneja los encabezados de enlace `canonical` con la misma elegancia que los encabezados `no-index`.

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [8 Marzo, 2022 03:36 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/2 "2022-03-08T03:36:05Z")

</div>

Me está costando esto, al leer la recomendación de Google parece que no le importa particularmente.

> Las recomendaciones para la cabecera HTTP `rel="canonical"` son las mismas que la etiqueta `link` `rel="canonical"`.

Supongo que no hay mucho que perder y es posible que una combinación de no indexar más rel canonical sea la receta correcta de Google. Pero no estoy seguro.

¿@Falco?

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [8 Marzo, 2022 03:48 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/3 "2022-03-08T03:48:25Z")

</div>

Esto revierte la configuración del sitio introducida recientemente a lo que es básicamente una no-operación (moviendo lo que enviamos como una etiqueta de encabezado en un encabezado, sin cambios semánticos).

No quiero este cambio tal como está.

---

<div class="post-metadata">

### Author: ![rrit](https://avatars.discourse-cdn.com/v4/letter/r/b5ac83/32.png) [@rrit](https://meta.discourse.org/u/rrit)
#### Post date: [8 Marzo, 2022 08:40 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/4 "2022-03-08T08:40:11Z")

</div>

> [@sam](#):
>
> Supongo que no hay mucho que perder y es posible que una combinación de no indexar más rel canonical sea la receta correcta de Google. Pero no estoy seguro.

Para la nueva configuración predeterminada `SiteSetting.allow_indexing_non_canonical_urls = false`, esta es la forma en que está implementada ahora mismo y se mantiene así:

- encabezado `noindex`
- etiqueta de enlace html `canonical` (podría ser ignorada)

Sin parche y `SiteSetting.allow_indexing_non_canonical_urls = true`

- – sin encabezado –
- etiqueta de enlace html `canonical`

Con parche y `SiteSetting.allow_indexing_non_canonical_urls = true`

- encabezado: `Link: <https://forum.example.com/t/test-example/1234>; rel="canonical"`
- etiqueta de enlace html `canonical` (podría ser ignorada, pero de todos modos es igual que el encabezado)

Toda la idea detrás de esto:  
Establecer `canonical` como **encabezado http** para obtener el mismo beneficio que el **encabezado http** `noindex`, es decir, una indexación más rápida.  
Por lo tanto, esto podría hacer que `noindex` sea obsoleto con sus implicaciones inciertas.

Otro punto sobre `noindex` vs. `canonical`:

- `noindex` es _más que una señal muy fuerte_ para no incluir la página en el índice de búsqueda.  
Pero con `noindex`, el contenido de la página todavía es procesado por Google Bot para extraer enlaces (existe la opción adicional `nofollow` para deshabilitar esto).
- `canonical` es una _señal fuerte_ de que el contenido a rastrear está en alguna otra URL canónica.  
En caso de que Google Bot decida aceptar esta _señal_ para una página, existe una gran posibilidad de que no procese el contenido de la página en absoluto, y solo procese la URL canónica.

* * *

Este es un _‘experimento mental’_. No está implementado en ninguna parte y nunca recomiendo implementarlo:

- encabezado `noindex`
- metaetiqueta html `noindex` (en lugar de: etiqueta de enlace html `canonical`)

– O –

- – sin encabezado –
- metaetiqueta html `noindex`

¿Por qué implementarlo o no implementarlo de esta manera?

---

<div class="post-metadata">

### Author: ![rrit](https://avatars.discourse-cdn.com/v4/letter/r/b5ac83/32.png) [@rrit](https://meta.discourse.org/u/rrit)
#### Post date: [8 Marzo, 2022 09:26 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/5 "2022-03-08T09:26:16Z")

</div>

> [@Falco](#):
>
> Esto revierte la configuración del sitio introducida recientemente a lo que es básicamente una operación nula (mover lo que enviamos como etiqueta de encabezado en un encabezado, sin cambios semánticos).

Este cambio no es una _‘operación nula’_:  
Google puede manejar encabezados y contenido HTML en diferentes etapas de sus colas de procesamiento. Al enviar encabezados, podríamos omitir colas de procesamiento adicionales (por ejemplo, la Cola de Renderizado) y, por lo tanto, liberar presupuesto de rastreo para páginas más importantes.

Ver [In-Depth Guide to How Google Search Works | Google Search Central &nbsp;|&nbsp; Documentation &nbsp;|&nbsp; Google for Developers](https://developers.google.com/search/docs/advanced/guidelines/how-search-works?hl=en#indexing)

> [@](#):
>
> En algún punto entre el rastreo y la indexación, Google determina si una página es un [duplicado o canónico](https://developers.google.com/search/docs/advanced/crawling/consolidate-duplicate-urls) de otra página. Si la página se considera un duplicado, se rastreará con mucha menos frecuencia.

 ![googlebot-crawl-render-index](https://global.discourse-cdn.com/meta/original/3X/4/9/4907e2c4a7d2f8f654ed7b85934e93f19b0427c0.png)

(El único gráfico de la cola de procesamiento que he encontrado: [Understand JavaScript SEO Basics | Google Search Central &nbsp;|&nbsp; Documentation &nbsp;|&nbsp; Google for Developers](https://developers.google.com/search/docs/advanced/javascript/javascript-seo-basics?hl=en#how-googlebot-processes-javascript))

---

<div class="post-metadata">

### Author: ![rrit](https://avatars.discourse-cdn.com/v4/letter/r/b5ac83/32.png) [@rrit](https://meta.discourse.org/u/rrit)
#### Post date: [20 Marzo, 2022 14:10 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/6 "2022-03-20T14:10:49Z")

</div>

> [@Falco](#):
>
> Esto revierte la configuración del sitio introducida recientemente a lo que es básicamente una no-operación (mover lo que enviamos como una etiqueta de encabezado, sin cambios semánticos).
> 
> No quiero este cambio tal como está.

El cambio de `noindex` se ha revertido recientemente:

- [Search engines now blocked from indexing non-canonical pages - #30 by sam](https://meta.discourse.org/t/search-engines-now-blocked-from-indexing-non-canonical-pages/218985/30?u=rrit)
- [FEATURE: enable canonical url indexing by SamSaffron · Pull Request #16196 · discourse/discourse · GitHub](https://github.com/discourse/discourse/pull/16196)

¿Podrías echar un nuevo vistazo a esta PR?:

> <https://github.com/discourse/discourse/pull/16113>
>
> The html response \*body\* already has a canonical link-tag.
> 
> This might save cr…awler resources for non-canonical pages:
> If the crawler trusts the additional canonical link response \*header\*, it does not need to parse/handle the html response \*body\*.

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [21 Marzo, 2022 00:14 UTC](https://meta.discourse.org/t/send-canonical-link-header-instead-of-noindex-header/220213/7 "2022-03-21T00:14:17Z")

</div>

No estoy fuertemente en contra de esto, pero parece muy menor. Google siempre está descargando contenido hoy en día, dudo que guardar un análisis HTML realmente marque una diferencia material.

Hay muchas otras áreas en las que centrarse primero, los microdatos son probablemente el primer lugar que necesita atención.
