# Google搜索索引与话语

**URL:** https://meta.discourse.org/t/google-search-indexing-and-discourse/154240
**Category:** Data & reporting
**Created:** [2020年六月8日 21:54 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240 "2020-06-08T21:54:11Z")
**Posts on this page:** 10
**Page:** 1

<div class="post-metadata">

### Author: ![kirupa](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kirupa/32/374711_2.png) [@kirupa](https://meta.discourse.org/u/kirupa)
#### Post date: [2020年六月8日 21:54 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/1 "2020-06-08T21:54:12Z")

</div>

大家好！

我阅读了关于 Google 爬虫在索引 Discourse 论坛方面没有任何困难的各类帖子。我的问题略有不同：每个主题是否都被 Google 视为可索引的“页面”？我之所以这样问，是因为我们论坛中很大一部分主题并未出现在 Google 的数据库中。这一点可以通过查看 Google Search Console 数据得到证实：

 ![image](https://global.discourse-cdn.com/meta/original/3X/c/e/cee6660ed666d734bf82ae20fc7b4d010e8486c0.png)

目前只有大约 17,000 条记录，而 [我们的论坛](https://forum.kirupa.com) 拥有数十万甚至可能数百万个主题。robots.txt 错误是针对那些确实不应被索引的页面。这看起来像是爬虫没有像预期那样自动访问所有较旧的主题。

是否有某个设置需要切换，以确保更多旧主题能够及时被索引？对于首屏内容，Google 的索引和搜索结果都非常好。这个问题仅影响那些位于首屏以下的主题。

谢谢，  
Kirupa

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [2020年六月8日 22:08 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/2 "2020-06-08T22:08:42Z")

</div>

为了进行一项实验，我使用 GoogleBot 用户代理字符串通过爬虫视图加载了 Meta 站点。然后一直浏览到我们最新列表的第 666 页，这些主题最后更新于 2017 年年中，距今已近 3 年。

列表中的一个主题是 [在 Ionic 应用中深度集成 Discourse](https://meta.discourse.org/t/deep-integration-of-discourse-within-an-ionic-app/68001)。我使用未登录状态的 Google 搜索，搜索“integration discourse ionic”时，该主题竟排在结果的第一位！！

 ![image](https://global.discourse-cdn.com/meta/original/3X/2/d/2d05e39cd3df9f71eae5534000f085178fa5d156.png)

> [@kirupa](#):
>
> 目前仅有约 1.7 万条条目，而 [我们的论坛](https://forum.kirupa.com) 拥有数十万甚至可能数百万个主题。

Meta 是一个“小型”实例，主题数量不足 3 万个，但所有主题似乎都被正确索引。由于这是一个老域名，并且我们是所有与 Discourse 相关内容的排名第一结果，因此我们在 GoogleBot 那里获得了足够的“信誉”，使得爬虫能在我们的域名上运行足够长的时间，以抓取所有必要的内容。

您的论坛是否从旧软件迁移到了 Discourse？

---

<div class="post-metadata">

### Author: ![sam](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/sam/32/102149_2.png) [@sam](https://meta.discourse.org/u/sam)
#### Post date: [2020年六月8日 22:14 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/3 "2020-06-08T22:14:11Z")

</div>

如果您需要加快索引速度，可以尝试使用站点地图插件。

标准爬取会抓取所有内容，但站点地图可能有助于更快地将内容纳入索引。

如果您这样做了，请分享结果。

另外，能否提供 5 个您论坛上的优质原创内容示例，这些内容在 Google 上完全找不到？

---

<div class="post-metadata">

### Author: ![Stranik](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/stranik/32/85638_2.png) [@Stranik](https://meta.discourse.org/u/Stranik)
#### Post date: [2020年六月8日 22:46 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/4 "2020-06-08T22:46:01Z")

</div>

也许谷歌还会关注帖子的访问量（如果有计数器的话），或者该帖子包含有活跃跳转的链接。谷歌可能不会访问它认为对用户“不感兴趣”的某些页面。这里有一个技巧，通常可以这样操作：这是 SEO 的做法。从其他资源放置一个链接并点击它。你不需要太多，只需几次（跳转）通常就足以引起谷歌的兴趣。人们去哪里，它就去哪里。

在大型谷歌站点上，仅仅知道页面存在是不够的。它需要更多的信号：活跃度、点击率、浏览量等。

---

<div class="post-metadata">

### Author: ![kirupa](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kirupa/32/374711_2.png) [@kirupa](https://meta.discourse.org/u/kirupa)
#### Post date: [2020年六月9日 04:54 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/5 "2020-06-09T04:54:41Z")

</div>

@Falco - 是的，论坛确实从 vBulletin 迁移过，但那是在 2014 年底。我已移除所有指向旧论坛的公开链接，因此不存在因重复内容导致搜索引擎索引不良的风险。

@sam - 是的，这里有几个例子：

- [https://forum.kirupa.com/t/js-tip-of-the-day-using-generators-to-animate/643058（近期）](https://forum.kirupa.com/t/js-tip-of-the-day-using-generators-to-animate/643058%EF%BC%88%E8%BF%91%E6%9C%9F%EF%BC%89)
- [https://forum.kirupa.com/t/the-sinking-post/21739（旧帖子，但即使直接在](https://forum.kirupa.com/t/the-sinking-post/21739%EF%BC%88%E6%97%A7%E5%B8%96%E5%AD%90%EF%BC%8C%E4%BD%86%E5%8D%B3%E4%BD%BF%E7%9B%B4%E6%8E%A5%E5%9C%A8) [forum.kirupa.com](http://forum.kirupa.com) 范围内搜索该主题，也找不到任何结果）
- [https://forum.kirupa.com/t/js-tip-of-the-day-promises-block-rendering/643097（Google](https://forum.kirupa.com/t/js-tip-of-the-day-promises-block-rendering/643097%EF%BC%88Google) 显示了主题列表，但未显示主题本身）
- [https://forum.kirupa.com/t/etsy-flash-developer-position-working-closely-with-jared-tarbell-and-marcos-weskamp/226106（另一个旧帖子）](https://forum.kirupa.com/t/etsy-flash-developer-position-working-closely-with-jared-tarbell-and-marcos-weskamp/226106%EF%BC%88%E5%8F%A6%E4%B8%80%E4%B8%AA%E6%97%A7%E5%B8%96%E5%AD%90%EF%BC%89)

所有这些帖子都是我过去三年中曾在 Twitter 或公共 Facebook 页面上发布过的，因此它们并非被永久埋藏或隐藏。

关于站点地图插件，让我试试看。我会发布我所能找到的任何数据。感谢大家抽出时间提供帮助 🙂

此致，  
Kirupa

---

<div class="post-metadata">

### Author: ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)
#### Post date: [2020年六月9日 05:00 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/6 "2020-06-09T05:00:03Z")

</div>

> [@kirupa](#):
>
> [JS 每日小贴士：使用生成器进行动画 - Web 开发 - kirupaForum](https://forum.kirupa.com/t/js-tip-of-the-day-using-generators-to-animate/643058)（最新）

这是我搜索“js 使用生成器动画示例”得到的第三个结果。

---

<div class="post-metadata">

### Author: ![kirupa](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kirupa/32/374711_2.png) [@kirupa](https://meta.discourse.org/u/kirupa)
#### Post date: [2020年六月9日 05:07 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/7 "2020-06-09T05:07:40Z")

</div>

这也许是我今天发布的一个糟糕的例子，因为我几个小时前手动提交该页面进行索引作为测试。这是其中一个论坛管理员在 7 小时前针对该搜索词看到的内容：

 ![image](https://global.discourse-cdn.com/meta/original/3X/e/b/eb040ca6130618af4623b64666f22826c1c84835.png)

你说得对，它目前确实是排名靠前的结果之一。我想知道手动索引是否与此有关。

**编辑** ：我刚刚设置了 Sitemap 插件，并将提交站点地图供 Google 索引！

---

<div class="post-metadata">

### Author: ![neounix](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/neounix/32/215617_2.png) [@neounix](https://meta.discourse.org/u/neounix)
#### Post date: [2020年六月9日 05:49 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/8 "2020-06-09T05:49:46Z")

</div>

> [@kirupa](#):
>
> 我已经移除了指向旧论坛的所有公开链接，因此不存在因重复内容导致搜索引擎索引效果不佳的风险。

你好 @kirupa，

顺便提一下，当 Google 索引同一域名下的两个网站时（例如你的例子中的 `kirupa.com` 包含相似内容），通常所谓的“惩罚”（严格来说并非真正的“惩罚”，更像是一种“规范选择”）是指 Google 的算法会选择其中一个页面作为规范页面，该页面将在搜索结果中排名更高。（Google 甚至可能将其判定为非规范的页面从索引中移除）。

Google 对此一直表述得很清楚：在大多数情况下，“重复内容惩罚”其实是个误解。这实际上关乎“规范化”和“选择”：

> 如果您的网站包含多个内容基本相同的页面，您可以通过多种方式向 Google 指明首选的 URL。（这称为“规范化”。）[有关规范化的更多信息。](https://support.google.com/webmasters/answer/139066)（参考 1）

例如，如果您同时保留旧网站和新网站，可以使用 `link canonical` 标签告知 Google 您的新网站是 `规范网站`，Google 随后将优先索引您的新网站。

> 更好的解决方案是允许搜索引擎抓取这些 URL，但通过使用 `rel="canonical"` 链接元素、URL 参数处理工具或 301 重定向将它们标记为重复内容。在重复内容导致我们过度抓取您的网站的情况下，您还可以在 Search Console 中 [调整抓取频率设置](https://support.google.com/webmasters/answer/48620)。（参考 1）

示例：

```plaintext
<link rel="canonical" href="https://forum.kirupa.com/t/js-tip-of-the-day-using-generators-to-animate/643058" />

```

@kirupa，你还问道：

> Google 是否将每个主题视为一个可索引的“页面”？我之所以这么问，是因为我们论坛中很大一部分主题并未出现在 Google 的数据库中。

关于 Google 与无限滚动，我推荐一篇非常棒（但略显过时）的讨论，来自 Google 官方 Webmaster Central 博客（参考 2）：

> **[Infinite scroll search-friendly recommendations](https://webmasters.googleblog.com/2014/02/infinite-scroll-search-friendly.html)**
>
> Official news on crawling and indexing sites for the Google index

@kirupa，一种实用（而非理论）的验证方法是使用 GSC（Google Search Console）查看其提供的“截图”，以了解它们如何呈现您的页面。这可以通过 GSC 中的“检查移动端友好度”功能轻松实现（例如）；如果您在 Discourse 中发布了一篇非常长的帖子，可以检查 Google 索引（读取并索引）了多少内容。关于无限滚动以及 Google 如何索引这些页面，存在许多不同观点。您可以使用 GSC 检查自己的页面，亲自验证。

根据 Google 的 Martin Splitt（参见参考 3）在 2020 年 4 月 14 日的说明：

> Splitt 举例说明了一个依赖无限滚动（也称为“懒加载”）来加载新内容的新闻网站。
> 
> 这意味着网页（在此例中为首页）在访客滚动到屏幕底部之前不会加载额外内容。
> 
> Splitt 解释了这为何是个问题：_ **“Googlebot 不会做什么？它不会滚动。”** _
> 
> Googlebot 的做法是访问页面并抓取立即可见的内容。
> 
> 根据 Splitt 的陈述，Googlebot 无法抓取仅在页面滚动后才加载的内容。

如前所述，@kirupa，您可以使用 GSC 中的工具检查自己的页面，这些工具将展示 Google 如何查看（并索引）您的页面的快照。

根据 Google 的 Splitt 在 2020 年 4 月的说法：_ **“Googlebot 不会滚动。”** _（转述）

关于“Google 搜索索引与 Discourse”这一主题问题，每位网站所有者都可以轻松使用 GSC 来确定 Googlebot 如何索引特定页面。

我的建议是，如果您有任何关于 Googlebot 如何索引您页面的疑问，请使用 GSC（Google Search Console）检查自己的页面。希望这能对您有所帮助。

参考：

1. [How to Specify a Canonical with rel="canonical" and Other Methods | Google Search Central &nbsp;|&nbsp; Documentation &nbsp;|&nbsp; Google for Developers](https://support.google.com/webmasters/answer/66359?hl=en)

2. [Official Google Webmaster Central Blog: Infinite scroll search-friendly recommendations](https://webmasters.googleblog.com/2014/02/infinite-scroll-search-friendly.html)

3. [Google’s Martin Splitt Explains Why Infinite Scroll Causes SEO Problems](https://www.searchenginejournal.com/google-infinite-scroll-lazy-loading/363184/)

---

<div class="post-metadata">

### Author: ![kirupa](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/kirupa/32/374711_2.png) [@kirupa](https://meta.discourse.org/u/kirupa)
#### Post date: [2020年六月9日 06:39 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/9 "2020-06-09T06:39:19Z")

</div>

非常感谢你的精彩回复，@neounix！我稍后会逐一查看并采纳你的建议 🙂

暂时恢复旧论坛（[kirupa.com/forum）的显示，并在新/活跃论坛上添加规范元标签，这似乎是个好主意。我本周会尝试一下。](http://kirupa.com/forum%EF%BC%89%E7%9A%84%E6%98%BE%E7%A4%BA%EF%BC%8C%E5%B9%B6%E5%9C%A8%E6%96%B0/%E6%B4%BB%E8%B7%83%E8%AE%BA%E5%9D%9B%E4%B8%8A%E6%B7%BB%E5%8A%A0%E8%A7%84%E8%8C%83%E5%85%83%E6%A0%87%E7%AD%BE%EF%BC%8C%E8%BF%99%E4%BC%BC%E4%B9%8E%E6%98%AF%E4%B8%AA%E5%A5%BD%E4%B8%BB%E6%84%8F%E3%80%82%E6%88%91%E6%9C%AC%E5%91%A8%E4%BC%9A%E5%B0%9D%E8%AF%95%E4%B8%80%E4%B8%8B%E3%80%82)

在此期间，我已向 Google 搜索控制台提交了一个包含约 30 万条记录的站点地图。

---

<div class="post-metadata">

### Author: ![neounix](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/neounix/32/215617_2.png) [@neounix](https://meta.discourse.org/u/neounix)
#### Post date: [2020年六月9日 06:59 UTC](https://meta.discourse.org/t/google-search-indexing-and-discourse/154240/10 "2020-06-09T06:59:50Z")

</div>

> [@kirupa](#):
>
> 恢复旧论坛的显示（[kirupa.com/forum](http://kirupa.com/forum)）并在新的/活跃的论坛上设置规范 meta 标签似乎是个好主意。我本周会尝试一下。

亲爱的 @kirupa，

不客气。

供您参考。

Discourse 论坛已经为各个主题自动添加了规范标签。

这是您论坛的一个链接，以及源代码中显示其规范标签的示例（见上文）：

![Screen Shot 2020-06-09 at 1.48.45 PM](https://cdck-file-uploads-global.s3.dualstack.us-west-2.amazonaws.com/meta/optimized/3X/b/8/b80b3b4d028f52647f1dc7b514ad00b45a195370_2_690x34.jpeg)

您可以看到您的 Discourse 页面已经包含规范标签。

一个“技巧”（虽不受官方支持但可行）是在您的“旧论坛”中添加相同的标签（指向新论坛），或者至少确保您的旧论坛不包含规范标签。

不过，说实话，要在旧论坛的数据库中找到对应 Discourse 论坛的正确主题 ID 需要一些工作（我们曾出于其他原因做过类似的事情，因此根据我们的经验，这是可行的，因为我们目前在两个论坛中都使用这些信息）。

Discourse 中有一个名为 post custom fields 的数据库表，其中包含了从旧论坛（主题和帖子 ID）到新论坛的映射关系；如果您愿意，可以从 Discourse 中导出这些数据，并将其添加到您的旧论坛中。

然后，如果您愿意（我并非推荐某种特定方式），就可以根据您的 SEO 策略以及您希望如何处理此事，轻松地在旧论坛中创建指向新 Discourse 论坛的规范标签。

有些人更倾向于对旧论坛页面进行 301 重定向。这完全取决于您以及您希望如何管理这些内容！请记住，如果您希望进行 301 重定向，同样需要获取 Discourse 主题（及帖子）ID 与旧论坛主题和帖子 ID 之间的映射关系。

希望这个快速跟进能对您有所帮助，@kirupa。

祝好，并祝您愉快！
