# 如何找出匿名浏览量激增的原因

**URL:** <https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415>\
**Category:** Data & reporting\
**Created:** [2022年三月8日 14:20 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415 "2022-03-08T14:20:18Z")\
**Posts on this page:** 11\
**Page:** 1

<div class="post-metadata">

**Author:** ![efuetatem1](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/efuetatem1/32/63191_2.png) [@efuetatem1](https://meta.discourse.org/u/efuetatem1)\
**Post date:** [2022年三月8日 14:20 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/1 "2022-03-08T14:20:18Z")

</div>

您好，

我注意到在 2022 年 2 月 15 日至 16 日期间，在我们自托管的 DigitalOcean Discourse 实例上出现了一个奇怪的现象。如下图所示，每天的匿名用户数量从大约每天 1000 人激增到平均每天 10000 人。我试图找出其根源，但徒劳无功。

 ![image](https://global.discourse-cdn.com/meta/original/3X/2/b/2b3e95860814123cbdecf932dd969f8246cad7c7.png)

我似乎无法将其与我们内容的浏览量、Google Search Console 或 Google Analytics 的统计数据进行匹配。我们也尝试检查了日志，但没有太多发现。

 ![image](https://global.discourse-cdn.com/meta/original/3X/a/1/a1bc9466acc7362de2fef32e7237c8930f9378e5.png)

有人知道可能是什么原因造成的吗？

我们的社区：[https://community.world-like-home.com/](https://community.world-like-home.com/)

非常感谢。

---

<div class="post-metadata">

**Author:** ![osioke](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/osioke/32/238946_2.png) [@osioke](https://meta.discourse.org/u/osioke)\
**Post date:** [2022年三月8日 14:29 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/2 "2022-03-08T14:29:37Z")

</div>

> [@efuetatem1](#):
>
> 有人知道可能是什么原因吗？

要以一种能说明你具体网站的方式来回答，这几乎是不可能的，甚至可以说是棘手的。不过，你可以开始找出原因的方法是查看仪表板中的爬虫报告，看看是否是爬虫造成的。

另外，我编辑了你的主题标题，使其更具描述性 😉

---

<div class="post-metadata">

**Author:** ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)\
**Post date:** [2022年三月8日 14:44 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/3 "2022-03-08T14:44:05Z")

</div>

你收到了很多机器人。

---

<div class="post-metadata">

**Author:** ![efuetatem1](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/efuetatem1/32/63191_2.png) [@efuetatem1](https://meta.discourse.org/u/efuetatem1)\
**Post date:** [2022年三月8日 15:47 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/4 "2022-03-08T15:47:27Z")

</div>

感谢 @osioke

但是，如果这是爬虫，我希望 Discourse 能明确地将其标记为爬虫吗？希望我没有遗漏什么？

@Jagster Discourse 是否有可能将机器人计为匿名用户？

 ![image](https://global.discourse-cdn.com/meta/original/3X/3/f/3f1d5fe05d313f729b98c3a261b5b79d90877f96.png)

---

<div class="post-metadata">

**Author:** ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)\
**Post date:** [2022年三月8日 15:57 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/5 "2022-03-08T15:57:37Z")

</div>

> [@efuetatem1](#):
>
> Discourse 是否可以将机器人计为匿名用户？

发起请求的实体会自行识别为“普通”用户或机器人。这是一个基于信誉的系统，有利有弊。

机器人生态系统中的大多数不良行为者不会将自己识别为机器人，而是会伪装成“普通”用户发出请求，在这种情况下 Discourse 无法做太多事情。

如果您熟悉命令行，可以登录到您的服务器并使用以下命令来跟踪大多数请求的来源：

```plaintext
cd /var/discourse/shared/standalone/log/var-log/nginx/
grep " 200 " access.log | awk '{print $4}' | sort | uniq -c | sort -r

```

---

<div class="post-metadata">

**Author:** ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)\
**Post date:** [2022年三月8日 17:21 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/6 "2022-03-08T17:21:41Z")

</div>

> [@efuetatem1](#):
>
> Discourse 是否可以将机器人计为匿名用户？

当然，机器人只需要识别自己为用户即可。更改用户代理非常简单——甚至您的浏览器也可以做到。Discourse 只知道那些使用……嗯，已知 UA 的机器人 😉

当然，如果某个流量更高的网站链接到您，它们也可能是真实用户。

---

<div class="post-metadata">

**Author:** ![pfaffman](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/pfaffman/32/120154_2.png) [@pfaffman](https://meta.discourse.org/u/pfaffman)\
**Post date:** [2022年三月8日 19:33 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/7 "2022-03-08T19:33:50Z")

</div>

我猜想那里上传的PDF文件可能被链接到了其他地方，所以很多人都在直接下载？那个PDF文件是有人恶意上传的，并且因为某种原因获得了大量流量吗？

---

<div class="post-metadata">

**Author:** ![efuetatem1](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/efuetatem1/32/63191_2.png) [@efuetatem1](https://meta.discourse.org/u/efuetatem1)\
**Post date:** [2022年三月9日 14:36 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/8 "2022-03-09T14:36:44Z")

</div>

谢谢你，@pfaffman，但 PDF 没有问题，实际上是我自己上传的。我只是展示图片来表明它与 discourse 显示的数千个匿名用户之间没有关联。

> [@Jagster](#):
>
> 当然，只需要一个机器人表明自己是用户。更改用户代理非常简单——甚至你的浏览器也可以做到。而 Discourse 只知道那些使用……嗯，已知 UA 的机器人。

好的，谢谢。

> [@Falco](#):
>
> 如果你熟悉命令行，可以登录到你的服务器并使用以下命令来跟踪大部分请求的来源：

谢谢你，@Falco。

你提供的命令行帮助我们追踪了导致流量激增的 IP 地址。目前，我们将继续观察，然后再决定是否[屏蔽爬虫](https://meta.discourse.org/t/how-to-block-all-crawlers-but-googles/62431)。

---

<div class="post-metadata">

**Author:** ![Ed\_S](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/ed_s/32/134015_2.png) [@Ed\_S](https://meta.discourse.org/u/Ed_S)\
**Post date:** [2022年三月9日 18:40 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/9 "2022-03-09T18:40:53Z")

</div>

> [@Falco](#):
>
> ```plaintext
> grep " 200 " access.log | awk '{print $4}' | sort | uniq -c | sort -r
> 
> ```

仅供参考，在我的案例中，绝大多数访问都是 POST 到消息总线端点。换句话说，可能是用户的浏览器。一种情况是每分钟一次，另一种情况是更频繁。

```plaintext
"POST /message-bus/<hash>/poll?dlp=t HTTP/1.1"

```

---

<div class="post-metadata">

**Author:** ![Falco](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/falco/32/179432_2.png) [@Falco](https://meta.discourse.org/u/Falco)\
**Post date:** [2022年三月9日 18:42 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/10 "2022-03-09T18:42:35Z")

</div>

这些确实是任何 Discourse 站点上的大多数请求，但它们不计入页面浏览量，因此不会反映在仪表板的“合并页面浏览量”图表中，这使得这个话题有点离题。

---

<div class="post-metadata">

**Author:** ![Ed\_S](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/ed_s/32/134015_2.png) [@Ed\_S](https://meta.discourse.org/u/Ed_S)\
**Post date:** [2022年三月9日 18:57 UTC](https://meta.discourse.org/t/how-can-i-figure-out-why-i-have-a-big-jump-in-anonymous-pageviews/220415/11 "2022-03-09T18:57:13Z")

</div>

说得有理。也许你可以在管道中添加 `grep -v POST`？
