# 用户代理：lfc-discourse-public-crawler

**URL:** https://meta.discourse.org/t/user-agent-lfc-discourse-public-crawler/407069
**Category:** Bug
**Created:** [2026年七月8日 12:03 UTC](https://meta.discourse.org/t/user-agent-lfc-discourse-public-crawler/407069 "2026-07-08T12:03:15Z")
**Posts on this page:** 4
**Page:** 1

<div class="post-metadata">

### Author: ![Orioni](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/orioni/32/542679_2.png) [@Orioni](https://meta.discourse.org/u/Orioni)
#### Post date: [2026年七月8日 12:03 UTC](https://meta.discourse.org/t/user-agent-lfc-discourse-public-crawler/407069/1 "2026-07-08T12:03:16Z")

</div>

下午好，

这与其说是一个漏洞，不如说是一次尝试，以获取更多关于一个似乎是 **AI爬虫** 的信息。

在我的Cloudflare分析仪表板中，我看到60%的HTTP请求来自一个用户代理，其名称中包含“Discourse”，特别是：`lfc-discourse-public-crawler`。完整的用户代理是 `lfc-discourse-public-crawler/0.1 (+public Discourse API archival crawl)`。我从未见过这个用户代理。

其他信息：

- 仅访问主题的 `.json` 版本。
- 它似乎在新加坡运行。
- IP指向 `speedypage.com`。
- 浏览器：未知/其他。
- 操作系统：未知/其他。

而且它似乎与Discourse无关。但鉴于这样的名称，也许你也应该了解这一点。

---

<div class="post-metadata">

### Author: ![awesomerobot](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/awesomerobot/32/142900_2.png) [@awesomerobot](https://meta.discourse.org/u/awesomerobot)
#### Post date: [2026年七月8日 14:50 UTC](https://meta.discourse.org/t/user-agent-lfc-discourse-public-crawler/407069/2 "2026-07-08T14:50:20Z")

</div>

嗯，可能是任何原因，但也许是 [A basic Discourse archival tool](https://meta.discourse.org/t/a-basic-discourse-archival-tool/62614) 的一个分支？

---

<div class="post-metadata">

### Author: ![Orioni](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/orioni/32/542679_2.png) [@Orioni](https://meta.discourse.org/u/Orioni)
#### Post date: [2026年七月8日 21:15 UTC](https://meta.discourse.org/t/user-agent-lfc-discourse-public-crawler/407069/3 "2026-07-08T21:15:32Z")

</div>

谢谢 @awesomerobot。这确实可能是这里使用的工具。由于我没有使用此类工具进行任何归档，看来是有人在（或试图）复制我所有的内容。

为了尝试阻止这种行为，我通过 `robots.txt` 屏蔽了该用户代理。我还屏蔽了所有来自新加坡的请求。七天后将重新评估这一措施。

---

<div class="post-metadata">

### Author: ![Jagster](https://sea3.discourse-cdn.com/meta/user_avatar/meta.discourse.org/jagster/32/192154_2.png) [@Jagster](https://meta.discourse.org/u/Jagster)
#### Post date: [2026年七月9日 05:20 UTC](https://meta.discourse.org/t/user-agent-lfc-discourse-public-crawler/407069/4 "2026-07-09T05:20:29Z")

</div>

`robots.txt` 仅仅是一种礼貌性的建议。它本身并不能阻止任何行为。但如果用户代理遵循这些规则，则表明该爬虫并非恶意严重。

我们应当在 Nginx 层面执行此类操作 🤷‍♂️
