| 蜘蛛 | 引擎 | User-Agent(点击复制) | 已知 IP / 验证方法 |
|---|
搜索引擎爬虫(蜘蛛)会抓取你的网页以便建立索引。本页列出最常见的爬虫——Googlebot、Bingbot、百度 Baiduspider、YandexBot、DuckDuckBot、360Spider、搜狗蜘蛛、字节 Bytespider(今日头条)以及神马 Yisou——给出它们发送的 User-Agent 字符串、各搜索引擎公布的 IP 段,以及如何辨别真假蜘蛛。
由于任何脚本都能在 User-Agent 里写上"Googlebot",可靠的验证方式是"正向确认的反向 DNS":先对来访 IP 做反向 DNS,确认主机名属于该引擎的官方域名(如 googlebot.com 或 crawl.baidu.com),再对该主机名做正向 DNS,检查它是否解析回同一个 IP。点击任意 User-Agent 即可复制。在搜索框输入蜘蛛名、引擎或反查域名即可过滤。全部在浏览器本地运行。