YandexBot 是 Yandex 的搜索引擎的爬虫。Yandex 是一家俄罗斯互联网公司,在俄罗斯经营最大的搜索引擎,在该国领有约 60% 的市场份额。截至 2012 年 4 月,Yandex 排名寰球第五大搜索引擎,每天有超过 1.5 亿次搜寻,访客超过 2550 万。
常常有网友问我如何屏蔽 yandexbot,或者如何查问 yandexbot ip range(yandex ip 地址段)?
这篇文章中我具体介绍一下这两个问题。
如何屏蔽 yandexbot
咱们能够通过 robots.txt 屏蔽 yandexbot 的爬虫,上面是示例:
User-agent: Yandex
Disallow: /
这样咱们就屏蔽了 yandexbot 抓取所有页面。
如果咱们只想 yandexbot 抓取局部页面,上面是写法示例:
User-agent: Yandex
Allow: /public
Disallow: /
下面除了 /public
页面容许被 yandexbot 拜访之外,其余都禁止 yandexbot 爬虫抓取。
通过 IP 地址段屏蔽 yandexbot
yandexbot 的 ASN 是 AS13238、AS208722 这两个,咱们能够通过 ASN 查问获取 ASN 的 IP 地址段。
将查问的 IP 地址退出到黑名单中就能够屏蔽 yandexbot 的目标了。
同时咱们能够找到爬虫查问这个工具,间接输出 IP 地址,就能够判断 IP 是否属于 yandexbot 的。
总结
这篇文章次要介绍了屏蔽 yandexbot 的两种办法,一种是:通过 robots.txt 协定,一个是通过 yandexbot ip range 的办法来屏蔽
当然因为 yandexbot 属于搜索引擎爬虫,能够为咱们带来流量,所以在 yandexbot 没有影响到你服务器性能的状况下,尽量不要屏蔽它。