关于ip:yandexbot-ip-地址段

25次阅读

共计 717 个字符,预计需要花费 2 分钟才能阅读完成。

YandexBot 是 Yandex 的搜索引擎的爬虫。Yandex 是一家俄罗斯互联网公司,在俄罗斯经营最大的搜索引擎,在该国领有约 60% 的市场份额。截至 2012 年 4 月,Yandex 排名寰球第五大搜索引擎,每天有超过 1.5 亿次搜寻,访客超过 2550 万。

常常有网友问我如何屏蔽 yandexbot,或者如何查问 yandexbot ip range(yandex ip 地址段)?

这篇文章中我具体介绍一下这两个问题。

如何屏蔽 yandexbot

咱们能够通过 robots.txt 屏蔽 yandexbot 的爬虫,上面是示例:

User-agent: Yandex

Disallow: /

这样咱们就屏蔽了 yandexbot 抓取所有页面。

如果咱们只想 yandexbot 抓取局部页面,上面是写法示例:

User-agent: Yandex

Allow: /public

Disallow: /

下面除了 /public 页面容许被 yandexbot 拜访之外,其余都禁止 yandexbot 爬虫抓取。

通过 IP 地址段屏蔽 yandexbot

yandexbot 的 ASN 是 AS13238、AS208722 这两个,咱们能够通过 ASN 查问获取 ASN 的 IP 地址段。

将查问的 IP 地址退出到黑名单中就能够屏蔽 yandexbot 的目标了。

同时咱们能够找到爬虫查问这个工具,间接输出 IP 地址,就能够判断 IP 是否属于 yandexbot 的。

总结

这篇文章次要介绍了屏蔽 yandexbot 的两种办法,一种是:通过 robots.txt 协定,一个是通过 yandexbot ip range 的办法来屏蔽

当然因为 yandexbot 属于搜索引擎爬虫,能够为咱们带来流量,所以在 yandexbot 没有影响到你服务器性能的状况下,尽量不要屏蔽它。

正文完
 0