创新互联建站导读:想要更加准确知道蜘蛛抓取数据,查看网站日志是最靠谱的,其他的各种工具也都是基于网站日志,提取里面的数据,但这些工具显然没有纯手工那么准确。
创新互联建站主打移动网站、成都网站设计、网站制作、网站改版、网络推广、网站维护、域名与空间、等互联网信息服务,为各行业提供服务。在技术实力的保障下,我们为客户承诺稳定,放心的服务,根据网站的内容与功能再决定采用什么样的设计。最后,要实现符合网站需求的内容、功能与设计,我们还会规划稳定安全的技术方案做保障。
问题:蜘蛛爬取情况通过什么方式查看准确?
回答:想要更加准确知道蜘蛛抓取数据,查看网站日志是最靠谱的,其他的各种工具也都是基于网站日志,提取里面的数据,但这些工具显然没有纯手工那么准确。
这里有个问题要注意:虽然网站日志里面能够统计到所有的蜘蛛抓取记录,但这里面也有些是伪蜘蛛,并不是真正的搜索引擎蜘蛛,对于这些要过滤掉。但如果“蜘蛛”的ip很多,要识别起来就得费些时间了。
以下是百度搜索提供的鉴别方法:
建议您使用DNS反查方式来确定抓取来源的ip是否属于百度,根据平台不同验证方法不同,如linux/windows/os三种平台下的验证方法分别如下:
1、在linux平台下,您可以使用host ip命令反解ip来判断是否来自Baiduspider的抓取。Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。
$ host 123.125.66.120
120.66.125.123.in-addr.arpa domain name pointer
baiduspider-123-125-66-120.crawl.baidu.com.
host 119.63.195.254
254.195.63.119.in-addr.arpa domain name pointer
BaiduMobaider-119-63-195-254.crawl.baidu.jp.
2 在windows平台或者IBM OS/2平台下,您可以使用nslookup ip命令反解ip来 判断是否来自Baiduspider的抓取。打开命令处理器 输入nslookup xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 来判断是否来自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。
3 在mac os平台下,您可以使用dig 命令反解ip来 判断是否来自Baiduspider的抓取。打开命令处理器 输入dig xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 来判断是否来自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。
关于如何手动分析网站日志的问题,创新互联之前写过网站日志如何分析的文章,里面做了详细的介绍,大家可以去看下。
当然也有些工具可以很方便的统计出网站日志的信息,只不过这些工具统计到的没有手动统计的那么详细,大家可以根据具体的情况去选择是利用工具还是手动。但相对来说,手动分析网站日志得到的数据会更加准确。
这里再提醒下:网上有人提到了降权蜘蛛、新站蜘蛛、权重蜘蛛等等,这些纯属胡说八道,大家不要轻易相信这些所谓的大师说法!
分析蜘蛛抓取为网站收录服务的,如果网站收录都正常的话,没有必要频繁的去统计蜘蛛抓取。如果觉得网站收录情况不好,这时候可以去分析网站日子,看看是不是有些页面没有被蜘蛛抓取到。如果没有被抓取,可以通过提交链接、增加站内锚文本链接、外链等方式来提升抓取率,进而提升页面收录。