蜘蛛爬虫行为分析
Linux shell命令
1. 百度蜘蛛爬行的次数
2. 百度蜘蛛的详细记录(Ctrl C可以终止)
3. 百度蜘蛛抓取首页的详细记录
百度蜘蛛好像对首页非常热爱每个钟头都来光顾,而谷歌和雅虎蜘蛛更喜欢内页。
4. 百度蜘蛛派性记录时间点分布
5. 百度蜘蛛爬行页面按次数降序列表
文中的Baiduspider 改成Googlebot都可以查看谷歌的数据,鉴于大陆的特殊性,大家应该对百度的log更为关注。
附:(Mediapartners-Google)Google adsense蜘蛛的详细爬行记录
cat access.log | grep Mediapartners
Mediapartners-Google是什么呢?Google adsense广告之所以能与内容相关,因为每个包含着adsense的广告被访问后,很快就有个Mediapartners-Google蜘蛛来到这个页面,所以几分钟后再刷新就能显示相关性广告了
最后更新于