设为首页 收藏本站
查看: 1839|回复: 0

[经验分享] 运用python抓取博客园首页的所有数据,而且定时持续抓取新公布的内容存入mongodb中

[复制链接]

尚未签到

发表于 2017-12-16 18:34:07 | 显示全部楼层 |阅读模式
依赖包:  

  
1.jieba
  

  
2.pymongo
  

  
3.HTMLParser
  

  
# -*- coding: utf-8 -*-
  
"""
  
@author: jiangfuqiang
  
"""
  

  
from HTMLParser import  HTMLParser
  
import re
  
import time
  
from datetime import  date
  
import pymongo
  
import urllib2
  
import sys
  
import traceback
  
import jieba
  

  
default_encoding = 'utf-8'
  
if sys.getdefaultencoding() != default_encoding:
  reload(sys)
  sys.setdefaultencoding(default_encoding)
  
isExist = False
  

  
class FetchCnblog(HTMLParser):

  def __init__(self,>  HTMLParser.__init__(self)
  self.result = []
  self.data = {}
  self.isTitleLink = False

  self.id =>  self.isSummary = False
  self.isPostItem = False
  self.isArticleView = False
  

  

  def handle_data(self, data):
  if self.isTitleLink and self.isPostItem:
  self.data['title'] = data
  self.isTitleLink = False
  elif self.isSummary and self.isPostItem:
  data = data.strip()
  if data:
  self.data['desc'] = data
  

  

  def handle_starttag(self, tag, attrs):
  if tag == 'a':
  for key, value in attrs:
  if key == 'class':
  if value == 'titlelnk':
  self.isTitleLink = True
  elif value == 'gray' and self.isArticleView:
  self.isArticleView = False
  for key, value in attrs:
  if key == 'href':
  self.data['readmoreLink'] = value
  reg = 'd+'
  result = re.search(reg,value)
  self.isPostItem = False
  

  if result:
  self.data['id'] = int(result.group())
  else:
  self.data = {}
  return
  if self.data['id'] <= self.id:
  self.data = {}
  isExist = True
  return
  else:
  self.data['srouce'] = "www.cnblogs.com"
  self.data['source_key'] = 'cnblogs'
  self.data['fetchTime'] = str(date.today())
  self.data['keyword'] = ",".join(jieba.cut(self.data['title']))
  self.result.append(self.data)
  self.data = {}
  

  elif tag == 'p':
  for key, value in attrs:
  if key == 'class' and value == 'post_item_summary':
  self.isSummary = True
  elif tag == 'img':
  for key, value in attrs:
  if key == 'class' and value == 'pfs':
  for key, value in attrs:
  if key == 'src':
  self.data['imgSrc'] = value
  

  

  elif tag == 'div':
  for key, value in attrs:
  if key == 'class' and value == 'post_item_foot':
  self.isSummary = False
  elif key == 'class' and value == 'post_item':
  self.isPostItem = True
  elif tag == 'span':
  for key , value in attrs:
  if key == 'class' and value == 'article_view':
  self.isArticleView = True
  

  

  def getResult(self):
  

  return self.result
  

  

  
if __name__ == "__main__":
  con = pymongo.Connection('localhost', 27017)
  db = con.blog
  fetchblog = db.fetch_blog
  record = db.record
  url = "http://www.cnblogs.com/sitehome/p/%d"
  count = 1
  flag = False
  headers={
  'User-Agent':'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US。 rv:1.9.1.6) Gecko/20091201 Firefox/3.5.6'}
  reco = record.find_one({"type":'cnblogs'})
  id = 0
  if reco:
  id = reco['maxId']
  while isExist == False:
  try:
  req = urllib2.Request(url%count,headers=headers)
  request = urllib2.urlopen(req)
  data = request.read()
  fj = FetchCnblog(id)
  fj.feed(data)
  result = fj.getResult()
  if len(result) < 1:
  isExist = True
  else:
  if flag == False:
  flag = True
  dic = result[0]
  id = int(dic['id'])
  record.update({"type":'cnblogs'},{"$set":{'maxId':id}},True,False)
  result.reverse()
  for doc in result:
  fetchblog.insert(doc)
  print "page is %d"%count
  count += 1
  

  time.sleep(5)
  except Exception, e:
  traceback.print_exc()
  print "parse error",e
  

  
程序假设在linux,mac下运行。在可在crontab -e中设置定时任务,假设在windows运行,则自己再在程序里加个定时器就可以

运维网声明 1、欢迎大家加入本站运维交流群:群②:261659950 群⑤:202807635 群⑦870801961 群⑧679858003
2、本站所有主题由该帖子作者发表,该帖子作者与运维网享有帖子相关版权
3、所有作品的著作权均归原作者享有,请您和我们一样尊重他人的著作权等合法权益。如果您对作品感到满意,请购买正版
4、禁止制作、复制、发布和传播具有反动、淫秽、色情、暴力、凶杀等内容的信息,一经发现立即删除。若您因此触犯法律,一切后果自负,我们对此不承担任何责任
5、所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其内容的准确性、可靠性、正当性、安全性、合法性等负责,亦不承担任何法律责任
6、所有作品仅供您个人学习、研究或欣赏,不得用于商业或者其他用途,否则,一切后果均由您自己承担,我们对此不承担任何法律责任
7、如涉及侵犯版权等问题,请您及时通知我们,我们将立即采取措施予以解决
8、联系人Email:admin@iyunv.com 网址:www.yunweiku.com

所有资源均系网友上传或者通过网络收集,我们仅提供一个展示、介绍、观摩学习的平台,我们不对其承担任何法律责任,如涉及侵犯版权等问题,请您及时通知我们,我们将立即处理,联系人Email:kefu@iyunv.com,QQ:1061981298 本贴地址:https://www.yunweiku.com/thread-424779-1-1.html 上篇帖子: 使用React、Node.js、MongoDB、Socket.IO开发一个角色投票应用的学习过程(二) 下篇帖子: Mongodb~Linux环境下的部署~服务的部署与自动化
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

扫码加入运维网微信交流群X

扫码加入运维网微信交流群

扫描二维码加入运维网微信交流群,最新一手资源尽在官方微信交流群!快快加入我们吧...

扫描微信二维码查看详情

客服E-mail:kefu@iyunv.com 客服QQ:1061981298


QQ群⑦:运维网交流群⑦ QQ群⑧:运维网交流群⑧ k8s群:运维网kubernetes交流群


提醒:禁止发布任何违反国家法律、法规的言论与图片等内容;本站内容均来自个人观点与网络等信息,非本站认同之观点.


本站大部分资源是网友从网上搜集分享而来,其版权均归原作者及其网站所有,我们尊重他人的合法权益,如有内容侵犯您的合法权益,请及时与我们联系进行核实删除!



合作伙伴: 青云cloud

快速回复 返回顶部 返回列表