python编写爬虫脚本并实现APScheduler调度

yuanqiao · 发表于 2015-4-20 09:17:27

　　前段时间自学了python，作为新手就想着自己写个东西能练习一下，了解到python编写爬虫脚本非常方便，且最近又学习了MongoDB相关的知识，万事具备只欠东风。
　　程序的需求是这样的，爬虫爬的页面是京东的电子书网站页面，每天会更新一些免费的电子书，爬虫会把每天更新的免费的书名以第一时间通过邮件发给我，通知我去下载。

一、编写思路：
　　　　1.爬虫脚本获取当日免费书籍信息
　　　　2.把获取到的书籍信息与数据库中的已有信息作比较，如果书籍存在不做任何操作，书籍不存在，执行插入数据库的操作，把数据的信息存入MongoDB
　　　　3.执行数据库插入操作时，把更新的数据以邮件的形式发送出来
　　　　4.用APScheduler调度框架完成python脚本调度

二、脚本的主要知识点：

1.python简单爬虫
　　本次用到的模块有urllib2用来抓取页面，导入模块如下：

import urllib2
from sgmllib import SGMLParser
　　
　　urlopen()方法获取网页HTML源码，都存储在content中，listhref()类主要的功能是解析HTML代码，处理HTML类型的半结构化文档。

content = urllib2.urlopen('http://sale.jd.com/act/yufbrhZtjx6JTV.html').read()
listhref = ListHref()
listhref.feed(content)
　　listhref()类代码可以在下面全部代码中查询到，这里只说几个关键点：
　　listhref()类继承了SGMLParser 类并重写了其中的内部方法。SGMLParser 将HTML分解成有用的片段，比如开始标记和结束标记。一旦成功地分解出某个数据为一个有用的片段，它会根据所发现的数据，调用一个自身内部的方法。为了使用这个分析器，您需要子类化 SGMLParser类，并且重写父类的这些方法。
　　SGMLParser 将 HTML 分析成不同类数据及标记，然后对每一类调用单独的方法:
开始标记 (Start_tag)
是一个开始一个块的 HTML 标记，像，， , 等，或是一个独一的标记，象或等。本例当它找到一个开始标记，SGMLParser将查找名为 start_a或do_a的方法。如果找到了，SGMLParser会使用这个标记的属性列表来调用这个方法；否则，它用这个标记的名字和属性列表来调用unknown_starttag方法。
结束标记 (End_tag)
是结束一个块的HTML标记，像，，或等。本例中当找到一个结束标记时，SGMLParser 将查找名为end_a的方法。如果找到，SGMLParser调用这个方法，否则它使用标记的名字来调用unknown_endtag。
文本数据(Text data)
获取文本块，当不满足其它各类别的任何标记时，调用handle_data获取文本。
　　以下的几类在本文中没有用到
字符引用 (Character reference)
用字符的十进制或等同的十六进制来表示的转义字符，当找到该字符，SGMLParser用字符调用 handle_charref 。
实体引用 (Entity reference)
HTML实体，像&ref，当找到该实体，SGMLParser实体的名字调用handle_entityref。
注释 (Comment)
HTML注释, 包括在之间。当找到，SGMLParser用注释内容调用handle_comment。
处理指令 (Processing instruction)
HTML处理指令，包括在

账号		自动登录	找回密码
密码			立即注册

大疆运维招人啦，

C++ :try 语句块和异常处理

C++的多态

Red Hat RHCE 8 (EX294) Cert Guide

Java/C++ 区别：看完这一篇，就够用！

别再用过时库了！这 13 个顶级 C++ 库才是

c++ size_t 和 int 的区别

[经验分享] python编写爬虫脚本并实现APScheduler调度

浏览过的版块

扫码加入运维网微信交流群