简述
以下的代码是使用python实现的网络爬虫,抓取动态网页 http://hb.qq.com/baoliao/ 。此网页中的最新、精华下面的内容是由JavaScript动态生成的。审查网页元素与网页源码是不同。
以上是网页源码
以上是审查网页元素
所以此处不能简单的使用正则表达式来获取内容。
以下是完整的获取内容并存储到数据库的思路及源码。
实现思路:
抓取实际访问的动态页面的url – 使用正则表达式获取需要的内容 – 解析内容 – 存储内容
以上部分过程文字解释:
抓取实际访问的动态页面的url:
在火狐浏览器中,右键打开插件 使用\*\*firebug审查元素\*\* \*(没有这项的,要安装firebug插件),找到并打开\*\*网络(NET)\*\*标签页。重新加载网页,获得网页的响应信息,包括连接地址。每个连接地址都可以在浏览器中打开。本网站的动态网页访问地址是:
http://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callback=jQuery183019859437816181613\_1440723895018&\_=1440723895472
正则表达式:
正则表达式的使用有两种思路,可以参考个人有关其简述:python实现简单爬虫以及正则表达式简述
更多的细节介绍可以参考网上资料,搜索关键词: 正则表达式 python
json:
参考网上有关json的介绍,搜索关键词: json python
存储到数据库:
参考网上的使用介绍,搜索关键词: 1,mysql 2,mysql python
源码及注释
注意:使用python的版本是 2.7
#!/usr/bin/python
#指明编码
# -\*- coding: UTF-8 -\*-
#导入python库
import urllib
import urllib2
import re
import MySQLdb
import json
#定义爬虫类
class crawl1:
def getHtml(self,url=None):
#代理
user\_agent="Mozilla/5.0 (Windows NT 6.1; WOW64; rv:40.0) Gecko/20100101 Firefox/40.0"
header\={"User-Agent":user\_agent}
request\=urllib2.Request(url,headers=header)
response\=urllib2.urlopen(request)
html\=response.read()
return html
def getContent(self,html,reg):
content\=re.findall(html, reg, re.S)
return content
#连接数据库 mysql
def connectDB(self):
host\="192.168.85.21"
dbName\="test1"
user\="root"
password\="123456"
#此处添加charset='utf8'是为了在数据库中显示中文,此编码必须与数据库的编码一致
db=MySQLdb.connect(host,user,password,dbName,charset='utf8')
return db
cursorDB\=db.cursor()
return cursorDB
#创建表,SQL语言。CREATE TABLE IF NOT EXISTS 表示:表createTableName不存在时就创建
def creatTable(self,createTableName):
createTableSql\="CREATE TABLE IF NOT EXISTS "\+ createTableName+"(time VARCHAR(40),title VARCHAR(100),text VARCHAR(40),clicks VARCHAR(10))"
DB\_create\=self.connectDB()
cursor\_create\=DB\_create.cursor()
cursor\_create.execute(createTableSql)
DB\_create.close()
print 'creat table '+createTableName+' successfully'
return createTableName
#数据插入表中
def inserttable(self,insertTable,insertTime,insertTitle,insertText,insertClicks):
insertContentSql\="INSERT INTO "+insertTable+"(time,title,text,clicks)VALUES(%s,%s,%s,%s)"
# insertContentSql="INSERT INTO "+insertTable+"(time,title,text,clicks)VALUES("+insertTime+" , "+insertTitle+" , "+insertText+" , "+insertClicks+")"
DB\_insert\=self.connectDB()
cursor\_insert\=DB\_insert.cursor()
cursor\_insert.execute(insertContentSql,(insertTime,insertTitle,insertText,insertClicks))
DB\_insert.commit()
DB\_insert.close()
print 'inert contents to '+insertTable+' successfully'
url\="http://baoliao.hb.qq.com/api/report/NewIndexReportsList/cityid/18/num/20/pageno/1?callback=jQuery183019859437816181613\_1440723895018&\_=1440723895472"
#正则表达式,获取js,时间,标题,文本内容,点击量(浏览次数)
reg\_jason=r'.\*?jQuery.\*?\\((.\*)\\)'
reg\_time\=r'.\*?"create\_time":"(.\*?)"'
reg\_title\=r'.\*?"title":"(.\*?)".\*?'
reg\_text\=r'.\*?"content":"(.\*?)".\*?'
reg\_clicks\=r'.\*?"counter\_clicks":"(.\*?)"'
#实例化crawl()对象
crawl=crawl1()
html\=crawl.getHtml(url)
html\_jason\=re.findall(reg\_jason, html, re.S)
html\_need\=json.loads(html\_jason\[0\])
print len(html\_need)
print len(html\_need\['data'\]\['list'\])
table\=crawl.creatTable('yh1')
for i in range(len(html\_need\['data'\]\['list'\])):
creatTime\=html\_need\['data'\]\['list'\]\[i\]\['create\_time'\]
title\=html\_need\['data'\]\['list'\]\[i\]\['title'\]
content\=html\_need\['data'\]\['list'\]\[i\]\['content'\]
clicks\=html\_need\['data'\]\['list'\]\[i\]\['counter\_clicks'\]
crawl.inserttable(table,creatTime,title,content,clicks)
最后这里给大家免费分享一份Python学习资料,包含了视频、源码、课件,希望能够帮助到那些不满现状,想提示自己却又没用方向的朋友,也可以和我一起来交流呀!
编辑资料、学习路线图、源代码、软件安装包等!【点击这里】领取!