首页 > 其他分享 >爬虫----day05()

爬虫----day05()

时间:2023-03-21 15:02:05浏览次数:32  
标签:xpath 爬虫 day05 ---- item scrapy article desc

上节回顾

# 1 selenium
	-登录cnblogs,拿到cookie,再打开cnblogs,写入cookie,它就是登录状态
    
    -半自动点赞---》selenium生成的cookie,给requests用
    	-selenium操作浏览器,速度慢
        -requests速度快
        
    -动作链
    -自动登录12306
# 2 打码平台
	-帮我们破解验证码---》超级鹰,云打码
    -验证码图片,发送给破解平台,把结果给你,你输入进去
    -获取到验证码图片
    	-1 截图
        -2 如果图片用base64编码的,直接保存到本地即可
        
        
    -使用打码平台,登录打码平台
    
    
# 3 xpath的使用
	- /
    - //
    -.
    -..
    -标签名字
    -@属性名

    
# 4 scrapy框架
	

今日内容

0 scrapy架构介绍

img

# 引擎(EGINE)
引擎负责控制系统所有组件之间的数据流,并在某些动作发生时触发事件。

# 调度器(SCHEDULER)
用来接受引擎发过来的请求, 压入队列中, 并在引擎再次请求的时候返回. 可以想像成一个URL的优先级队列, 由它来决定下一个要抓取的网址是什么, 同时去除重复的网址

# 下载器(DOWLOADER)
用于下载网页内容, 并将网页内容返回给EGINE,下载器是建立在twisted这个高效的异步模型上的

# 爬虫(SPIDERS)--->在这里写代码
SPIDERS是开发人员自定义的类,用来解析responses,并且提取items,或者发送新的请求

# 项目管道(ITEM PIPLINES)
在items被提取后负责处理它们,主要包括清理、验证、持久化(比如存到数据库)等操作

# 下载器中间件(Downloader Middlewares)

位于Scrapy引擎和下载器之间,主要用来处理从EGINE传到DOWLOADER的请求request,已经从DOWNLOADER传到EGINE的响应response,你可用该中间件做以下几件事:设置请求头,设置cookie,使用代理,集成selenium

# 爬虫中间件(Spider Middlewares)
位于EGINE和SPIDERS之间,主要工作是处理SPIDERS的输入(即responses)和输出(即requests)

0.1 scrapy的一些命令

# 安装完成后,会有scrapy的可执行文件

# 创建项目
	scrapy startproject 项目名字  # 跟创建django一样,pycharm能直接创建django
    
    
# 创建爬虫
	scrapy genspider 名字 域名   # 创建爬虫  django的创建app
    
# pycharm打开scrapy的项目


# 运行爬虫
	scrapy crawl 爬虫名字
    
# 想点击绿色箭头运行爬虫
	新建一个run.py,写入,以后右键执行即可
    from scrapy.cmdline import execute
    execute(['scrapy','crawl','cnblogs','--nolog'])
    
    
    
# 补充:爬虫协议
 http://www.cnblogs.com/robots.txt

0.2 scrapy项目目录结构

firstscrapy 						# 项目名
    firstscrapy            # 文件夹名字,核心代码,都在这里面
    	spiders            # 爬虫的文件,里面有所有的爬虫
        	__init__.py
        	baidu.py      # 百度爬虫 
        	cnblogs.py    #cnblogs爬虫
        items.py # 有很多模型类---》以后存储的数据,都做成模型类的对象,等同于django的models.py
        middlewares.py # 中间件:爬虫中间件,下载中间件都写在这里面
        pipelines.py   #项目管道---》以后写持久化,都在这里面写
        run.py         # 自己写的,运行爬虫
        settings.py    # 配置文件  django的配置文件
   scrapy.cfg          # 项目上线用的,不需要关注

1 scrapy解析数据

1 response对象有css方法和xpath方法
	-css中写css选择器
    -xpath中写xpath选择
2 重点1:
	-xpath取文本内容
	'.//a[contains(@class,"link-title")]/text()'
    -xpath取属性
    './/a[contains(@class,"link-title")]/@href'
    -css取文本
    'a.link-title::text'
    -css取属性
    'img.image-scale::attr(src)'
3 重点2:
	.extract_first()  取一个
    .extract()        取所有
    

解析cnblosg

    # def parse(self, response):
    #     # 解析数据 css解析
    #     article_list = response.css('article.post-item')
    #     for article in article_list:
    #         title = article.css('div.post-item-text>a::text').extract_first()
    #         author_img = article.css('div.post-item-text img::attr(src)').extract_first()
    #         author_name = article.css('footer span::text').extract_first()
    #         desc_old = article.css('p.post-item-summary::text').extract()
    #         desc = desc_old[0].replace('\n', '').replace(' ', '')
    #         if not desc:
    #             desc = desc_old[1].replace('\n', '').replace(' ', '')
    #         url=article.css('div.post-item-text>a::attr(href)').extract_first()
    #         # 文章真正的内容,没拿到,它不在这个页面中,它在下一个页面中
    #         print(title)
    #         print(author_img)
    #         print(author_name)
    #         print(desc)
    #         print(url)

    def parse(self, response):
        # 解析数据 css解析
        article_list = response.xpath('//*[@id="post_list"]/article')
        # article_list = response.xpath('//article[contains(@class,"post-item")]')
        for article in article_list:
            title = article.xpath('.//div/a/text()').extract_first()
            author_img = article.xpath('.//div//img/@src').extract_first()
            author_name = article.xpath('.//footer//span/text()').extract_first()
            desc_old = article.xpath('.//p/text()').extract()
            desc = desc_old[0].replace('\n', '').replace(' ', '')
            if not desc:
                desc = desc_old[1].replace('\n', '').replace(' ', '')
            url = article.xpath('.//div/a/@href').extract_first()
            # 文章真正的内容,没拿到,它不在这个页面中,它在下一个页面中
            print(title)
            print(author_img)
            print(author_name)
            print(desc)
            print(url)

2 settings相关配置,提高爬取效率

# scrapy 项目有项目自己的配置文件,还有内置的

2.1 基础的一些

#1 了解
BOT_NAME = "firstscrapy"  #项目名字,整个爬虫名字
#2 爬虫存放位置    了解
SPIDER_MODULES = ["firstscrapy.spiders"]
NEWSPIDER_MODULE = "firstscrapy.spiders"

#3  记住 是否遵循爬虫协议,一般都设为False
ROBOTSTXT_OBEY = False
# 4 记住
USER_AGENT = "firstscrapy (+http://www.yourdomain.com)"
#5  记住  日志级别
LOG_LEVEL='ERROR'

#6   记住 DEFAULT_REQUEST_HEADERS 默认请求头
DEFAULT_REQUEST_HEADERS = {
   'Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
   'Accept-Language': 'en',
}

#7 记住 后面学  SPIDER_MIDDLEWARES 爬虫中间件
SPIDER_MIDDLEWARES = {
    'cnblogs.middlewares.CnblogsSpiderMiddleware': 543,
}
#8 后面学 DOWNLOADER_MIDDLEWARES  下载中间件
DOWNLOADER_MIDDLEWARES = {
    'cnblogs.middlewares.CnblogsDownloaderMiddleware': 543,
}

#9 后面学 ITEM_PIPELINES 持久化配置
ITEM_PIPELINES = {
    'cnblogs.pipelines.CnblogsPipeline': 300,
}

2.2 增加爬虫的爬取效率

#1 增加并发:默认16
默认scrapy开启的并发线程为32个,可以适当进行增加。在settings配置文件中修改
CONCURRENT_REQUESTS = 100
值为100,并发设置成了为100。
#2 降低日志级别:
在运行scrapy时,会有大量日志信息的输出,为了减少CPU的使用率。可以设置log输出信息为INFO或者ERROR即可。在配置文件中编写:
LOG_LEVEL = 'INFO'
# 3 禁止cookie:
如果不是真的需要cookie,则在scrapy爬取数据时可以禁止cookie从而减少CPU的使用率,提升爬取效率。在配置文件中编写:
COOKIES_ENABLED = False
# 4 禁止重试:
对失败的HTTP进行重新请求(重试)会减慢爬取速度,因此可以禁止重试。在配置文件中编写:
RETRY_ENABLED = False
# 5 减少下载超时:
如果对一个非常慢的链接进行爬取,减少下载超时可以能让卡住的链接快速被放弃,从而提升效率。在配置文件中进行编写:
DOWNLOAD_TIMEOUT = 10 超时时间为10s

3 持久化方案

# 方式一:(parse必须有return值,必须是列表套字典形式--->使用命令,可以保存到json格式中,csv中。。。)
scrapy crawl cnblogs -o cnbogs.json

# 方式二:我们用的,使用pipline存储---》可以存到多个位置
	-第一步:在item.py中写一个类
        class FirstscrapyItem(scrapy.Item):
            title = scrapy.Field()
            author_img = scrapy.Field()
            author_name = scrapy.Field()
            desc = scrapy.Field()
            url = scrapy.Field()
            # 博客文章内容,但是暂时没有
            content = scrapy.Field()
            
    -第二步:在pipline.py中写代码,写一个类:open_spide,close_spider,process_item
    	-open_spide:开启爬虫会触发
    	-close_spider:爬完会触发
        -process_ite:每次要保存一个对象会触发
        class FirstscrapyFilePipeline:
            def open_spider(self, spider):
                print('我开了')
                self.f=open('a.txt','w',encoding='utf-8')
            def close_spider(self, spider):
                print('我关了')
                self.f.close()
            # 这个很重要
            def process_item(self, item, spider):
                self.f.write(item['title']+'\n')
                return item
    -第三步:配置文件配置
    	ITEM_PIPELINES = {
           "firstscrapy.pipelines.FirstscrapyFilePipeline": 300,  # 数字越小,优先级越高
        }
        
    -第四步:在解析方法parse中yield item对象
    

4 全站爬取cnblogs文章

4.1 request和response对象传递参数

# Request创建:在parse中,for循环中,创建Request对象时,传入meta
	yield Request(url=url, callback=self.detail_parse,meta={'item':item})
    
# Response对象:detail_parse中,通过response取出meta取出item,把文章详情写入
	yield item

4.2 解析下一页并继续爬取

import scrapy
from bs4 import BeautifulSoup
from firstscrapy.items import FirstscrapyItem
from scrapy.http.request import Request

class CnblogsSpider(scrapy.Spider):
    name = "cnblogs"
    allowed_domains = ["www.cnblogs.com"]
    start_urls = ["http://www.cnblogs.com/"]

    # 解析出下一页地址,继续爬取
    def parse(self, response):
        article_list = response.xpath('//*[@id="post_list"]/article')
        # article_list = response.xpath('//article[contains(@class,"post-item")]')
        # l=[]
        for article in article_list:
            item = FirstscrapyItem()
            title = article.xpath('.//div/a/text()').extract_first()
            item['title'] = title
            author_img = article.xpath('.//div//img/@src').extract_first()
            item['author_img'] = author_img
            author_name = article.xpath('.//footer//span/text()').extract_first()
            item['author_name'] = author_name
            desc_old = article.xpath('.//p/text()').extract()
            desc = desc_old[0].replace('\n', '').replace(' ', '')
            if not desc:
                desc = desc_old[1].replace('\n', '').replace(' ', '')
            item['desc'] = desc
            url = article.xpath('.//div/a/@href').extract_first()
            item['url'] = url
            # print(title)
            # yield item对象 不完整,缺文章的content,而文章的content在下一个页面中,而此处要yield一个Request对象
            # yield item
            yield Request(url=url,callback=self.parser_detail,meta={'item':item}) # 爬完后执行的解析方法


        next='https://www.cnblogs.com'+response.css('div.pager>a:last-child::attr(href)').extract_first()
        print(next) # 继续爬取
        yield Request(url=next,callback=self.parse)



    # 解析详情的方法
    def parser_detail(self,response):
        # print(response.status)
        # 解析出文章内容
        content=response.css('#cnblogs_post_body').extract_first()
        # print(str(content))
        # 如何放到item中
        item=response.meta.get('item')
        if content:
            item['content']=content
        else:
            item['content'] = '没查到'
        yield item



作业

# 讲了什么写什么
	-持久化方案用一下让你忘记的那个
    -把cnblgos整站爬取,存到数据库中

5 爬虫和下载中间件

6 加代理,cookie,header,加入selenium

6.1 加代理

6.2 加cookie,修改请求头,随机生成UserAgent

6.3 集成selenium

面试题

#1  面试官要看你项目
	- 编码水平
    - 公司的看不了,给他看的,全是个人项目
    - 公司项目看不了,签了保密协议
    
    
#2  数据库如何处理的?
	-云数据库:阿里云数据库,花钱,买服务---》账号和密码---》公司不需要自己搭建mysql
    	-mysql
        -redis
        -mongodb
    -自己的数据库,部署在云服务器上的数据库,是你自己的
    
    
# 3 你用过什么云产品?
	- 阿里云的ecs,服务器
    - 阿里云的oss ,对象存储
    - 云短信
    - 七牛云 文件存储
    
    
# 4 看看你的数据库
	-配置文件 dev.py  连的是本地127.0.0.1
    -你们上线怎么弄
    	-我不知道,就是给我一个地址,端口,用户名密码
        
    - 上线的数据库服务和项目服务 是在同一台及其上吗?

# 5 celery用过
	定时任务
    定时
    异步任务
    
    
    
# 6 多线程用过
	-用过
    -怎么用的?两种方式
    	-类实例化得到对象Thread类 传入target 任务函数,对象.start
        -写一个类,继承Thread,重写run方法,写任务  类实例化得到对象  对象.start
    -如果io密集型,用多线程,计算密集型用多进程 ---》只针对于cpython
    
    
# 7 mysql 用过,索引你知道吗?
	唯一索引和联合索引有什么区别
    
    
#8 1千万w,性别字段(男女),查询时候,这个字段要不要加索引
	-因为它就两种状态,建立索引是没用的,即便建立索引,也不会走
    
    


# 9 实现踢下线
	-session机制---》表中把它那条记录删除
    -token机制----》
    	-下线人id----》放个位置
        -进入到认证类中---》

# 10 实现黑名单功能
	-建立个黑名单表
    	-id  用户id ,ip,时间。。。

标签:xpath,爬虫,day05,----,item,scrapy,article,desc
From: https://www.cnblogs.com/tengyifan888/p/17240022.html

相关文章

  • python hmac.new示例
      hmac是Python中的一个模块,它提供了一个类和一些函数,用于使用密钥对消息进行哈希处理。哈希处理是一种将任意长度的消息转换为固定长度哈希值的方法。哈希值通常用于......
  • Docker1
    title:DockerDockerDocker各种指令合集dockerversion#显示docker详细信息dockerinfo#显示docker的系统信息,包括镜像和容器的数量dockerpullxx:vers......
  • 五种常用的web安全认证方式
    https://www.oldboyedu.com/blog/4538.html 现如今web服务器随处可见,千万台web程序被部署到公网上供用户访问,有些系统只针对指定用户开放,属于安全级别较高的web应用,他们......
  • 专业开发人员使用低代码是什么体验?
     相关数据显示,74%的公司计划将低代码此业务线集成到应用程序开发生命周期中,显而易见,公司正在采用低代码技术来缓解应用程序开发需求的压力。现在你的老板告诉你低代码开......
  • vue按需加载组件,异步组件
    vue2按需加载组件,或者异步组件,主要是应用了component的is属性vue2中的动态组件component,官方文档<!--组件会在`currentTabComponent`改变时改变--><component......
  • CSS02.字体样式
    字体样式1.CSS外观属性1.1color:文本颜色作用:color属性用于定义文本的颜色其取值方式有如下3种:表示属性值预定义的颜色值(预设值:定义好的单词)red、green......
  • 【标准的产品解决方案】Softerra与上海道宁为IT行业提供优质且全面的解决方案,帮助世界
      Softerra为IT行业提供标准产品和解决方案以及从头开始研发定制软件以及物联网、定制芯片和电子产品等提供嵌入式研发服务LDAPAdministrator提供了一个可靠......
  • Python中获取文件大小
    这篇文章将讨论如何在Python中获取文件的大小。1.使用os.stat()功能获取文件状态的标准解决方案是使用os.stat()Python函数。它返回一个stat_result对象,它有一......
  • 创建controller/service/mapper/impl过程
    先创建entity包,在里面导入实体类然后创建controller/mapper/service包然后在service里创建impl包然后在mapper包里写mapper接口,加上@Mapper注解,继承BaseMapper<Employee......
  • OpenXML-SDK 操作Word,PPT,提取文字
    今天跟大家分享一款插件,OpenXML-SDK实现对Word,PPT的操作。今天仅介绍如何利用这个组件,从文件中提取文字。OpenXML-SDK有个缺陷,不支持跨平台,即只能部署在windows系统首......