爬虫--Scrapy-持久化存储操作2

内容导读

互联网集市收集整理的这篇技术教程文章主要介绍了爬虫--Scrapy-持久化存储操作2，小编现在分享给大家，供广大互联网技能从业者学习和参考。文章包含3170字，纯文字阅读大概需要5分钟。

内容图文

1、管道的高级操作

将爬取到的数据值分别存储到本地磁盘、redis数据库、mysql数据。

            
                需求：将爬取到的数据值分别存储到本地磁盘、redis数据库、mysql数据。
　　1.需要在管道文件中编写对应平台的管道类
　　2.在配置文件中对自定义的管道类进行生效操作

qiubai.py

            import
             scrapy

            from qiubaipro.items import QiubaiproItem

class QiubaiSpider(scrapy.Spider):
    name = ‘qiubai‘#allowed_domains = [‘www.qiushibaike.com/text‘]
    start_urls = [‘https://www.qiushibaike.com/text/‘]

    def parse(self, response):
        # 建议大家使用xpath进行解析(框架集成了xpath解析的接口)
        div_list = response.xpath("//div[@id=‘content-left‘]/div")
        # 存储到的解析到的页面数据
        data_list = []
        for div in div_list:
            author = div.xpath(‘./div/a[2]/h2/text()‘).extract_first()
            #content = div.xpath(".//div[@class=‘content‘]/span/text()")
            content = div.xpath(".//div[@class=‘content‘]/span/text()").extract_first()# 1.将解析到数据值(author和content)储存到items对象
            item = QiubaiproItem()
            item[‘author‘] = author
            item[‘content‘] = content
            # 2.将item对象提交给管道yield item

pipelines.py

            import
             redis

            import
             pymysql

            class
             QiubaiproPipeline(object):
    conn = None
    def open_spider(self,spider):
        print(‘写入到redis服务器‘)
        print(‘开始爬虫‘)
        # redis服务器port
        self.conn = redis.Redis(host=‘127.0.0.1‘,port=6379)
    # 该方法可以接受爬虫文件中提交过来的item对象，并且对item对象的页面数据进行持久化处理# 参数：item表示的就是接受到的item对象def process_item(self, item, spider):
        # 1.链接数据库
        dict = {‘author‘:item[‘author‘],
                ‘content‘:item[‘content‘]}
        self.conn.lpush(‘data‘,dict)

        return item
    # 该方法只会在爬虫结束的时候被调用一次def close_spider(self,spider):
        print(‘爬虫结束‘)

# 实现将数据值存到本地磁盘中class QiubaiByFiles(object):
    # 该方法可以接受爬虫文件中提交过来的item对象，并且对item对象的页面数据进行持久化处理# 参数：item表示的就是接受到的item对象def open_spider(self,spider):
        print(‘写入到本地磁盘中‘)
        print(‘开始爬虫‘)
        self.fp = open(‘./qiubai_pipe.txt‘, ‘w‘, encoding=‘utf-8‘)

    # 该方法可以接受爬虫文件中提交过来的item对象，并且对item对象的页面数据进行持久化处理# 参数：item表示的就是接受到的item对象def process_item(self, item, spider):
        author = item[‘author‘]
        content  = item[‘content‘]

        # 持久化存储io操作
        self.fp.write(author+‘:‘+content+‘\n\n\n‘)
        return item
    # 该方法只会在爬虫结束的时候被调用一次def close_spider(self,spider):
        print(‘爬虫结束‘)
        self.fp.close()

# 实现将数据值存储到mysql数据库中class QiubaiByMysql(object):
    conn = None  # mysql的连接对象声明
    cursor = None  # mysql游标对象声明def open_spider(self,spider):
        print(‘写入到mysql数据库中‘)
        print(‘开始爬虫‘)

        # 链接数据库# host 本机的ip地址# 在命令行输入 ipconfig查看
        self.conn = pymysql.Connect(host=‘10.10.40.140‘,port=3306,user=‘root‘,password=‘123‘,db=‘qiubai‘,charset=‘utf8‘)

    # 该方法可以接受爬虫文件中提交过来的item对象，并且对item对象的页面数据进行持久化处理# 参数：item表示的就是接受到的item对象def process_item(self, item, spider):
        # 1.链接数据库# 执行sql语句# 插入数据
        sql = ‘insert into qiubai(author,content) values("%s","%s")‘%(item[‘author‘], item[‘content‘])
        # 获取游标
        self.cursor = self.conn.cursor()
        try:
            self.cursor.execute(sql)
            self.conn.commit()
        except Exception as e:
            print(e)
            self.conn.rollback()

        # 提交事务return item
    # 该方法只会在爬虫结束的时候被调用一次def close_spider(self,spider):
        print(‘爬虫结束‘)
        self.cursor.close()
        self.conn.close()

在settings配置

            #
              数字表示优先级,数字越大优先级越高
ITEM_PIPELINES = {
   ‘qiubaipro.pipelines.QiubaiproPipeline‘: 300,
   ‘qiubaipro.pipelines.QiubaiByFiles‘:400,
   ‘qiubaipro.pipelines.QiubaiByMysql‘:500,
}

打开终端，先进入文件目录

技术分享图片

多个url数据爬取

***问题：针对多个url进行数据的爬取
    解决方案：请求的手动发送

1、新建一个工程

cd 到需要保存工程的目录

scrapy startproject qiubaiByPages

cd qiubaiByPages

爬虫文件的名称，起始url

scrapy genspider qiubai www.qiushibaike.com/text

技术分享图片

把实现的步骤在理清一次

原文：https://www.cnblogs.com/foremostxl/p/10090586.html

内容总结

以上是互联网集市为您收集整理的爬虫--Scrapy-持久化存储操作2全部内容，希望文章能够帮你解决爬虫--Scrapy-持久化存储操作2所遇到的程序开发问题。如果觉得互联网集市技术教程内容还不错，欢迎将互联网集市网站推荐给程序员好友。

内容备注

版权声明：本文内容由互联网用户自发贡献，该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容，请发送邮件至 gblab@vip.qq.com 举报，一经查实，本站将立刻删除。

内容手机端

扫描二维码推送至手机访问。

本文链接：https://qyyshop.com/info/1216470.html

来源：【匿名】

【上一篇】python 爬虫数据准换时间格式【下一篇】PHP使用swoole实现多线程爬虫

更多 ►

【爬虫--Scrapy-持久化存储操作2】教程文章相关的互联网学习教程文章

Mooc爬虫05-scrapy框架【代码】【图】

1 scrapy框架的介绍　　安装pip install scrapy　　查看是否安装完成scrapy ‐h　　scrapy框架是实现爬虫功能的一个软件结构和功能组件集合　　scrapy爬虫框架的结构原文：http://www.cnblogs.com/weihuchao/p/6716623.html

1、管道的高级操作将爬取到的数据值分别存储到本地磁盘、redis数据库、mysql数据。需求：将爬取到的数据值分别存储到本地磁盘、redis数据库、mysql数据。1.需要在管道文件中编写对应平台的管道类2.在配置文件中对自定义的管道类进行生效操作qiubai.pyimport scrapy from qiubaipro.items import QiubaiproItemclass QiubaiSpider(scrapy.Spider):name = ‘qiubai‘#allowed_domains = [‘www.qiushibaike.com/text‘]start_urls = ...

爬虫框架 -->scrapy【代码】

scrapy框架　- 框架 : 具有很多功能,且具有很强通用性的项目模板　　- 环境安装 :#环境准备linux 系统　pip3 install scrapywindows系统1 pip3 install wheel2 下载 Twisted-19.2.0-cp36-cp36m-win-amd64.whl3 进入下载目录，执行 pip3 install Twisted?19.2.0?cp36?cp36m?win_amd64.whl4 pip3 install pywin5 pip3 install wheel 什么是scrapy?Scrapy 是一个为了爬取网站数据,提取结构性数据编写的应用框架,.非常强大,所谓的框架就...

scrapy爬虫-------命令解析

scrapy是通过命令行进行控制的，你可以在命令行中输入一个scrapy，会出现一拍命令。你也可以通过tree来查看scrapy的目录结构，scrapy.cfg存放的目录被认为是项目的根目录，该文件中包含python模块名的字段定义了项目的设置。下面的代码是我一个爬取天气的爬虫中的.cfg文件。# Automatically created by: scrapy startproject # # For more information about the [deploy] section see: # http://doc.scrapy.org/en/latest/topics/...

python爬虫scrapy之rules的基本使用【代码】

Link ExtractorsLink Extractors 是那些目的仅仅是从网页(scrapy.http.Response ' ref='nofollow'> scrapy.http.Response 对象)中抽取最终将会被follow链接的对象? Scrapy默认提供2种可用的 Link Extractor, 但你通过实现一个简单的接口创建自己定制的Link Extractor来满足需求? 每个LinkExtractor有唯一的公共方法是 extract_links ,它接收一个 Response' ref='nofollow'> Response 对象,并返回一个 scrapy.link.Link 对象?Link ...

Python 爬虫6——Scrapy的安装和使用【代码】【图】

前面我们简述了使用Python自带的urllib和urllib2库完成的一下爬取网页数据的操作，但其实能完成的功能都很简单，假如要进行复制的数据匹配和高效的操作，可以引入第三方的框架，例如Scrapy便是比较常用的爬虫框架。一、Scrapy的安装：1.最简单的安装方式：根据官方主页的指导：http://www.scrapy.org/ 使用pip来安装python相关插件其实都很简单，当然用这个办法安装Scrapy也是最为简单的安装方式，仅需在命令行窗口...

Scrapy爬虫笔记【2-基本流程】【代码】

1.一个项目的基本流程创建新项目scrapy startproject <name>会自动生成目录：熟悉一下目录结构：lawson ├── lawson │ ├── __init__.py │ ├── items.py │ ├── pipelines.py │ ├── settings.py │ └── spiders │ └── __init__.py └── scrapy.cfg items.py 定义抓取结果中单个项所需要包含的所有内容，比如便利店的地址、分店名称等。【目标】pipelines.py 定义如何对抓取到的内容进行再...

爬虫框架Scrapy之详解【图】

Scrapy 框架Scrapy是用纯Python实现一个为了爬取网站数据、提取结构性数据而编写的应用框架，用途非常广泛。框架的力量，用户只需要定制开发几个模块就可以轻松的实现一个爬虫，用来抓取网页内容以及各种图片，非常之方便。Scrapy 使用了 Twisted[‘tw?st?d](其主要对手是Tornado)异步网络框架来处理网络通讯，可以加快我们的下载速度，不用自己去实现异步框架，并且包含了各种中间件接口，可以灵活的完成各种需求。Scrapy架构图(绿...

Python爬虫【五】Scrapy分布式原理笔记【代码】【图】

Scrapy单机架构在这里scrapy的核心是scrapy引擎，它通过里面的一个调度器来调度一个request的队列，将request发给downloader，然后来执行request请求但是这些request队列都是维持在本机上的，因此如果要多台主机协同爬取，需要一个request共享的机制——requests队列，在本机维护一个爬取队列，Scheduler进行调度，而要实现多态服务器共同爬取数据关键就是共享爬取队列。单主机爬虫架构调度器负责从队列中调度requests进行爬取，而...

scrapy爬虫案例：问政平台【代码】【图】

问政平台http://wz.sun0769.com/index.php/question/questionType?type=4爬取投诉帖子的编号、帖子的url、帖子的标题，和帖子里的内容。items.pyimport scrapyclass DongguanItem(scrapy.Item):# 每个帖子的标题title = scrapy.Field()# 每个帖子的编号number = scrapy.Field()# 每个帖子的文字内容content = scrapy.Field()# 每个帖子的urlurl = scrapy.Field()spiders/sunwz.py# -*- coding: utf-8 -*-import scrapy from scrapy...

scrapy爬虫框架调用百度地图api数据存入数据库【代码】【图】

scrapy安装配置不在本文提及，1.在开始爬取之前，必须创建一个新的Scrapy项目。进入自定义的项目目录中，运行下列命令scrapy startproject mySpider其中， mySpider 为项目名称，可以看到将会创建一个 mySpider 文件夹，目录结构大致如下：下面来简单介绍一下各个主要文件的作用：scrapy.cfg ：项目的配置文件mySpider/ ：项目的Python模块，将会从这里引用代码mySpider/items.py ：项目的目标文件mySpider/pipelines.py ：项目的...

在Pycharm中运行Scrapy爬虫项目的基本操作【图】

目标在Win7上建立一个Scrapy爬虫项目，以及对其进行基本操作。运行环境：电脑上已经安装了python(环境变量path已经设置好)，以及scrapy模块，IDE为Pycharm 。操作如下：　　一、建立Scrapy模板。进入自己的工作目录，shift + 鼠标右键进入命令行模式，在命令行模式下，输入scrapy startproject 项目名 ,如下：看到以上的代码说明项目已经在工作目录中建好了。　　二、在Pycharm中scrapy的导入。在Pycharm中打开工作目录中的Test...

scrapy写爬虫是出现no module named win32api错误【图】

windows下利用scrapy（python2.7）写爬虫，运行 scrapy crawl dmoz 命令时提示：exceptions.ImportError: No module named win32api 插个话题，这里还需要注意的是你需要到你所创建的爬虫项目目录下运行以上命令，比如你创建了 scrapy startproject tutorial 项目，你需要到tutorial目录下运行以上命令。另外一点就是需要注意一下爬虫的名字如：dmoz，它是和以下这个名字对应的解决办法：安装pywin32 地址：https://sourceforge...

[爬虫] 学Scrapy，顺便把它的官方教程给爬下来【代码】【图】

想学爬虫主要是因为算法和数据是密切相关的，有数据之后可以玩更多有意思的事情，数据量大可以挖掘挖掘到更多的信息。之前只会通过python中的request库来下载网页内容，再用BeautifulSoup、re正则工具来解析；后来了解到Scrapy爬虫框架，现在入门先写个小小的爬虫项目，这里做个简单的总结和记录。官方教程：https://scrapy-chs.readthedocs.io/zh_CN/1.0/intro/overview.html（包括安装指南）Github：https://github.com/scrapy ...

scrapy-redis 分布式爬虫爬取房天下网站所有国内城市的新房和二手房信息【代码】

scrapy-redis 分布式爬虫爬取房天下网站所有国内城市的新房和二手房信息先完成单机版的爬虫，然后将单机版爬虫转为分布式爬虫爬取思路1. 进入 https://www.fang.com/SoufunFamily.htm 页面，解析所有的省份和城市，获取到城市首页链接 2. 通过分析，每个城市的新房都是在首页链接上添加newhouse和house/s/字符串，二手房都死在首页链接上添加esf字段以上海为例：首页：https://sh.fang.com/ 新房：https://sh.newhouse....

首页 / 爬虫 / 爬虫--Scrapy-持久化存储操作2