原创文章
专注于分享 Go、Java、Python、PHP、Node.js 等全栈技术开发领域知识,探索系统架构与人工智能等前沿技术。
03月
12
利用Flask和ECharts进行数据可视化——我用scrapy写爬虫(四)
前几篇文章,我们对慕课网的课程进行了爬取,本文就对数据进行统计和可视化,让这些数据更直观的展现出来。 介绍 Flask 是基于Python的非常流行的框架之一,主要用于web开发,适合开发中小型项目,易于扩展。Flask的官方网站是 http://flask.pocoo.org/ 。 Echarts (http://echarts.baidu.com/...
02月
23
Virtualenv,Python虚拟环境,多版本共存
virtualenv 是创建独立Python环境的工具。 我们在同时开发多个应用的时候,老项目使用的是python2,新项目要求使用python3,或者有的项目使用python2.5,有的使用python2.6,那么如何让每个项目都在一个“隔离”的环境运行呢? virtualenv ( https://virtualenv.pypa.io/en/sta...
11月
29
scrapy爬取慕课网全部免费课程——我用scrapy写爬虫(三)
前两篇文章中,简单用scrapy写了一个小demo,本篇文章主要目标是完整用scrapy爬取,慕课网所有免费的课程、标题、图片、地址、学习人数、难度、方向、分类、时长、评分、评论数等。 其实,很简单,在上一次的代码中修改调整一下就好。 Spider Item pipelines 保存至数据库 这里也附上建表语句吧 下面是保存到数据库的类 大功告成 至此...
11月
23
Centos下安装Python3.6和Python2共存
写在前面 centos6.8中默认自带的python版本为python2.6,那么这里需要将其改为python3 下载并解压 官方下载地址为 https://www.python.org/downloads/ ,这里已3.6.3为例。 安装 修改python3为默认的python python3和python2共存 由于yum用的python仍然是2....
10月
25
保存数据到MySql数据库——我用scrapy写爬虫(二)
写在前面 上一篇(https://www.tech1024.cn/original/2951.html )说了如何创建项目,并爬去网站内容,下面我们说一下如何保存爬去到的数据 开始爬取 创建Spider,上一篇我们已经创建了ImoocSpider,我们做一下修改,可以连续下一页爬取。 scrapyDemo/spiders目录下的ImoocSpider类...
10月
17
快速上手——我用scrapy写爬虫(一)
写在前面 用python写爬虫的人很多,python的爬虫框架也很多,诸如pyspider 和 scrapy,笔者还是笔记倾向于scrapy,本文就用python写一个小爬虫demo。 本文适用于有一定python基础的,并且对爬虫有一定了解的开发者。 安装 Scrapy 检查环境,python的版本为3.6.2,pip为9.0.1 安装scrapy框...