寫到終于了scrapy
爬蟲框架了,這個框架可以說是蟒爬蟲框架里面出鏡率最高的一個了,我們接下來重點(diǎn)研究一下它的使用規(guī)則。
安裝過程自己百度一下,就能找到3種以上的安裝手法,一個哪都可以安裝上
可以參考https://scrapy-chs.readthedocs.io/zh_CN/0.24/intro/install.html
官方說明進(jìn)行安裝。
通用使用下面的命令,創(chuàng)建即可
scrapy startproject mySpider
完成之后,你的項(xiàng)目的目錄結(jié)構(gòu)為
每個文件對應(yīng)的意思為
通過命令行進(jìn)入到mySpider / spiders /目錄,然后執(zhí)行如下命令
scrapy genspider 高考 “ www.gaokaopai.com ”
打開mySpider / spiders /目錄里面的高考,默認(rèn)增加了下列代碼
import scrapyclass GaoKaoSpider(scrapy.Spider): name = "GaoKao" allowed_domains = ["www.gaokaopai.com"] start_urls = ['http://www.gaokaopai.com/'] def parse(self, response): pass
默認(rèn)生成的代碼,一個所有游戲GaoKaoSpider
的類,這個并且類的英文用scrapy.Spider
繼承來的
而且默認(rèn)實(shí)現(xiàn)了三個屬性狀語從句:一個方法
name =“”這個是爬蟲的名字,必須唯一,在不同的爬蟲需要定義不同的名字
allowed_domains = []域名范圍,限制爬蟲爬取當(dāng)前域名下的網(wǎng)頁
start_urls = []爬取的URL元組/列表。爬蟲從這里開始爬取數(shù)據(jù),第一次爬取的頁面就是從這里開始,其他的URL將會從這些起始的URL爬取的結(jié)果中生成
解析(self,response)解析網(wǎng)頁的方法, -個初始網(wǎng)址完成下載后將調(diào)用,調(diào)用的時候傳入每一個初始URL返回的響應(yīng)對象作為唯一參數(shù),主要作用1、負(fù)責(zé)解析返回的網(wǎng)頁數(shù)據(jù),response.body
2、生成下一頁的URL請求
要我們爬取的的英文高考派大學(xué)數(shù)據(jù)
數(shù)據(jù)為http://www.gaokaopai.com/rank-index.html
頁面下部有一個加載更多,點(diǎn)擊抓取鏈接
尷尬的事情發(fā)生了,竟然是一個POST請求,本打算實(shí)現(xiàn)一個GET的,這回代碼量有點(diǎn)大了?
scrapy模式是GET請求的,如果我們需要修改成POST,那么需要重寫Spider類的start_requests(self)方法,并且不再調(diào)用start_urls里面的url了,所以,咱對代碼進(jìn)行一些修改。重寫代碼之后,注意下面這段代碼
request = FormRequest(self.start_url,headers=self.headers,formdata=form_data,callback=self.parse)
FormRequest需要引入模塊from scrapy import FormRequest
self.start_url寫上帖請求的地址即可formdata
用來提交表單數(shù)據(jù)
callback調(diào)用網(wǎng)頁解析參數(shù)
最后的yield請求表示這個函數(shù)是一個生成器
import scrapyfrom scrapy import FormRequestimport jsonfrom items import MyspiderItemclass GaokaoSpider(scrapy.Spider): name = 'GaoKao' allowed_domains = ['gaokaopai.com'] start_url = 'http://www.gaokaopai.com/rank-index.html' def __init__(self): self.headers = { "User-Agent":"自己找個UA", "X-Requested-With":"XMLHttpRequest" } # 需要重寫start_requests() 方法 def start_requests(self): for page in range(0,7): form_data = { "otype": "4", "city":"", "start":str(25*page), "amount": "25" } request = FormRequest(self.start_url,headers=self.headers,formdata=form_data,callback=self.parse) yield request def parse(self, response): print(response.body) print(response.url) print(response.body_as_unicode())Python資源分享qun 784758214 ,內(nèi)有安裝包,PDF,學(xué)習(xí)視頻,這里是Python學(xué)習(xí)者的聚集地,零基礎(chǔ),進(jìn)階,都?xì)g迎
在我們def parse(self, response):
函數(shù)里面,輸出一下網(wǎng)頁內(nèi)容,這個地方,需要用到1個知識點(diǎn)是
獲取網(wǎng)頁內(nèi)容 response.body
response.body_as_unicode()
我們接下來就可以運(yùn)行一下爬蟲程序了
項(xiàng)目在根目錄創(chuàng)建33一個begin.py
文件,里面寫入如下代碼
from scrapy import cmdlinecmdline.execute(("scrapy crawl GaoKao").split())
運(yùn)行該文件,記住在scrapy中的其他py文件中,運(yùn)行是不會顯示相應(yīng)的結(jié)果的,每次測試的時候,都需要運(yùn)行begin.py當(dāng)然,你可起一個其他的名字。
如果你不這么干的,那么你只能采用下面的操作,就是比較麻煩。
cd到爬蟲目錄里執(zhí)行scrapy crawl GaoKao--nolog命令說明:scrapy crawl GaoKao(GaoKao表示爬蟲名稱) --nolog(--nolog表示不顯示日志)
運(yùn)行起來,就在控制臺打印數(shù)據(jù)了,測試方便,可以把上述代碼中那個數(shù)字7,修改成2,有心人能看到我這個小文字
pycharm在運(yùn)行過程中,會在控制臺打印很多紅色的字,沒事,那不是BUG
一定要在紅色的字中間找到黑色的字,黑色的字才是你打印出來的數(shù)據(jù),如下,得到這樣的內(nèi)容,就成功一大半了。
但是這個地方有個小坑,就是,你會發(fā)現(xiàn)返回的數(shù)據(jù)不一致,這個我測試了一下,是因?yàn)榈谝豁摰臄?shù)據(jù)返回的不是JSON格式的,而是普通的網(wǎng)頁,那么我們需要針對性處理一下,這個先不用管,把我們items.py
進(jìn)行完善
import scrapyclass MyspiderItem(scrapy.Item): # 學(xué)校名稱 uni_name = scrapy.Field() uni_id = scrapy.Field() city_code = scrapy.Field() uni_type = scrapy.Field() slogo = scrapy.Field() # 錄取難度 safehard = scrapy.Field() # 院校所在地 rank = scrapy.Field()
然后在剛才的GaokaoSpider類中,繼續(xù)完善解析函數(shù),判斷通過response.headers["Content-Type"]
去確定本。頁面的英文HTML格式,還是JSON格式。
if(content_type.find("text/html")>0): # print(response.body_as_unicode()) trs = response.xpath("http://table[@id='results']//tr")[1:] for item in trs: school = MyspiderItem() rank = item.xpath("td[1]/span/text()").extract()[0] uni_name = item.xpath("td[2]/a/text()").extract()[0] safehard = item.xpath("td[3]/text()").extract()[0] city_code = item.xpath("td[4]/text()").extract()[0] uni_type = item.xpath("td[6]/text()").extract()[0] school["uni_name"] = uni_name school["uni_id"] = "" school["city_code"] = city_code school["uni_type"] = uni_type school["slogo"] = "" school["rank"] = rank school["safehard"] = safehard yield school else: data = json.loads(response.body_as_unicode()) data = data["data"]["ranks"] # 獲取數(shù)據(jù) for item in data: school = MyspiderItem() school["uni_name"] = item["uni_name"] school["uni_id"] = item["uni_id"] school["city_code"] = item["city_code"] school["uni_type"] = item["uni_type"] school["slogo"] = item["slogo"] school["rank"] = item["rank"] school["safehard"] = item["safehard"] # 將獲取的數(shù)據(jù)交給pipelines,pipelines在settings.py中定義 yield school
parse()方法的執(zhí)行機(jī)制
到這里,如果想要數(shù)據(jù)準(zhǔn)備的進(jìn)入到管道中,你需要在setting.py
中將配置開啟
# See https://doc.scrapy.org/en/latest/topics/item-pipeline.html ITEM_PIPELINES = { 'mySpider.pipelines.MyspiderPipeline': 300, }
關(guān)系編寫同時pipeline.py
文件
import osimport csvclass MyspiderPipeline(object): def __init__(self): # csv 文件 store_file = os.path.dirname(__file__) "/spiders/school1.csv" self.file = open(store_file,"a ",newline='',encoding="utf-8") self.writer = csv.writer(self.file) def process_item(self, item, spider): try: self.writer.writerow(( item["uni_name"], item["uni_id"], item["city_code"], item["uni_type"], item["slogo"], item["rank"], item["safehard"] )) except Exception as e: print(e.args) def close_spider(self,spider): self.file.close()Python資源分享qun 784758214 ,內(nèi)有安裝包,PDF,學(xué)習(xí)視頻,這里是Python學(xué)習(xí)者的聚集地,零基礎(chǔ),進(jìn)階,都?xì)g迎
好了,代碼全部編寫完畢,還是比較簡單的吧,把上面的數(shù)字在修改成圖7,為啥是7,因?yàn)橹荒塬@取到前面150條數(shù)據(jù)