国产成人精品久久免费动漫-国产成人精品天堂-国产成人精品区在线观看-国产成人精品日本-a级毛片无码免费真人-a级毛片毛片免费观看久潮喷

您的位置:首頁(yè)技術(shù)文章
文章詳情頁(yè)

Python使用xpath實(shí)現(xiàn)圖片爬取

瀏覽:3日期:2022-07-11 09:53:11

高性能異步爬蟲

目的:在爬蟲中使用異步實(shí)現(xiàn)高性能的數(shù)據(jù)爬取操作

異步爬蟲的方式:

- 多線程、多進(jìn)程(不建議):

好處:可以為相關(guān)阻塞的操作單獨(dú)開啟多線程或進(jìn)程,阻塞操作就可以異步執(zhí)行;

弊端:無法無限制的開啟多線程或多進(jìn)程。

- 線程池、進(jìn)程池(適當(dāng)?shù)氖褂茫?/p>

好處:我們可以降低系統(tǒng)對(duì)進(jìn)程或線程創(chuàng)建和銷毀的一個(gè)頻率,從而很好的降低系統(tǒng)的開銷;

弊端:池中線程或進(jìn)程的數(shù)據(jù)是有上限的。

代碼如下

# _*_ coding:utf-8 _*_'''@FileName :6.4k圖片解析爬取(異步高性能測(cè)試).py@CreateTime :2020/8/14 0014 10:01@Author : Lurker Zhang@E-mail : 289735192@qq.com@Desc. :'''import requestsfrom lxml import etreefrom setting.config import *import jsonimport osimport timefrom multiprocessing.dummy import Pooldef main(): # 圖片采集源地址 # source_url = ’http://pic.netbian.com/4kmeinv/’ # temp_url = ’http://pic.netbian.com/4kmeinv/index_{}.html’ # source_url = ’http://pic.netbian.com/4kdongman/’ # temp_url = ’http://pic.netbian.com/4kdongman/index_{}.html’ source_url = ’http://pic.netbian.com/4kmingxing/’ temp_url = ’http://pic.netbian.com/4kmingxing/index_{}.html’ # 本此采集前多少頁(yè),大于1的整數(shù) page_sum = 136 all_pic_list_url = [] if page_sum == 1: pic_list_url = source_url print(’開始下載:’ + pic_list_url) all_pic_list_url.append(pic_list_url) else: # 先采集第一頁(yè) pic_list_url = source_url # 調(diào)用采集單頁(yè)圖片鏈接的函數(shù) all_pic_list_url.append(pic_list_url) # 再采集第二頁(yè)開始后面的頁(yè)數(shù) for page_num in range(2, page_sum + 1): pic_list_url = temp_url.format(page_num) all_pic_list_url.append(pic_list_url) # 單頁(yè)圖片多線程解析 pool1 = Pool(10) pool1.map(down_pic, all_pic_list_url) print(’采集完成,本地成功下載{0}張圖片,失敗{1}張圖片。’.format(total_success, total_fail)) # 存儲(chǔ)已下載文件名列表: with open('../depository/mingxing/pic_name_list.json', ’w’, encoding=’utf-8’) as fp: json.dump(pic_name_list, fp)def down_pic(pic_list_url): print('準(zhǔn)備解析圖片列表頁(yè):',pic_list_url) # 獲取圖片列表頁(yè)的網(wǎng)頁(yè)數(shù)據(jù) pic_list_page_text = requests.get(url=pic_list_url, headers=headers).text tree_1 = etree.HTML(pic_list_page_text) # 獲取圖片地址列表 pic_show_url_list = tree_1.xpath(’//div[@class='slist']/ul//a/@href’) pic_url_list = [get_pic_url(’http://pic.netbian.com’ + pic_show_url) for pic_show_url in pic_show_url_list] # 開始下載并保存圖片(多線程) pool2 = Pool(5) pool2.map(save_pic, pic_url_list)def save_pic(pic_url): print('準(zhǔn)備下載圖片:',pic_url) global total_success, total_fail, pic_name_list,path picname = get_pic_name(pic_url) if not picname in pic_name_list: # 獲取日期作為保存位置文件夾 pic = requests.get(url=pic_url, headers=headers).content try: with open(path + picname, ’wb’) as fp:fp.write(pic) except IOError: print(picname + '保存失敗') total_fail += 1 else: pic_name_list.append(picname) total_success += 1 print('成功保存圖片:{0},共成功采集{1}張。'.format(picname, total_success)) else: print('跳過,已下載過圖片:' + picname) total_fail += 1def get_pic_name(pic_url): return pic_url.split(’/’)[-1]def get_pic_url(pic_show_url): tree = etree.HTML(requests.get(url=pic_show_url, headers=headers).text) return ’http://pic.netbian.com/’ + tree.xpath(’//div[@class='photo-pic']/a/img/@src’)[0]if __name__ == ’__main__’: # 讀入已采集圖片的名稱庫(kù),名稱存在重復(fù)的表示已經(jīng)采集過將跳過不采集 if not os.path.exists(’../depository/mingxing/pic_name_list.json’): with open('../depository/mingxing/pic_name_list.json', ’w’, encoding='utf-8') as fp: json.dump([], fp) with open('../depository/mingxing/pic_name_list.json', 'r', encoding='utf-8') as fp: pic_name_list = json.load(fp) path = ’../depository/mingxing/’ + time.strftime(’%Y%m%d’, time.localtime()) + ’/’ if not os.path.exists(path): os.mkdir(path) # 記錄本次采集圖片的數(shù)量 total_success = 0 total_fail = 0 main()

以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持好吧啦網(wǎng)。

標(biāo)簽: Python 編程
相關(guān)文章:
主站蜘蛛池模板: 国产成人一区二区三区影院免费 | 国产成人mv在线观看入口视频 | 中文成人在线 | 中文字幕乱码中文乱码综合 | 男女性高清爱潮视频免费观看 | 三级毛片在线免费观看 | 美女黄色一级片 | 亚洲一级毛片免费看 | 日韩美女免费线视频 | 免费看毛片网 | 97se狠狠狠狠狠亚洲综合网 | 国产一级一片 | 亚洲欧洲日韩综合色天使不卡 | 亚洲一区二区三区精品影院 | 国产在线视频欧美亚综合 | 久久综合免费 | 免费在线观看a级片 | 亚洲美女一级片 | 免费被黄网站在观看 | 欧美成人高清性色生活 | 一级一片一a一片 | 日韩一区二区三区四区 | 欧美日韩精品一区二区三区视频播放 | 亚洲黄色第一页 | 能看毛片的网址 | 伊人www | 精品成人免费一区二区在线播放 | 免费在线观看一区二区 | 一级做a爰性色毛片 | 欧美黄色免费 | 成人免费高清视频 | 97婷婷狠狠成人免费视频 | 久草视频免费看 | 亚洲精品15p | 免费看真人a一级毛片 | 欧美日韩乱国产 | 五月激激激综合网色播免费 | 久久福利国产 | 欧美aaa视频 | 久久久久久久久久毛片精品美女 | 欧美特级午夜一区二区三区 |