最近看到一篇文章介紹了利用Python爬蟲爬取B站視頻封面的文章,雖然我完全沒看文章,但是只看了一眼這個封面圖就徹底把我吸引了。不過我也對爬蟲這方面比較熟悉了,這麼簡單的事情還用看別人的文章教我做事?當然是自己動手豐衣足食啦!
(此處請自行想像.JPG)
確定思路
首先自然是先用F12開發者工具看看這個頁面的樣子了。這一步簡直順利的無懈可擊,一下子就找到了封面圖的地址,就是下圖紅框所示的地址。在瀏覽器中打開看看,果然正是這個封面圖。但是話又說回來,這個封面圖是不是小了點?這就要說到圖片CDN的一個功能了,如果大家有用過這類服務的話,一般這種圖片服務都支持按照尺寸加載圖片,也就是這個地址最後的320w_240h。如果是這樣的話,那麼我們把它改成大尺寸的1920*1080,不就是可以得到高清大圖了嗎?這麼一嘗試果然如此,好了,那麼問題就解決了。
封面圖地址
解決異步加載
但是實際操作的時候,又遇到了一個問題。那就是代碼完全正確,但是結果卻一個網頁元素都獲取不到了。這可讓我百思不得其解,百般嘗試之後無奈再回頭看看人家的文章是怎麼說的。原來B站的網頁是異步加載的,如果用爬蟲直接獲取的話,只會得到如下圖所示的空空如也的頁面,實際的網頁內容都是通過JavaScript執行以後獲得的。比較遺憾的是,我嘗試用requests-html的render函數渲染瀏覽器實際頁面,也沒有成功。
沒有實際內容的網頁內容
這時候就要說回到異步加載了,既然這些信息是異步加載出來的,那麼我們看看能否從網頁中找到一些線索。實際上還真有這麼一個東西,就是下圖中search這個請求,它請求的地址是api開頭的網址,一般都是幹返回JSON數據的。如果不好找的話,可以從紅框那裡選擇篩選類別來進行更詳細的查找。總之,這個請求就是我們要找的東西,它返回的正是當前頁面的封面圖JSON數據,最關鍵的是,它這裡的圖片直接就是1920*1080高清大圖,直接省了不少事情。而且這個請求的參數直接就包含了頁數,所以我們只要取到總頁數,用這個api拉圖片地址就完事了。
尋找加載方式
實際代碼和效果
好了,下面就是最終的代碼了。代碼按照函數來組織,應該非常容易理解,因為我這裡使用視頻封面圖的標題來當做文件名,所以可能會出現不能當做文件名的非法字符。因此我還加了一個函數專門來去除非法字符。默認圖片保存路徑是桌面,可以更改到其他位置。
部分代碼截圖
from requests_html import HTMLSessionuserinfo_url = 'https://space.bilibili.com/72956117/video'save_folder = r'~/Desktop/images'def get_total_page(): session = HTMLSession() response = session.get(userinfo_url) response.html.render() total_page = response.html.find('span.be-pager-total', first=True).text return int(total_page[2:-3])def get_image_urls(): base_url = 'https://api.bilibili.com/x/space/arc/search?mid=72956117&ps=30&tid=0&pn={0}&keyword=&order=pubdate&jsonp=jsonp' session = HTMLSession() for i in range(1, get_total_page()+1): url = base_url.format(i) response = session.get(url) for i in response.json()['data']['list']['vlist']: yield {'name': i['title'], 'url': 'https:'+i["pic"]}def remove_unvalid_chars(s): for c in r'''"'<>/\|:*?''': s = s.replace(c, '') return sdef download_images(): import pathlib import requests import shutil folder = pathlib.Path(save_folder).expanduser() if not folder.exists(): folder.mkdir() for i in get_image_urls(): response = requests.get(i['url'], stream=True) filename = remove_unvalid_chars(i["name"])+'.jpg' with open(folder/filename, 'wb') as f: shutil.copyfileobj(response.raw, f) print(f'{i["name"]}.jpg下載完成')download_images()運行完畢之後就可以得到滿滿一個文件夾的圖片了,然後就可以一個人找個閒暇時間靜靜的欣賞了。喜歡的朋友記得點個讚哦!
此處請繼續自行想像