python爬蟲——爬取小說 | 探索白子畫和花千骨的愛恨情仇

newsning 發(fā)布于2019-07-30 14:30 / 3122人閱讀

摘要：先打開花千骨小說的目錄頁，是這樣的。網(wǎng)頁結(jié)構(gòu)分析首先，目錄頁左上角有幾個(gè)可以提高你此次爬蟲成功后成就感的字眼暫不提供花千骨全集下載。打開盤查看花千骨文件。

知識(shí)就像碎布，記得“縫一縫”，你才能華麗麗地亮相。

1.Beautiful Soup 1.Beautifulsoup 簡介

此次實(shí)戰(zhàn)從網(wǎng)上爬取小說，需要使用到Beautiful Soup。
Beautiful Soup為python的第三方庫，可以幫助我們從網(wǎng)頁抓取數(shù)據(jù)。
它主要有如下特點(diǎn)：

1.Beautiful Soup可以從一個(gè)HTML或者XML提取數(shù)據(jù)，它包含了簡單的處理、遍歷、搜索文檔樹、修改網(wǎng)頁元素等功能。可以通過很簡短地代碼完成我們地爬蟲程序。

2.Beautiful Soup幾乎不用考慮編碼問題。一般情況下，它可以將輸入文檔轉(zhuǎn)換為unicode編碼，并且以utf-8編碼方式輸出，

2.Beautiful Soup安裝

win命令行下：

pip install beautifusoup4

3.Beautiful Soup基礎(chǔ)

大家可以參考文檔來學(xué)習(xí)（中文版的哦）：

[http://beautifulsoup.readthedocs.io/zh_CN/latest/#id8]

對于本次爬蟲任務(wù)，只要了解以下幾點(diǎn)基礎(chǔ)內(nèi)容就可以完成：
1.Beautiful Soup的對象種類：

Tag

Navigablestring

BeautifulSoup

Comment

2.遍歷文檔樹：find、find_all、find_next和children
3.一點(diǎn)點(diǎn)HTML和CSS知識(shí)（沒有也將就，現(xiàn)學(xué)就可以）

2.爬取小說花千骨 1.爬蟲思路分析

本次爬取小說的網(wǎng)站為136書屋。
先打開花千骨小說的目錄頁，是這樣的。

我們的目的是找到每個(gè)目錄對應(yīng)的url，并且爬取其中地正文內(nèi)容，然后放在本地文件中。

2.網(wǎng)頁結(jié)構(gòu)分析

首先，目錄頁左上角有幾個(gè)可以提高你此次爬蟲成功后成就感的字眼：暫不提供花千骨txt全集下載。
繼續(xù)往下看，發(fā)現(xiàn)是最新章節(jié)板塊，然后便是全書的所有目錄。我們分析的對象便是全書所有目錄。點(diǎn)開其中一個(gè)目錄，我們便可以都看到正文內(nèi)容。

按F12打開審查元素菜單。可以看到網(wǎng)頁前端的內(nèi)容都包含在這里。

我們的目的是要找到所有目錄的對應(yīng)鏈接地址，爬取每個(gè)地址中的文本內(nèi)容。
有耐心的朋友可以在里面找到對應(yīng)的章節(jié)目錄內(nèi)容。有一個(gè)簡便方法是點(diǎn)擊審查元素中左上角箭頭標(biāo)志的按鈕，然后選中相應(yīng)元素，對應(yīng)的位置就會(huì)加深顯示。

這樣我們可以看到，每一章的鏈接地址都是有規(guī)則地存放在

中。而這些

又放在

中。

我不停地強(qiáng)調(diào)“我們的目的”是要告訴大家，思路很重要。爬蟲不是約pao，蒙頭就上不可取。

3.單章節(jié)爬蟲

剛才已經(jīng)分析過網(wǎng)頁結(jié)構(gòu)。我們可以直接在瀏覽器中打開對應(yīng)章節(jié)的鏈接地址，然后將文本內(nèi)容提取出來。

我們要爬取的內(nèi)容全都包含在這個(gè)

里面。
代碼整理如下：

from urllib import request
from bs4 import BeautifulSoup

if __name__ == "__main__":
    # 第8章的網(wǎng)址
    url = "http://www.136book.com/huaqiangu/ebxeew/"
    head = {}
    # 使用代理
    head["User-Agent"] = "Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19"
    req = request.Request(url, headers = head)
    response = request.urlopen(req)
    html = response.read()
    # 創(chuàng)建request對象
    soup = BeautifulSoup(html, "lxml")
    # 找出div中的內(nèi)容
    soup_text = soup.find("div", id = "content")
    # 輸出其中的文本
    print(soup_text.text)

運(yùn)行結(jié)果如下：

這樣，單章節(jié)內(nèi)容爬取就大功告成了。

4.小說全集爬蟲

單章節(jié)爬蟲我們可以直接打開對應(yīng)的章節(jié)地址解析其中的文本，全集爬蟲我們不可能讓爬蟲程序在每章節(jié)網(wǎng)頁內(nèi)中跑一遍，如此還不如復(fù)制、粘貼來的快。
我們的思路是先在目錄頁中爬取所有章節(jié)的鏈接地址，然后再爬取每個(gè)鏈接對應(yīng)的網(wǎng)頁中的文本內(nèi)容。說來，就是比單章節(jié)爬蟲多一次解析過程，需要用到Beautiful Soup遍歷文檔樹的內(nèi)容。

1.解析目錄頁

在思路分析中，我們已經(jīng)了解了目錄頁的結(jié)構(gòu)。所有的內(nèi)容都放在一個(gè)

中。

這兒有兩個(gè)一模一樣的

。
第一個(gè)

包含著最近更新的章節(jié)，第二個(gè)

包含著全集內(nèi)容。
請注意，我們要爬取的是第二個(gè)

中的內(nèi)容。
代碼整理如下：

from urllib import request
from bs4 import BeautifulSoup

if __name__ == "__main__":
    # 目錄頁
    url = "http://www.136book.com/huaqiangu/"
    head = {}
    head["User-Agent"] = "Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19"
    req = request.Request(url, headers = head)
    response = request.urlopen(req)
    html = response.read()
    # 解析目錄頁
    soup = BeautifulSoup(html, "lxml")
    # find_next找到第二個(gè)
    soup_texts = soup.find("div", id = "book_detail", class_= "box1").find_next("div")
    # 遍歷ol的子節(jié)點(diǎn)，打印出章節(jié)標(biāo)題和對應(yīng)的鏈接地址
    for link in soup_texts.ol.children:
        if link != "
":
            print(link.text + ":  ", link.a.get("href"))

執(zhí)行結(jié)果如圖：

2.爬取全集內(nèi)容

將每個(gè)解析出來的鏈接循環(huán)代入到url中解析出來，并將其中的文本爬取出來，并且寫到本地F：/huaqiangu.txt中。
代碼整理如下：

from urllib import request
from bs4 import BeautifulSoup

if __name__ == "__main__":
    url = "http://www.136book.com/huaqiangu/"
    head = {}
    head["User-Agent"] = "Mozilla/5.0 (Linux; Android 4.1.1; Nexus 7 Build/JRO03D) AppleWebKit/535.19 (KHTML, like Gecko) Chrome/18.0.1025.166  Safari/535.19"
    req = request.Request(url, headers = head)
    response = request.urlopen(req)
    html = response.read()
    soup = BeautifulSoup(html, "lxml")
    soup_texts = soup.find("div", id = "book_detail", class_= "box1").find_next("div")
    # 打開文件
    f = open("F:/huaqiangu.txt","w")
    # 循環(huán)解析鏈接地址
    for link in soup_texts.ol.children:
        if link != "
":
            download_url = link.a.get("href")
            download_req = request.Request(download_url, headers = head)
            download_response = request.urlopen(download_req)
            download_html = download_response.read()
            download_soup = BeautifulSoup(download_html, "lxml")
            download_soup_texts = download_soup.find("div", id = "content")
            # 抓取其中文本
            download_soup_texts = download_soup_texts.text
            # 寫入章節(jié)標(biāo)題
            f.write(link.text + "

")
            # 寫入章節(jié)內(nèi)容
            f.write(download_soup_texts)
            f.write("

")
    f.close()

執(zhí)行結(jié)果顯示 [Finished in 32.3s] 。

打開F盤查看花千骨文件。

爬蟲成功。備好紙巾，快快去感受尊上和小骨的虐戀吧。

5.總結(jié)

代碼還有很多改進(jìn)的地方。例如文本中包含廣告的js代碼可以去除，還可以加上爬蟲進(jìn)度顯示等等。實(shí)現(xiàn)這些功能需要包含正則表達(dá)式和os模塊知識(shí)，就不多說了，大家可以繼續(xù)完善。

碼字辛苦，碼代碼費(fèi)神，文字和代碼同碼更是艱辛無比。如果您覺得文章有那么一丟丟價(jià)值，請不要吝嗇您的贊賞。