使用python爬取微博數(shù)據(jù)打造一顆“心”
前言
一年一度的虐狗節(jié)終于過(guò)去了,朋友圈各種曬,曬自拍,曬娃,曬美食,秀恩愛(ài)的。程序員在曬什么,程序員在加班。但是禮物還是少不了的,送什么好?作為程序員,我準(zhǔn)備了一份特別的禮物,用以往發(fā)的微博數(shù)據(jù)打造一顆“愛(ài)心”,我想她一定會(huì)感動(dòng)得哭了吧。哈哈
準(zhǔn)備工作
有了想法之后就開(kāi)始行動(dòng)了,自然最先想到的就是用 Python 了,大體思路就是把微博數(shù)據(jù)爬下來(lái),數(shù)據(jù)經(jīng)過(guò)清洗加工后再進(jìn)行分詞處理,處理后的數(shù)據(jù)交給詞云工具,配合科學(xué)計(jì)算工具和繪圖工具制作成圖像出來(lái),涉及到的工具包有:
requests 用于網(wǎng)絡(luò)請(qǐng)求爬取微博數(shù)據(jù),結(jié)巴分詞進(jìn)行中文分詞處理,詞云處理庫(kù) wordcloud,圖片處理庫(kù) Pillow,科學(xué)計(jì)算工具 NumPy ,類(lèi)似于 MATLAB 的 2D 繪圖庫(kù) Matplotlib
工具安裝
安裝這些工具包時(shí),不同系統(tǒng)平臺(tái)有可能出現(xiàn)不一樣的錯(cuò)誤,wordcloud,requests,jieba 都可以通過(guò)普通的 pip 方式在線(xiàn)安裝,
pip install wordcloud pip install requests pip install jieba
在Windows 平臺(tái)安裝 Pillow,NumPy,Matplotlib 直接用 pip 在線(xiàn)安裝會(huì)出現(xiàn)各種問(wèn)題,推薦的一種方式是在一個(gè)叫 Python Extension Packages for Windows 1 的第三方平臺(tái)下載 相應(yīng)的 .whl 文件安裝??梢愿鶕?jù)自己的系統(tǒng)環(huán)境選擇下載安裝 cp27 對(duì)應(yīng) python2.7,amd64 對(duì)應(yīng) 64 位系統(tǒng)。下載到本地后進(jìn)行安裝
pip install Pillow-4.0.0-cp27-cp27m-win_amd64.whl pip install scipy-0.18.0-cp27-cp27m-win_amd64.whl pip install numpy-1.11.3+mkl-cp27-cp27m-win_amd64.whl pip install matplotlib-1.5.3-cp27-cp27m-win_amd64.whl
其他平臺(tái)可根據(jù)錯(cuò)誤提示 Google 解決。或者直接基于 Anaconda 開(kāi)發(fā),它是 Python 的一個(gè)分支,內(nèi)置了大量科學(xué)計(jì)算、機(jī)器學(xué)習(xí)的模塊 。
獲取數(shù)據(jù)
新浪微博官方提供的 API 是個(gè)渣渣,只能獲取用戶(hù)最新發(fā)布的5條數(shù)據(jù),退而求其次,使用爬蟲(chóng)去抓取數(shù)據(jù),抓取前先評(píng)估難度,看看是否有人寫(xiě)好了,在GitHub逛了一圈,基本沒(méi)有滿(mǎn)足需求的。倒是給我提供了一些思路,于是決定自己寫(xiě)爬蟲(chóng)。
使用 移動(dòng)端網(wǎng)址去爬取數(shù)據(jù)。發(fā)現(xiàn)接口 可以分頁(yè)獲取微博數(shù)據(jù),而且返回的數(shù)據(jù)是 json 格式,這樣就省事很多了,不過(guò)該接口需要登錄后的 cookies 信息,登錄自己的帳號(hào)就可以通過(guò) Chrome 瀏覽器 找到 Cookies 信息。

實(shí)現(xiàn)代碼:
def fetch_weibo():
api = "http://m.weibo.cn/index/my?format=cards&page=%s"
for i in range(1, 102):
response = requests.get(url=api % i, cookies=cookies)
data = response.json()[0]
groups = data.get("card_group") or []
for group in groups:
text = group.get("mblog").get("text")
text = text.encode("utf-8")
text = cleanring(text).strip()
yield text
查看微博的總頁(yè)數(shù)是101,考慮到一次性返回一個(gè)列表對(duì)象太費(fèi)內(nèi)存,函數(shù)用 yield 返回一個(gè)生成器,此外還要對(duì)文本進(jìn)行數(shù)據(jù)清洗,例如去除標(biāo)點(diǎn)符號(hào),HTML 標(biāo)簽,“轉(zhuǎn)發(fā)微博”這樣的字樣。
保存數(shù)據(jù)
數(shù)據(jù)獲取之后,我們要把它離線(xiàn)保存起來(lái),方便下次重復(fù)使用,避免重復(fù)地去爬取。使用 csv 格式保存到 weibo.csv 文件中,以便下一步使用。數(shù)據(jù)保存到 csv 文件中打開(kāi)的時(shí)候可能為亂碼,沒(méi)關(guān)系,用 notepad++查看不是亂碼。
def write_csv(texts):
with codecs.open('weibo.csv', 'w') as f:
writer = csv.DictWriter(f, fieldnames=["text"])
writer.writeheader()
for text in texts:
writer.writerow({"text": text})
def read_csv():
with codecs.open('weibo.csv', 'r') as f:
reader = csv.DictReader(f)
for row in reader:
yield row['text']
分詞處理
從 weibo.csv 文件中讀出來(lái)的每一條微博進(jìn)行分詞處理后再交給 wordcloud 生成詞云。結(jié)巴分詞適用于大部分中文使用場(chǎng)景,使用停止詞庫(kù) stopwords.txt 把無(wú)用的信息(比如:的,那么,因?yàn)榈龋┻^(guò)濾掉。
def word_segment(texts):
jieba.analyse.set_stop_words("stopwords.txt")
for text in texts:
tags = jieba.analyse.extract_tags(text, topK=20)
yield " ".join(tags)
生成圖片
數(shù)據(jù)分詞處理后,就可以給 wordcloud 處理了,wordcloud 根據(jù)數(shù)據(jù)里面的各個(gè)詞出現(xiàn)的頻率、權(quán)重按比列顯示關(guān)鍵字的字體大小。生成方形的圖像,如圖:

是的,生成的圖片毫無(wú)美感,畢竟是要送人的也要拿得出手才好炫耀對(duì)吧,那么我們找一張富有藝術(shù)感的圖片作為模版,臨摹出一張漂亮的圖出來(lái)。我在網(wǎng)上搜到一張“心”型圖:

生成圖片代碼:
def generate_img(texts):
data = " ".join(text for text in texts)
mask_img = imread('./heart-mask.jpg', flatten=True)
wordcloud = WordCloud(
font_path='msyh.ttc',
background_color='white',
mask=mask_img
).generate(data)
plt.imshow(wordcloud)
plt.axis('off')
plt.savefig('./heart.jpg', dpi=600)
需要注意的是處理時(shí),需要給 matplotlib 指定中文字體,否則會(huì)顯示亂碼,找到字體文件夾:C:\Windows\Fonts\Microsoft YaHei UI復(fù)制該字體,拷貝到 matplotlib 安裝目錄:C:\Python27\Lib\site-packages\matplotlib\mpl-data\fonts\ttf 下
差不多就這樣。

當(dāng)我自豪地把這張圖發(fā)給她的時(shí)候,出現(xiàn)了這樣的對(duì)話(huà):
這是什么?
我:愛(ài)心啊,親手做的
這么專(zhuān)業(yè),好感動(dòng)啊,你的眼里只有 python ,沒(méi)有我 (哭笑)
我:明明是“心”中有 python 啊
我好像說(shuō)錯(cuò)了什么。哈哈哈
完整代碼可以Github 下載。
以上就是本文的全部?jī)?nèi)容,希望對(duì)大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。
相關(guān)文章
python數(shù)據(jù)庫(kù)PooledDB連接池初始化使用示例
這篇文章主要為大家介紹了python數(shù)據(jù)庫(kù)PooledDB連接池初始化使用示例詳解,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪2023-08-08
Python遍歷目錄下文件、讀取、千萬(wàn)條數(shù)據(jù)合并詳情
這篇文章主要介紹了Python遍歷目錄下文件、讀取、千萬(wàn)條數(shù)據(jù)合并詳情,對(duì)文件夾和文件進(jìn)行屬性判斷,首先對(duì)文件夾進(jìn)行遍歷,看文件夾里有什么樣的文件,讀取出文件夾中的所有文件,下面文章將詳細(xì)介紹該內(nèi)容,需要的小伙伴可以參考一下2022-01-01
在Python開(kāi)發(fā)環(huán)境中調(diào)用ChatGPT模型詳細(xì)過(guò)程
在開(kāi)發(fā)過(guò)程當(dāng)中時(shí)常需要使用 ChatGPT 來(lái)完成一些任務(wù),但總是使用網(wǎng)頁(yè)交互模式去 Web 端訪問(wèn) ChatGPT 是很麻煩的,這時(shí)候我們可以使用代碼來(lái)調(diào)用 ChatGPT 模型,本文將詳細(xì)介紹在 Python 開(kāi)發(fā)環(huán)境中調(diào)用 ChatGPT 模型過(guò)程,,需要的朋友可以參考下2023-05-05
Python Loguru日志封裝裝飾器實(shí)現(xiàn)過(guò)程
這篇文章主要介紹了Python Loguru日志封裝裝飾器實(shí)現(xiàn)過(guò)程,本文通過(guò)實(shí)例代碼給大家介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友參考下吧2024-03-03
python 監(jiān)控服務(wù)器是否有人遠(yuǎn)程登錄(詳細(xì)思路+代碼)
這篇文章主要介紹了python 監(jiān)控服務(wù)器是否有人遠(yuǎn)程登錄的方法,幫助大家利用python 監(jiān)控服務(wù)器,感興趣的朋友可以了解下2020-12-12
python實(shí)現(xiàn)excel公式格式化的示例代碼
這篇文章主要介紹了python實(shí)現(xiàn)excel公式格式化的示例代碼,文中通過(guò)示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來(lái)一起學(xué)習(xí)學(xué)習(xí)吧2020-12-12
Python+SeaTable實(shí)現(xiàn)生成條形碼圖片并寫(xiě)入表格
不管是錄入信息時(shí)需要用掃碼器掃碼錄入,還是有別的生成條形碼的需要,這在?SeaTable?表格中用?Python?腳本就可以輕松實(shí)現(xiàn),本文就來(lái)為大家詳細(xì)講解一下2022-07-07

