先看看要爬取页面出版社信息格式:
import urllib.request
import re
data = urllib.request.urlopen("https://read.douban.com/provider/all").read().decode("UTF-8")
# print(len(data))
pat = '<div class="name">(.*?)</div>'
r = re.compile(pat).findall(data)
# print(r[0])
fh = open("C:/Users/Nicht_sehen/Desktop/cbs.txt","w")
for i in range(0,len(r)):
fh.write(r[i]+"\n")
fh.close()
打开桌面的cbs文件:
可以看到爬下来的出版社信息已经写入了文件