午夜时分,当你看到选择心动秘书的游戏广告,能用Python做什么?

24 阅读2分钟

===========

爬取目标:


网址:www.jdlingyu.com/tag/%e4%b8%…

工具使用


开发环境:win10、python3.8 开发工具:pycharm、Chrome 工具包:requests,lxml

项目思路解析


选取你对应的图片分类

根据分类信息提取到没有图片的超链接,提取出A标签的跳转地址以及图片的标题名字

进入详情页面,xpath提取详情页面所有的图片地址:

将就一下:保存图片到本地

============

import requests

from lxml import etree

headers = {

"user-agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/87.0.4280.88 Safari/537.36"

}

def get_url(start_url):

response = requests.get(start_url, headers=headers).text

data = etree.HTML(response)

new_url = data.xpath('//div[@class="post-module-thumb"]/a/@href')

for url in new_url:

yield url

def get_img(url):

response = requests.get(url, headers=headers).text

img_data = etree.HTML(response)

img_url = img_data.xpath('//div[@class="entry-content"]/img/@src')

for img_url in img_url:

name = img_url.split("/")[-2] + img_url.split("/")[-1]

result = requests.get(img_url).content

with open("图片/" + name, "wb")as f:

f.write(result)

print("正在下载", name)

if name == 'main':

for i in range(1, 3):

start_url = "www.jdlingyu.com/tuji/hentai…

html_url = get_url(start_url)

for url in html_url:

get_img(url)

好了,图片下载完成,我也该关电脑睡觉了。留着给我的00后小徒弟看吧。

收集整理了一份《2024年最新Python全套学习资料》免费送给大家,初衷也很简单,就是希望能够帮助到想自学提升又不知道该从何学起的朋友。 img img

既有适合小白学习的零基础资料,也有适合3年以上经验的小伙伴深入学习提升的进阶课程,涵盖了95%以上Python知识点,真正体系化!

了解详情:docs.qq.com/doc/DSnl3ZG…