Python代理IP爬虫的新手使用教程

站长资源 2026/7/31 佚名

27 1538 27

DDR爱好者之家 Design By 杰米

前言

Python爬虫要经历爬虫、爬虫被限制、爬虫反限制的过程。当然后续还要网页爬虫限制优化，爬虫再反限制的一系列道高一尺魔高一丈的过程。爬虫的初级阶段，添加headers和ip代理可以解决很多问题。

本人自己在爬取豆瓣读书的时候,就以为爬取次数过多,直接被封了IP.后来就研究了代理IP的问题.

(当时不知道什么情况,差点心态就崩了...),下面给大家介绍一下我自己代理IP爬取数据的问题,请大家指出不足之处.

问题

这是我的IP被封了,一开始好好的,我还以为是我的代码问题了

思路：

从网上查找了一些关于爬虫代理IP的资料,得到下面的思路

爬取一些IP,过滤掉不可用.
在requests的请求的proxies参数加入对应的IP.
继续爬取.
收工
好吧,都是废话,理论大家都懂,上面直接上代码...

思路有了,动手起来.

运行环境

Python 3.7, Pycharm

这些需要大家直接去搭建好环境...

准备工作

爬取IP地址的网站(国内高匿代理)
校验IP地址的网站
你之前被封IP的py爬虫脚本...

上面的网址看个人的情况来选取

爬取IP的完整代码

PS:简单的使用bs4获取IP和端口号,没有啥难度,里面增加了一个过滤不可用IP的逻辑

关键地方都有注释了

#!/usr/bin/env python3
# -*- coding: utf-8 -*-
# @Time : 2018/11/22 
# @Author : liangk
# @Site :
# @File : auto_archive_ios.py
# @Software: PyCharm


import requests
from bs4 import BeautifulSoup
import json


class GetIp(object):
 """抓取代理IP"""

 def __init__(self):
 """初始化变量"""
 self.url = 'http://www.xicidaili.com/nn/'
 self.check_url = 'https://www.ip.cn/'
 self.ip_list = []

 @staticmethod
 def get_html(url):
 """请求html页面信息"""
 header = {
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.77 Safari/537.36'
 }
 try:
  request = requests.get(url=url, headers=header)
  request.encoding = 'utf-8'
  html = request.text
  return html
 except Exception as e:
  return ''

 def get_available_ip(self, ip_address, ip_port):
 """检测IP地址是否可用"""
 header = {
  'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.77 Safari/537.36'
 }
 ip_url_next = '://' + ip_address + ':' + ip_port
 proxies = {'http': 'http' + ip_url_next, 'https': 'https' + ip_url_next}
 try:
  r = requests.get(self.check_url, headers=header, proxies=proxies, timeout=3)
  html = r.text
 except:
  print('fail-%s' % ip_address)
 else:
  print('success-%s' % ip_address)
  soup = BeautifulSoup(html, 'lxml')
  div = soup.find(class_='well')
  if div:
  print(div.text)
  ip_info = {'address': ip_address, 'port': ip_port}
  self.ip_list.append(ip_info)

 def main(self):
 """主方法"""
 web_html = self.get_html(self.url)
 soup = BeautifulSoup(web_html, 'lxml')
 ip_list = soup.find(id='ip_list').find_all('tr')
 for ip_info in ip_list:
  td_list = ip_info.find_all('td')
  if len(td_list) > 0:
  ip_address = td_list[1].text
  ip_port = td_list[2].text
  # 检测IP地址是否有效
  self.get_available_ip(ip_address, ip_port)
 # 写入有效文件
 with open('ip.txt', 'w') as file:
  json.dump(self.ip_list, file)
 print(self.ip_list)


# 程序主入口
if __name__ == '__main__':
 get_ip = GetIp()
 get_ip.main()

使用方法完整代码

PS: 主要是通过使用随机的IP来爬取,根据request_status来判断这个IP是否可以用.

为什么要这样判断"htmlcode">

#!/usr/bin/env python3 # -*- coding: utf-8 -*- # @Time : 2018/11/22 # @Author : liangk # @Site : # @File : get_douban_books.py # @Software: PyCharm from bs4 import BeautifulSoup import datetime import requests import json import random ip_random = -1 article_tag_list = [] article_type_list = [] def get_html(url): header = { 'User-Agent': 'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_14_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/70.0.3538.102 Safari/537.36' } global ip_random ip_rand, proxies = get_proxie(ip_random) print(proxies) try: request = requests.get(url=url, headers=header, proxies=proxies, timeout=3) except: request_status = 500 else: request_status = request.status_code print(request_status) while request_status != 200: ip_random = -1 ip_rand, proxies = get_proxie(ip_random) print(proxies) try: request = requests.get(url=url, headers=header, proxies=proxies, timeout=3) except: request_status = 500 else: request_status = request.status_code print(request_status) ip_random = ip_rand request.encoding = 'gbk' html = request.content print(html) return html def get_proxie(random_number): with open('ip.txt', 'r') as file: ip_list = json.load(file) if random_number == -1: random_number = random.randint(0, len(ip_list) - 1) ip_info = ip_list[random_number] ip_url_next = '://' + ip_info['address'] + ':' + ip_info['port'] proxies = {'http': 'http' + ip_url_next, 'https': 'https' + ip_url_next} return random_number, proxies # 程序主入口 if __name__ == '__main__': """只是爬取了书籍的第一页,按照评价排序""" start_time = datetime.datetime.now() url = 'https://book.douban.com/tag/""" 整理分析数据 """ sub_type_list = [] a = table.find_all('a') for book_type in a: sub_type_list.append(book_type.text) article_type_list.append(sub_type_list) for sub in article_type_list: for sub1 in sub: title = '==============' + sub1 + '==============' print(title) print(base_url + sub1 + '"text-align: center">

总结

使用这样简单的代理IP,基本上就可以应付在爬爬爬着被封IP的情况了.而且没有使用自己的IP,间接的保护?!?!

大家有其他的更加快捷的方法，欢迎大家可以拿出来交流和讨论，谢谢。

好了，以上就是这篇文章的全部内容了，希望本文的内容对大家的学习或者工作具有一定的参考学习价值，谢谢大家对的支持。

python采集代理ip,爬虫代理ip使用方法,python爬虫更改ip

DDR爱好者之家 Design By 杰米

广告合作：本站广告合作请联系QQ：858582 申请时备注：广告合作（否则不回）
免责声明：本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除！

上一篇
 PyCharm搭建Spark开发环境的实现步骤

下一篇
 浅谈Python_Openpyxl使用（最全总结）

DDR爱好者之家 Design By 杰米

评论“Python代理IP爬虫的新手使用教程”

再想想

暂无评论...

ddrfans.com DDR爱好者之家

8,675无损音乐

1,324高清电影

213破解软件

70,141收录资讯

最新文章

群星《奔赴！万人现场第2期》[FLAC/分轨][5

2026/7/31
43

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/7/31
32

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》

2026/7/31
61

【古典音乐】詹姆斯·高威《季节》1993[WAV+

2026/7/31
24

贝拉芳蒂《卡里普索之王》SACD[WAV+CUE]

2026/7/31
74

站点导航

抖音极速版河马剧场京东小红书微信高德地图红果短剧夸克美团剪映拼多多支付宝淘宝快手 QQ 哔哩哔哩番茄小说得物阿里巴巴王者荣耀和平精英腾讯视频爱奇艺 QQ音乐咸鱼之王逆水寒三国志战略版梦幻西游金铲铲之战捕鱼大作战原神英雄联盟手游网易云音乐崩坏星穹铁道优酷视屏酷狗音乐蛋仔派对

更新日志

2026年07月31日

群星《奔赴！万人现场第2期》[FLAC/分轨][518.87MB]

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》[320K/MP3][43.91MB]

群星《奇妙浪一夏 (上海迪士尼度假区音乐)》[FLAC/分轨][140.49MB]

【古典音乐】詹姆斯·高威《季节》1993[WAV+CUE]

贝拉芳蒂《卡里普索之王》SACD[WAV+CUE]

2026年07月31日

小骆驼-《草原狼2(蓝光CD)》[原抓WAV+CUE]

群星《欢迎来到我身边电影原声专辑》[320K/MP3][105.02MB]

群星《欢迎来到我身边电影原声专辑》[FLAC/分轨][480.9MB]

雷婷《梦里蓝天HQⅡ》 2023头版限量编号低速原抓[WAV+CUE][463M]

群星《2024好听新歌42》AI调整音效【WAV分轨】

王思雨-《思念陪着鸿雁飞》WAV

王思雨《喜马拉雅HQ》头版限量编号[WAV+CUE]

李健《无时无刻》[WAV+CUE][590M]

陈奕迅《酝酿》[WAV分轨][502M]

卓依婷《化蝶》2CD[WAV+CUE][1.1G]

群星《吉他王(黑胶CD)》[WAV+CUE]

齐秦《穿乐(穿越)》[WAV+CUE]

发烧珍品《数位CD音响测试-动向效果（九）》【WAV+CUE】

邝美云《邝美云精装歌集》[DSF][1.6G]

吕方《爱一回伤一回》[WAV+CUE][454M]

友情链接

杰晶网络 DDR爱好者之家南强小屋黑松山资源网白云城资源网

DDR爱好者之家 Design By 杰米

Copyright © 1998~2024 DDR爱好者之家 Design by 杰米手机版