DDR爱好者之家 Design By 杰米
本文实例讲述了Python实现的爬取百度文库功能。分享给大家供大家参考,具体如下:
# -*- coding: utf-8 -*- from selenium import webdriver from bs4 import BeautifulSoup from docx import Document from docx.enum.text import WD_ALIGN_PARAGRAPH# 用来居中显示标题 from time import sleep from selenium.webdriver.common.keys import Keys # 浏览器安装路径 #BROWSER_PATH=\'C:\Users\Administrator\AppData\Local\Google\Chrome\Application\chromedriver.exe' #目的URL DEST_URL='https://wenku.baidu.com/view/aa31a84bcf84b9d528ea7a2c.html' #用来保存文档 doc_title = '' doc_content_list = [] def find_doc(driver, init=True): global doc_content_list global doc_title stop_condition = False html = driver.page_source soup1 = BeautifulSoup(html, 'lxml') if (init is True): # 得到标题 title_result = soup1.find('div', attrs={'class': 'doc-title'}) doc_title = title_result.get_text() # 得到文档标题 # 拖动滚动条 init_page = driver.find_element_by_xpath( "//div[@class='foldpagewg-text-con']") print(type(init_page), init_page) driver.execute_script('arguments[0].scrollIntoView();', init_page) init_page.click() init = False else: try: page = driver.find_element_by_xpath( "//div[@class='pagerwg-schedule']") #print(type(next_page), next_page) next_page = driver.find_element_by_class_name("pagerwg-button") station = driver.find_element_by_xpath( "//div[@class='bottombarwg-root border-none']") driver.execute_script('arguments[0].scrollIntoView(false);', station) #js.executeScript("arguments[0].click();",next_page); #sleep(5) '''js = "window.scrollTo(508,600)" driver.execute_script(js)''' next_page.click() except: #结束条件 print("找不到元素") stop_condition = True #next_page.send_keys(Keys.ENTER) # 遍历所有的txt标签标定的文档,将其空格删除,然后进行保存 content_result = soup1.find_all('p', attrs={'class': 'txt'}) for each in content_result: each_text = each.get_text() if ' ' in each_text: text = each_text.replace(' ', '') else: text = each_text # print(each_text) doc_content_list.append(text) # 得到正文内容 sleep(2) # 防止页面加载过慢 if stop_condition is False: doc_title, doc_content_list = find_doc(driver, init) return doc_title, doc_content_list def save(doc_title, doc_content_list): document = Document() heading = document.add_heading(doc_title, 0) heading.alignment = WD_ALIGN_PARAGRAPH.CENTER # 居中显示 for each in doc_content_list: document.add_paragraph(each) # 处理字符编码问题 t_title = doc_title.split()[0] #print(t_title) #document.save('2.docx') document.save('百度文库-%s.docx'% t_title) print("\n\nCompleted: %s.docx, to read." % t_title) driver.quit() if __name__ == '__main__': options = webdriver.ChromeOptions() options.add_argument('user-agent="Mozilla/5.0 (Linux; Android 4.0.4; \ Galaxy Nexus Build/IMM76B) AppleWebKit/535.19 (KHTML, like Gecko) \ Chrome/18.0.1025.133 Mobile Safari/535.19"') #driver = webdriver.Chrome(BROWSER_PATH, chrome_options=options) driver = webdriver.Chrome(chrome_options=options) driver.get(DEST_URL) #JavascriptExecutor js = (JavascriptExecutor) driver; print("**********START**********") title, content = find_doc(driver, True) save(title, content) driver.quit()
更多关于Python相关内容可查看本站专题:《Python Socket编程技巧总结》、《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》
希望本文所述对大家Python程序设计有所帮助。
DDR爱好者之家 Design By 杰米
广告合作:本站广告合作请联系QQ:858582 申请时备注:广告合作(否则不回)
免责声明:本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除!
免责声明:本站资源来自互联网收集,仅供用于学习和交流,请遵循相关法律法规,本站一切资源不代表本站立场,如有侵权、后门、不妥请联系本站删除!
DDR爱好者之家 Design By 杰米
暂无评论...
稳了!魔兽国服回归的3条重磅消息!官宣时间再确认!
昨天有一位朋友在大神群里分享,自己亚服账号被封号之后居然弹出了国服的封号信息对话框。
这里面让他访问的是一个国服的战网网址,com.cn和后面的zh都非常明白地表明这就是国服战网。
而他在复制这个网址并且进行登录之后,确实是网易的网址,也就是我们熟悉的停服之后国服发布的暴雪游戏产品运营到期开放退款的说明。这是一件比较奇怪的事情,因为以前都没有出现这样的情况,现在突然提示跳转到国服战网的网址,是不是说明了简体中文客户端已经开始进行更新了呢?
更新日志
2024年11月26日
2024年11月26日
- 凤飞飞《我们的主题曲》飞跃制作[正版原抓WAV+CUE]
- 刘嘉亮《亮情歌2》[WAV+CUE][1G]
- 红馆40·谭咏麟《歌者恋歌浓情30年演唱会》3CD[低速原抓WAV+CUE][1.8G]
- 刘纬武《睡眠宝宝竖琴童谣 吉卜力工作室 白噪音安抚》[320K/MP3][193.25MB]
- 【轻音乐】曼托凡尼乐团《精选辑》2CD.1998[FLAC+CUE整轨]
- 邝美云《心中有爱》1989年香港DMIJP版1MTO东芝首版[WAV+CUE]
- 群星《情叹-发烧女声DSD》天籁女声发烧碟[WAV+CUE]
- 刘纬武《睡眠宝宝竖琴童谣 吉卜力工作室 白噪音安抚》[FLAC/分轨][748.03MB]
- 理想混蛋《Origin Sessions》[320K/MP3][37.47MB]
- 公馆青少年《我其实一点都不酷》[320K/MP3][78.78MB]
- 群星《情叹-发烧男声DSD》最值得珍藏的完美男声[WAV+CUE]
- 群星《国韵飘香·贵妃醉酒HQCD黑胶王》2CD[WAV]
- 卫兰《DAUGHTER》【低速原抓WAV+CUE】
- 公馆青少年《我其实一点都不酷》[FLAC/分轨][398.22MB]
- ZWEI《迟暮的花 (Explicit)》[320K/MP3][57.16MB]