Pythonselenium爬取微博数据代码实例_WebWorm.RandomHeader

81 浏览量更新于2023-03-03 评论 2 收藏 48KB PDF 举报

身份认证购VIP最低享 7 折!

领优惠券(最高得80元）

资源详情

资源评论

资源推荐

Python selenium爬取微博数据代码实例爬取微博数据代码实例

主要介绍了Python selenium爬取微博数据代码实例,文中通过示例代码介绍的非常详细，对大家的学习或者工作

具有一定的参考学习价值,需要的朋友可以参考下

爬取某人的微博数据，把某人所有时间段的微博数据都爬下来。

具体思路：

创建driver-----get网页----找到并提取信息-----保存csv----翻页----get网页（开始循环）----...----没有“下一页”就结束，

用了while True，没用自我调用函数

嘟大海的微博：https://weibo.com/u/1623915527

办公室小野的微博：https://weibo.com/bgsxy

代码如下

from selenium import webdriver

from selenium.webdriver.common.keys import Keys

import csv

import os

import time

#只有这2个参数设置，想爬谁的微博数据就在这里改地址和目标csv名称就行

weibo_url = 'https://weibo.com/bgsxy?profile_ftype=1&is_all=1#_0'

csv_name = 'bgsxy_allweibo.csv'

def start_chrome():

print('开始创建浏览器')

driver = webdriver.Chrome(executable_path='C:/Users/lori/Desktop/python52project/chromedriver_win32/chromedriver.exe')

driver.start_client()

return driver

def get_web(url): #获取网页，并下拉到最底部

print('开始打开指定网页')

driver.get(url)

time.sleep(7)

scoll_down()

time.sleep(5)

def scoll_down(): # 滚轮下拉到最底部

html_page = driver.find_element_by_tag_name('html')

for i in range(7):

print(i)

html_page.send_keys(Keys.END)

time.sleep(1)

def get_data():

print('开始查找并提取数据')

card_sel = 'div.WB_cardwrap.WB_feed_type'

time_sel = 'a.S_txt2[node-type="feed_list_item_date"]'

source_sel = 'a.S_txt2[suda-uatrack="key=profile_feed&value=pubfrom_guest"]'

content_sel = 'div.WB_text.W_f14'

interact_sel = 'span.line.S_line1>span>em:nth-child(2)'

cards = driver.find_elements_by_css_selector(card_sel)

info_list = []

for card in cards:

time = card.find_elements_by_css_selector(time_sel)[0].text #虽然有可能在一个card中有2个time元素，我们取第一个就对

if card.find_elements_by_css_selector(source_sel):

source = card.find_elements_by_css_selector(source_sel)[0].text

else:

source = ''

content = card.find_elements_by_css_selector(content_sel)[0].text

link = card.find_elements_by_css_selector(time_sel)[0].get_attribute('href')

trans = card.find_elements_by_css_selector(interact_sel)[1].text

comment = card.find_elements_by_css_selector(interact_sel)[2].text

like = card.find_elements_by_css_selector(interact_sel)[3].text

info_list.append([time,source,content,link,trans,comment,like])

return info_list

def save_csv(info_list,csv_name):

csv_path = './' + csv_name

本内容试读结束，登录后可阅读更多

下载后可阅读完整内容，剩余1页未读，立即下载

weixin_38702047

粉丝: 3
资源: 968

会员权益专享

Python selenium爬取微博数据代码实例

评论0

会员权益专享

最新资源

Python selenium爬取微博数据代码实例

评论0

Python爬取微博评论代码

新浪微博 评论抓取v1.2

Selenium爬取新浪微博客户端用户信息、热点话题及评论 (上).docx

python selenium爬取微博

python爬虫爬取微博

python根据关键字爬取微博

python使用selenium爬取微博热搜榜，将网页源代码解析为HTML文档，使用xpath获取热搜文本内容。

python爬取微博评论数据可视化

python爬取微博关键词数据

网络爬虫程序爬取微博数据

python根据关键字爬取微博相关信息

python爬取微博含有关键词微博代码

selenium爬取微博

爬取微博评论数据python

python爬取微博今日热门话题

python爬取微博用户关注列表_GitHub - dataabc/weibo-follow: 爬取关注列表中微博账号的微博...

python爬取微博舆情

python爬取微博评论生词云

python selenium爬取今日头条新闻

python selenium爬取京东

会员权益专享

最新资源

新浪微博评论抓取v1.2