python爬虫新浪微博并将其保存到excel文件中

时间: 2024-03-14 12:50:13 浏览: 342

【python爬虫】连续爬取一个或多个新浪微博用户的数据并将结果信息写入文件或数据库介绍

在Python编程领域，爬虫是一项重要的技术，用于自动获取网页数据。本教程将详细介绍如何使用Python编写爬虫来连续爬取新浪微博用户的数据，例如胡歌、迪丽热巴、郭碧婷等明星的信息，并将这些数据存储到文件或数据库中。我们需要引入必要的Python库。`requests`库用于发送HTTP请求，`BeautifulSoup`库用于解析HTML文档，如果要保存到数据库，可能还需要`sqlite3`或`pymysql`等数据库操作库。 1. **设置微博API和访问权限**：新浪提供了一套API接口，但需要申请开发者账号以获取API密钥。这些密钥包括App Key、App Secret、Access Token等，用于验证请求的合法性。 2. **请求用户信息**：使用`requests`库向微博API发送GET请求，获取特定用户的公开信息。这通常包括用户名、粉丝数、关注数、微博数等。例如： ```python url = "https://api.weibo.com/2/users/show.json?access_token=YOUR_ACCESS_TOKEN&uid=USER_ID" response = requests.get(url) user_info = response.json() ``` 3. **解析JSON数据**：返回的响应通常是JSON格式，可以使用内置的`json`库进行解析。解析后的数据是Python字典类型，可以直接访问其键值。 4. **爬取微博内容**：获取用户的所有微博，需要通过分页请求API。每页的微博数量有限，通常需要循环请求。微博内容包括文字、图片、视频等，这些信息也需要解析并提取。 5. **解析HTML内容**：如果微博包含HTML内容（如图片链接、视频链接），可以利用`BeautifulSoup`来解析。例如： ```python soup = BeautifulSoup(html_content, 'html.parser') images = soup.find_all('img') for img in images: image_url = img['src'] ``` 6. **数据存储**：收集到的数据可以写入文件，如CSV或JSON格式，也可以存入数据库。对于CSV，可以使用`csv`库；对于JSON，直接调用`json.dump()`即可。如果选择数据库，先建立相应的表结构，然后使用SQL语句插入数据。 7. **处理多个用户**：为了爬取多个用户的信息，你可以创建一个用户ID列表，然后对每个ID执行上述步骤。记得控制请求频率，避免被微博封禁。 8. **异常处理与错误恢复**：网络请求可能会失败，解析HTML可能出现异常。因此，需要添加异常处理代码，确保程序在遇到问题时能够继续运行或优雅退出。 9. **优化与扩展**：为了提高效率，可以使用多线程或异步IO。还可以增加缓存机制，减少重复请求。如果需要更高级的功能，如动态加载内容的抓取，可能需要使用Selenium等工具。 10. **合规性与道德考虑**：在爬取和使用数据时，一定要遵守相关法律法规和网站的使用条款，尊重用户的隐私权，不进行非法活动。通过以上步骤，我们可以构建一个完整的微博用户信息爬虫。这个过程涉及了HTTP请求、JSON解析、HTML解析、数据存储等多个Python编程基础概念，同时也是Python爬虫实战中的典型应用。在实际项目中，可以根据需求进一步定制和优化。

好的，我可以为您提供相关的代码。请先确认您已经安装好了以下库：requests、beautifulsoup4、openpyxl。接下来是代码实现： ```python import requests from bs4 import BeautifulSoup from openpyxl import Workbook # 登录微博并获取Cookie def get_cookie(username, password): session = requests.session() login_url = 'https://passport.weibo.cn/signin/login' post_url = 'https://passport.weibo.cn/sso/login' session.headers.update({ 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'}) login_page = session.get(login_url) soup = BeautifulSoup(login_page.text, 'html.parser') vk = soup.find('input', {'name': 'vk'})['value'] data = { 'username': username, 'password': password, 'savestate': '1', 'r': '', 'ec': '0', 'pagerefer': '', 'entry': 'mweibo', 'wentry': '', 'loginfrom': '', 'client_id': '', 'code': '', 'qq': '', 'mainpageflag': '1', 'hff': '', 'hfp': '', 'vt': '', 'm': '', 'mainpagewei': '', 'authurl': '', 'u': '', 'vt3': '', 'prelt': '', 'returntype': '', 'domain': '', 'alt': '', 'psp': '', 'sr': '', 's': '', 'vm': '', 'nonce': '', 'su': '', 'service': '', 'servertime': '', 'noncestr': '', 'rsakv': '', 'sp': '', 'sr': '1920*1080', 'encoding': 'UTF-8', 'prelt': '194', 'url': 'https://passport.weibo.cn/signin/welcome?entry=mweibo&r=https%3A%2F%2Fm.weibo.cn%2F' } post_data = { 'username': username, 'password': password, 'savestate': '1', 'ec': '0', 'pagerefer': '', 'entry': 'mweibo', 'wentry': '', 'loginfrom': '', 'client_id': '', 'code': '', 'qq': '', 'mainpageflag': '1', 'hff': '', 'hfp': '', 'vt': '', 'm': '', 'mainpagewei': '', 'authurl': '', 'u': '', 'vt3': '', 'sid': '', 'display': '', 'withOfficalFlag': '0', 'response_type': 'code', 'appkey': '', 'state': '', 'redirect_uri': '', 'uid': '', 'scope': '', 'isLoginSina': '', 'from': '', 'client_id': '', 'code': '', 'refresh_token': '', 'checkToken': '', 'verifyToken': '', 'from': '', 'switchLogin': '0', 'action': 'submit', 'withOfficalFlag': '0', 'withOfficalAccount': '', 'lang': '', 'oauth2Callback': '', 'rand': '0', 'csrf_token': '', 'vk': vk, 'password_': '' } session.post(post_url, data=post_data) return session.cookies.get_dict() # 获取微博数据 def get_weibo_data(cookie, keyword): session = requests.session() session.cookies.update(cookie) weibo_url = 'https://m.weibo.cn/api/container/getIndex?type=all&queryVal=' + keyword + '&featurecode=20000320&luicode=10000011&lfid=106003type%3D1&title=' + keyword headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3', 'Accept': 'application/json, text/plain, */*', 'Referer': weibo_url } response = session.get(weibo_url, headers=headers) data = response.json() cards = data['data']['cards'] weibo_data = [] for card in cards: if card['card_type'] == 9: mblog = card['mblog'] weibo_id = mblog['id'] text = mblog['text'] reposts_count = mblog['reposts_count'] comments_count = mblog['comments_count'] attitudes_count = mblog['attitudes_count'] created_at = mblog['created_at'] user = mblog['user'] screen_name = user['screen_name'] verified = user['verified'] followers_count = user['followers_count'] follow_count = user['follow_count'] weibo_data.append([weibo_id, text, reposts_count, comments_count, attitudes_count, created_at, screen_name, verified, followers_count, follow_count]) return weibo_data # 将数据保存到Excel文件 def save_to_excel(weibo_data, keyword): wb = Workbook() sheet = wb.active sheet.title = keyword sheet.append(['微博ID', '微博内容', '转发数', '评论数', '点赞数', '发布时间', '用户昵称', '是否认证', '粉丝数', '关注数']) for data in weibo_data: sheet.append(data) wb.save(keyword + '.xlsx') if __name__ == '__main__': username = 'your_username' password = 'your_password' keyword = 'your_keyword' cookie = get_cookie(username, password) weibo_data = get_weibo_data(cookie, keyword) save_to_excel(weibo_data, keyword) ``` 这个程序需要您输入您的微博账号和密码，以及您想要爬取的关键词。最后程序会在当前目录下生成一个以关键词命名的Excel文件，保存了爬取到的微博数据。请注意：这个程序仅供学习和研究使用，请勿用于其他非法用途。

阅读全文

python爬虫新浪微博并将其保存到excel文件中

相关推荐

使用Python实现新浪微博爬虫技术

Python实现新浪微博数据爬虫及数据存储教程

python抓取新浪微博数据

简易爬虫教程：如何用Python爬取新浪微博数据

使用Python进行新浪微博数据爬取的实用教程

详解用python写网络爬虫-爬取新浪微博评论

新浪微博爬虫

crawlerforSinaweibo_爬虫python_webcrawler_python_weibo_python爬虫_源码

微博数据爬取系统设计：从登录到多进程并行抓取

xhs搜索笔记与评论爬虫项目：结构化数据抓取与存储

Python实现新浪微博数据爬虫及多媒体下载

掌握Python爬虫技巧：新浪微博爬取实例

YOLO算法-数据集数据集-330张图像带标签-椅子-书桌.zip

java毕设项目之ssm蜀都天香酒楼的网站设计与实现+jsp(完整前后端+说明文档+mysql+lw).zip

weixin138社区互助养老+ssm(论文+源码)-kaic.zip

光纤到户及通信基础设施报装申请表.docx

java毕设项目之ssm基于jsp的精品酒销售管理系统+jsp(完整前后端+说明文档+mysql+lw).zip

功能完善的电商数据智能爬虫采集系统项目全套技术资料.zip

YOLO算法-刀数据集-198张图像带标签-刀-枪.zip

最新推荐

python制作爬虫并将抓取结果保存到excel中

Python实现爬虫抓取与读写、追加到excel文件操作示例

python智联招聘爬虫并导入到excel代码实例

Python爬虫进阶之多线程爬取数据并保存到数据库

Python将列表数据写入文件（txt, csv，excel）

Java毕业设计项目：校园二手交易网站开发指南

管理建模和仿真的文件

【MVC标准化：肌电信号处理的终极指南】：提升数据质量的10大关键步骤与工具

能否提供一个在R语言中执行Framingham数据集判别分析的详细和完整的代码示例？

Blaseball Plus插件开发与构建教程