用python从交大新闻网主页新闻栏目(http://news.xjtu.edu.cn/zyxw.htm)爬取最新的100 条新闻内容的代码,并保存在news.txt文件中

时间: 2024-02-26 11:53:30 浏览: 46
好的,可以用python的requests和BeautifulSoup库来实现这个爬虫任务。下面是代码实现: ```python import requests from bs4 import BeautifulSoup # 设置请求头 headers = { 'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.3'} # 发送请求 url = 'http://news.xjtu.edu.cn/zyxw.htm' response = requests.get(url, headers=headers) # 解析HTML soup = BeautifulSoup(response.content, 'html.parser') news_list = soup.find_all('div', class_='newslist')[0].find_all('li') # 获取最新的100条新闻 news_content = [] for news in news_list[:100]: news_url = news.find('a')['href'] news_title = news.find('a').text.strip() news_time = news.find('span').text.strip() news_response = requests.get(news_url, headers=headers) news_soup = BeautifulSoup(news_response.content, 'html.parser') news_content.append({'title': news_title, 'time': news_time, 'content': news_soup.find('div', class_='wp_articlecontent').text.strip()}) # 保存到文件 with open('news.txt', 'w', encoding='utf-8') as f: for news in news_content: f.write(f"{news['title']}\n{news['time']}\n{news['content']}\n\n") ``` 这个代码会首先发送请求获取新闻网页的HTML,然后用BeautifulSoup库解析HTML,找到新闻列表的每个新闻的标题、发布时间和链接,再分别请求每个新闻的链接来获取新闻的内容。最后将每个新闻的标题、发布时间和内容保存到news.txt文件中。

相关推荐

最新推荐

recommend-type

STC算法及代码文档说明

本文提出一种结合时空上下文的简单快速鲁棒的跟踪算法。算法对目标和目标周围时空关系利用贝叶斯框架建模,也就是对目标和目标周围的低层次特征的统计相关性进行建模。跟踪问题变成计算置信图,根据目标位置相似函数...
recommend-type

Intel Fortran IAPWS-IF97水物性Fortran源程序

本文给出了基于IAPWS-IF97的水物性计算Fortran90语言程序代码,适用Compaq visual fortran和Intel Fortran 编译环境。目前网上大量水物性包在Intel ...本版本基于网上版本修改,使用者若涉及版权问题,本人概不负责。
recommend-type

新建文本文档.txt

新建文本文档
recommend-type

开源Git gui工具Fork

开源Git gui工具Fork,CSDN能找到教程,但是资料不多,推荐用Tortoise
recommend-type

yolov5在华为昇腾atlas上加速推理

该资源为yolov5在华为昇腾atlas上使用Ascend310芯片加速推理,属于c++后端开发,适合C++开发者在华为昇腾盒子上移植深度学习算法的博主们。 资源是demo形式,包含完整的一套代码,还有转好的离线模型文件和跑出的测试结果图片。
recommend-type

zigbee-cluster-library-specification

最新的zigbee-cluster-library-specification说明文档。
recommend-type

管理建模和仿真的文件

管理Boualem Benatallah引用此版本:布阿利姆·贝纳塔拉。管理建模和仿真。约瑟夫-傅立叶大学-格勒诺布尔第一大学,1996年。法语。NNT:电话:00345357HAL ID:电话:00345357https://theses.hal.science/tel-003453572008年12月9日提交HAL是一个多学科的开放存取档案馆,用于存放和传播科学研究论文,无论它们是否被公开。论文可以来自法国或国外的教学和研究机构,也可以来自公共或私人研究中心。L’archive ouverte pluridisciplinaire
recommend-type

MATLAB柱状图在信号处理中的应用:可视化信号特征和频谱分析

![matlab画柱状图](https://img-blog.csdnimg.cn/3f32348f1c9c4481a6f5931993732f97.png) # 1. MATLAB柱状图概述** MATLAB柱状图是一种图形化工具,用于可视化数据中不同类别或组的分布情况。它通过绘制垂直条形来表示每个类别或组中的数据值。柱状图在信号处理中广泛用于可视化信号特征和进行频谱分析。 柱状图的优点在于其简单易懂,能够直观地展示数据分布。在信号处理中,柱状图可以帮助工程师识别信号中的模式、趋势和异常情况,从而为信号分析和处理提供有价值的见解。 # 2. 柱状图在信号处理中的应用 柱状图在信号处理
recommend-type

HSV转为RGB的计算公式

HSV (Hue, Saturation, Value) 和 RGB (Red, Green, Blue) 是两种表示颜色的方式。下面是将 HSV 转换为 RGB 的计算公式: 1. 将 HSV 中的 S 和 V 值除以 100,得到范围在 0~1 之间的值。 2. 计算色相 H 在 RGB 中的值。如果 H 的范围在 0~60 或者 300~360 之间,则 R = V,G = (H/60)×V,B = 0。如果 H 的范围在 60~120 之间,则 R = ((120-H)/60)×V,G = V,B = 0。如果 H 的范围在 120~180 之间,则 R = 0,G = V,B =
recommend-type

JSBSim Reference Manual

JSBSim参考手册,其中包含JSBSim简介,JSBSim配置文件xml的编写语法,编程手册以及一些应用实例等。其中有部分内容还没有写完,估计有生之年很难看到完整版了,但是内容还是很有参考价值的。