
qq:800819103
在线客服,实时响应
qq群
在线客服,实时响应
客服电话
13318873961网上每天都有大量的新闻内容出现,如何快速获取这些内容呢?今天黑洞代理IP就为大家分享一下,爬取是如何爬取网易的社会新闻内容的。首先我们可以先打开目标页面,右键检查,查找我们需要的内容。这里我们主要抓取新闻标题、链接和新闻内容。
代码如下:
import re
from urllib import request
from bs4 import BeautifulSoup
def download(title, url):
req = request.urlopen(url)
res = req.read()
soup = BeautifulSoup(res,'lxml')
#print(soup.prettify())
tag = soup.find('div',class_='post_text')
#print(tag.get_text())
title = title.replace(':','')
title = title.replace('"','')
title = title.replace('|','')
title = title.replace('/','')
title = title.replace('\\','')
title = title.replace('*','')
title = title.replace('<',' title="title.replace('">','')
title = title.replace('?','')
#print(title)
file_name = r'E:\code\python\spider_news\sociaty\\' +title + '.txt'
file = open(file_name,'w',encoding = 'utf-8')
file.write(tag.get_text())
if __name__ == '__main__':
urls = ['http://temp.163.com/special/00804KVA/cm_shehui.js?callback=data_callback',
'http://temp.163.com/special/00804KVA/cm_shehui_02.js?callback=data_callback',
'http://temp.163.com/special/00804KVA/cm_shehui_03.js?callback=data_callback']
for url in urls:
#url = 'http://temp.163.com/special/00804KVA/cm_shehui_02.js?callback=data_callback'
req = request.urlopen(url)
res = req.read().decode('gbk')
#print(res)
pat1 = r'"title":"(.*?)",'
pat2 = r'"tlink":"(.*?)",'
m1 = re.findall(pat1,res)
news_title = []
for i in m1:
news_title.append(i)
m2 = re.findall(pat2,res)
news_url = []
for j in m2:
news_url.append(j)
for i in range(0,len(news_url)):
#print(news_title[i],news_body[i])
download(news_title[i],news_url[i])
print('正在爬取第' + str(i) + '个新闻',news_title[i])
通过上述代码,我们就可以获取到网易社会新闻的相关内容了。黑洞代理IP为您提供安全稳定、高效便捷的爬虫代理IP服务,更多问题请点击官网咨询客服。
相关文章内容简介
1 动态IP如何帮助爬虫爬取网易社会新闻内容
网上每天都有大量的新闻内容出现,如何快速获取这些内容呢?今天黑洞代理IP就为大家分享一下,爬取是如何爬取网易的社会新闻内容的。首先我们可以先打开目标页面,右键检查,查找我们需要的内容。这里我们主要抓取新闻标题、链接和新闻内容。 代码如下: import∵re from∵urllib∵import∵request from∵bs4∵import∵BeautifulSoup def∵download... [阅读全文]
最新标签
推荐阅读
07
2019-05
IP代理速度快吗?
代理服务器 价格显然,负担得起是一个主要问题。代理服务器拥有一个年度或月度的收费系统,价格基于您愿意投入的时间长度。然而,廉价的服务并不一定,两者都支付高额费用并不能保证
15
2019-05
换IP软件能获得大量网络资源
众所周知,每台电脑都是有ip地址的,作为网络上一种身份证的象征,有了ip地址才能去访问网络或者局域网。然而,正因为如此,有些限制使得使用者并不能访问一些网站,比如说谷歌、推
17
2019-08
代理IP的常见使用方法
不同的软件有不同的使用方法,如果是同类型的商品,也会有很多相似之处。国内代理IP一般有三种方法,下面就为大家进行详细的介绍。
18
2019-04
http代理是如何爬取数据的?
Web 代理是一种存在于网络中间的实体,提供各式各样的功能。现代网络系统中,Web 代理无处不在。我之前有关 HTTP 的博文中,多次提到了代理对 HTTP 请求及响应的影响。今天这篇文章,我打算
热门文章