![](/index/img/qc-side/indexLogo4.png)
qq:800819103
在线客服,实时响应![](/index/img/qc-side/indexLogo5.png)
qq群
在线客服,实时响应![](/index/img/qc-side/indexLogo6.png)
客服电话
13318873961网上每天都有大量的新闻内容出现,如何快速获取这些内容呢?今天黑洞代理IP就为大家分享一下,爬取是如何爬取网易的社会新闻内容的。首先我们可以先打开目标页面,右键检查,查找我们需要的内容。这里我们主要抓取新闻标题、链接和新闻内容。
代码如下:
import re
from urllib import request
from bs4 import BeautifulSoup
def download(title, url):
req = request.urlopen(url)
res = req.read()
soup = BeautifulSoup(res,'lxml')
#print(soup.prettify())
tag = soup.find('div',class_='post_text')
#print(tag.get_text())
title = title.replace(':','')
title = title.replace('"','')
title = title.replace('|','')
title = title.replace('/','')
title = title.replace('\\','')
title = title.replace('*','')
title = title.replace('<',' title="title.replace('">','')
title = title.replace('?','')
#print(title)
file_name = r'E:\code\python\spider_news\sociaty\\' +title + '.txt'
file = open(file_name,'w',encoding = 'utf-8')
file.write(tag.get_text())
if __name__ == '__main__':
urls = ['http://temp.163.com/special/00804KVA/cm_shehui.js?callback=data_callback',
'http://temp.163.com/special/00804KVA/cm_shehui_02.js?callback=data_callback',
'http://temp.163.com/special/00804KVA/cm_shehui_03.js?callback=data_callback']
for url in urls:
#url = 'http://temp.163.com/special/00804KVA/cm_shehui_02.js?callback=data_callback'
req = request.urlopen(url)
res = req.read().decode('gbk')
#print(res)
pat1 = r'"title":"(.*?)",'
pat2 = r'"tlink":"(.*?)",'
m1 = re.findall(pat1,res)
news_title = []
for i in m1:
news_title.append(i)
m2 = re.findall(pat2,res)
news_url = []
for j in m2:
news_url.append(j)
for i in range(0,len(news_url)):
#print(news_title[i],news_body[i])
download(news_title[i],news_url[i])
print('正在爬取第' + str(i) + '个新闻',news_title[i])
通过上述代码,我们就可以获取到网易社会新闻的相关内容了。黑洞代理IP为您提供安全稳定、高效便捷的爬虫代理IP服务,更多问题请点击官网咨询客服。
相关文章内容简介
1 动态IP如何帮助爬虫爬取网易社会新闻内容
网上每天都有大量的新闻内容出现,如何快速获取这些内容呢?今天黑洞代理IP就为大家分享一下,爬取是如何爬取网易的社会新闻内容的。首先我们可以先打开目标页面,右键检查,查找我们需要的内容。这里我们主要抓取新闻标题、链接和新闻内容。 代码如下: import∵re from∵urllib∵import∵request from∵bs4∵import∵BeautifulSoup def∵download... [阅读全文]
最新标签
推荐阅读
22
2019-02
自动换IP软件可以刷数据吗?
对于数据造假,大家都有一定的了解,比如刷阅读量,刷排名,刷单,刷好评,买粉,买流量等等,以前使用人工,现在随着技术的发展,这造假的成本更低了,还可以自己刷了,那么自动换IP
07
2019-05
代理IP如何实现改变你的IP地址的?
这是正确的,有一个身份盗窃事件的现象,以及每个人在上网时应该留意的其他条件。采取必要的预防措施,并建议在线冲浪者在付款时更加不可靠。因此,如果您决定保持较高的学位,我们现
22
2019-04
动态IP如何帮助爬虫爬取网易社会新闻内容
网上每天都有大量的新闻内容出现,如何快速获取这些内容呢?今天黑洞代理IP就为大家分享一下,爬取是如何爬取网易的社会新闻内容的。首先我们可以先打开目标页面,右键检查,查找我们需
30
2019-05
代理IP稳定吗?
随着网路的迅速发展,IP代理行业也迅速发展起来,用户们可以随时随地的使用代理IP。然而由于市场的巨大和开放,代理IP行业可以说是鱼龙混杂,所以选择代理IP的时候就需要多方面考虑,而
热门文章