b2c信息网

您现在的位置是:首页 > 前天新闻 > 正文

前天新闻

安卓app仿糗事百科源码(糗事百科安卓11)

hacker2022-06-09 02:52:27前天新闻82
本文目录一览:1、python3.4+requests+re仿写糗事百科爬虫,遇到一个疑惑,求助

本文目录一览:

python3.4 + requests + re 仿写糗事百科爬虫,遇到一个疑惑,求助

网上的Python教程大都是2.X版本的,python2.X和python3.X相比较改动比较大,好多库的用法不太一样,我安装的是3.4.1,就用3.4.1实现一下网页内容抓取

首先是库,2.7版本的urllib2库已经没有了,我导入的是:

import urllib.request

import re

首先是取得url,直接打开糗事百科直接复制网址

url='http//'

然后设置headers,伪装成浏览器进行访问,有的网站会有屏蔽措施,设置过headers可以绕过屏蔽

user_agent='Mozilla/4.0 (compatible; MSIE 5.5; Windows NT)'

headers={'User-Agent':user_agent}

然后进行请求,这里3.4和2.7有点不一样,注意用法

request=urllib.request.Request(url=url,headers=headers)

然后获取响应结果,注意用法

response=urllib.request.urlopen(request)

此时就抓去了整个网页源代码,可以打印一下看看

content=response.read().decode('utf-8')

print(content)

如何抓取想要的内容呢?这里需要正则表达式去匹配

先看看部分源码的内容,如下:

div class="ea55-69c3-7a76-6add article block untagged mb15" id='qiushi_tag_115326209'div class="69c3-7a76-6add-b312 author clearfix"a href="/users/6689931" target="_blank" rel="nofollow"img src="" alt="狼牙蝎子尾"//aa href="/users/6689931" target="_blank" title="狼牙蝎子尾"h2狼牙蝎子尾/h2/a/divdiv class="7a76-6add-b312-f6d5 content"“懒惰是可以战胜饥饿的 ”br/br/“但却输给了尿”!--1456774385--/divdiv class="6add-b312-f6d5-eae5 thumb"a href="/article/115326209" target="_blank"img src="" alt="懒惰是可以战胜饥饿的 " //a/divdiv class="b312-f6d5-eae5-3d34 stats"span class="f6d5-eae5-3d34-4451 stats-vote"i class="eae5-3d34-4451-355d number"1702/i 好笑/spanspan class="3d34-4451-355d-ae2a stats-comments"span class="4451-355d-ae2a-fd6a dash" · /spana href="/article/115326209" data-share="/article/115326209" id="c-115326209" class="355d-ae2a-fd6a-7753 qiushi_comments" target="_blank"i class="ae2a-fd6a-7753-ec16 number"26/i 评论

这是一条内容,可以看出,从div ....author...开始到/i结束

然后就写正则匹配

pattern=re.compile('div.*?author clearfix".*?h2(.*?)/h2.*?div.*?content"(.*?)!--.*?--.*?img src="(.*?)" alt=.*?.*?/i')

再然后就可以获取内容了

items=re.findall(pattern,str(content))

由于控制台不能输出图片,就把带图片的过滤掉吧

for item in items:

haveImg=re.search('img',item[2])

if not haveImg:

print(item[0]),print(item[1])

然后运行即可

附上源码图片以及运行结果:

代码估计大家都能看懂,正则表达式可能新手不太理解

我稍微说一下

.*?代表一个固定搭配,指尽可能短的匹配

(.*?)代表一个分组,是我们抓取的内容

re.S说明可以匹配到换行,如果没有re.S就啥也取不到

这个代码是初稿,比较粗糙,有兴趣的可以把它改造成面向对象的模式

求网站源码,仿糗事百科网站源码+数据库(php+mysql)

上面的几条回答都很有道理,只能说给你尽量实现。互联网的宗旨是分享没错,但是付出了脑力,免费是相对的!

求糗事百科android客户端端源码

你可以下载一个apk,反编译,就可以得到部分源码。你可以试试。

求仿糗事百科的PHP网站源码,QQ:1217061614,采用一定追加悬赏!

PM联系我,免费赠送最新版~~~~ 但说一下,YICMS是拼凑的烂程序,漏洞百出,你要敢用就行

发表评论

评论列表

  • 俗野释欢(2022-06-09 14:41:10)回复取消回复

    本文目录一览:1、python3.4 + requests + re 仿写糗事百科爬虫,遇到一个疑惑,求助2、求网站源码,仿糗事百科网站源码+数据库(php+mysql)3、求糗事百科android客户端端源码4、求仿糗事

  • 泪灼邶谌(2022-06-09 13:16:23)回复取消回复

    就写正则匹配pattern=re.compile('div.*?author clearfix".*?h2(.*?)/h2.*?div.*?content"(.*?)!--

  • 怎忘双笙(2022-06-09 12:20:10)回复取消回复

    k,反编译,就可以得到部分源码。你可以试试。求仿糗事百科的PHP网站源码,QQ:1217061614,采用一定追加悬赏!PM联系我,免费赠送最新版~~~~ 但说一下,YICMS是拼凑的烂程序,漏洞百出,你要敢用就行