爬虫小工具合集 | 不会编程也能爬数据

现阶段的主流爬虫手段是用Python编制程序,Python的强大毋庸置疑,但初学者学习Python仍旧需求一多个月时间的。有没有一些更简短的爬取数据格局吧?答案是局部,DataCastle为您准备了如下小工具,对于种种小工具你只要求花十几分钟时间,跟着作者的步骤走2次就能够控制它啦~

一、Microsoft Excel

首先教我们3个用Excel爬取多少的方法,那里用的Microsoft Excel
2011版本,上面手把手起先教学~

(1)新建Excel,打开它,如下图所示

(2)点击“数据”——“自网站”

(3)在弹出的对话框中输入目的网址,那里以全国实时间和空间气质量网站为例,点击转到,再导入

挑选导入地点,分明

(4)结果如下图所示,怎么着,是或不是十分的赞?

(5)假设要实时更新数据,能够在“数据”——“全体制改良进”——“连接属性”中展开设置,输入更新频率即可

二、Google Sheet

选择GoogleSheet爬取多少前,要力保三点:使用Chrome浏览器、拥有谷歌(Google)账号、电脑已翻墙。如若那四个规范具备了的话,上面大家就起来吧~

(1)打开Google
Sheet
网站:

(2)在首页上点击“转到谷歌(Google)表格”,然后登录本身的账号,能够观察如下界面,再点击“+”成立新的表格

新建的表格如下:

(3)打开要爬取的靶子网站,二个全国实时间和空间气质量网站
,目的网站上的报表结构如下图所示

(4)回到谷歌 sheet页面,使用函数=IMPOPAJEROTHTML(网址, 查询,
索引),“网址”就是要爬取数据的靶子网站,“查询”中输入“list”或“table”,这些取决于数量的实际协会类型,“索引”填阿拉伯数字,从1始发,对应着网站中定义的哪一份报表或列表

对此大家要爬取的网站,大家在Googlesheet的A1单元格中输入函数=IMPOHavalTHTML(“http://www.pm25.in/rank“,”table”,1),回车后就爬得多少啦

(5)将爬取好的表格存到本地

是还是不是感到超级简单?

三、you-get

那是三个程序员基于python
3开发的种类,已经在github上边开源,协理61个网站,包涵优酷、土豆、爱奇艺、b站、酷狗音乐、虾米……不问可见你能想到的网站都有!
还有多少个黑科技(science and technology)的地点,尽管是名单上未曾的网站,当您输入链接,程序也会疑忌你想要下载什么,然后帮您下载。当然you-get要在python3条件下举办安装,用pip安装好后,在顶峰输入“you
get+你想下载财富的链接”就能够等着收藏财富了。

那里给二个you-get的华语使用验证,依据表达上写的按步骤操作就足以啦。

未完待续……以往DataCastle还会继续补充部分简练好用的爬虫小工具的,记得援助一下呀~

相关文章