av一区二区在线观看_亚洲男人的天堂网站_日韩亚洲视频_在线成人免费_欧美日韩精品免费观看视频_久草视

您的位置:首頁(yè)技術(shù)文章
文章詳情頁(yè)

python和php哪個(gè)更適合寫(xiě)爬蟲(chóng)

瀏覽:3日期:2022-07-20 09:06:44

python和PHP相比較,python適合做爬蟲(chóng)。原因如下

抓取網(wǎng)頁(yè)本身的接口

相比與其他靜態(tài)編程語(yǔ)言,如java,c#,C++,python抓取網(wǎng)頁(yè)文檔的接口更簡(jiǎn)潔;相比其他動(dòng)態(tài)腳本語(yǔ)言,如perl,shell,python的urllib2包提供了較為完整的訪問(wèn)網(wǎng)頁(yè)文檔的API。(當(dāng)然ruby也是很好的選擇)

此外,抓取網(wǎng)頁(yè)有時(shí)候需要模擬瀏覽器的行為,很多網(wǎng)站對(duì)于生硬的爬蟲(chóng)抓取都是封殺的。這是我們需要模擬user agent的行為構(gòu)造合適的請(qǐng)求,譬如模擬用戶登陸、模擬session/cookie的存儲(chǔ)和設(shè)置。在python里都有非常優(yōu)秀的第三方包幫你搞定,如Requests,mechanize

網(wǎng)頁(yè)抓取后的處理

抓取的網(wǎng)頁(yè)通常需要處理,比如過(guò)濾html標(biāo)簽,提取文本等。python的beautifulsoap提供了簡(jiǎn)潔的文檔處理功能,能用極短的代碼完成大部分文檔的處理。

其實(shí)以上功能很多語(yǔ)言和工具都能做,但是用python能夠干得最快,最干凈。Life is short, u need python.

py用在linux上很強(qiáng)大,語(yǔ)言挺簡(jiǎn)單的。

NO.1 快速開(kāi)發(fā)(唯一能和python比開(kāi)發(fā)效率的語(yǔ)言只有rudy)語(yǔ)言簡(jiǎn)潔,沒(méi)那么多技巧,所以讀起來(lái)很清楚容易。

NO.2跨平臺(tái)(由于python的開(kāi)源,他比java更能體現(xiàn)”一次編寫(xiě)到處運(yùn)行”

NO.3解釋性( 無(wú)須編譯,直接運(yùn)行/調(diào)試代碼)

NO.4構(gòu)架選擇太多(GUI構(gòu)架方面 主要的就有 wxPython, tkInter, PyGtk, PyQt 。

PHP 腳本主要用于以下三個(gè)領(lǐng)域:

服務(wù)端腳本。這是 PHP 最傳統(tǒng),也是最主要的目標(biāo)領(lǐng)域。開(kāi)展這項(xiàng)工作需要具備以下三點(diǎn):PHP 解析器(CGI 或者服務(wù)器模塊)、web

服務(wù)器和 web 瀏覽器。需要在運(yùn)行 web 服務(wù)器時(shí),安裝并配置 PHP,然后,可以用 web 瀏覽器來(lái)訪問(wèn) PHP 程序的輸出,即瀏覽服務(wù)

端的 PHP 頁(yè)面。如果只是實(shí)驗(yàn) PHP 編程,所有的這些都可以運(yùn)行在自己家里的電腦中。請(qǐng)查閱安裝一章以獲取更多信息。命令行腳本。

可以編寫(xiě)一段 PHP 腳本,并且不需要任何服務(wù)器或者瀏覽器來(lái)運(yùn)行它。通過(guò)這種方式,僅僅只需要 PHP 解析器來(lái)執(zhí)行。這種用法對(duì)于依

賴 cron(Unix 或者 Linux 環(huán)境)或者 Task Scheduler(Windows 環(huán)境)的日常運(yùn)行的腳本來(lái)說(shuō)是理想的選擇。這些腳本也可以用來(lái)處

理簡(jiǎn)單的文本。請(qǐng)參閱 PHP 的命令行模式以獲取更多信息。編寫(xiě)桌面應(yīng)用程序。對(duì)于有著圖形界面的桌面應(yīng)用程序來(lái)說(shuō),PHP 或許不是

一種最好的語(yǔ)言,但是如果用戶非常精通 PHP,并且希望在客戶端應(yīng)用程序中使用 PHP 的一些高級(jí)特性,可以利用 PHP-GTK 來(lái)編寫(xiě)這

些程序。用這種方法,還可以編寫(xiě)跨平臺(tái)的應(yīng)用程序。PHP-GTK 是 PHP 的一個(gè)擴(kuò)展,在通常發(fā)布的 PHP 包中并不包含它。

網(wǎng)友觀點(diǎn)擴(kuò)展:

我用 PHP Node.js Python 寫(xiě)過(guò)抓取腳本,簡(jiǎn)單談一下吧。

首先PHP。先說(shuō)優(yōu)勢(shì):網(wǎng)上抓取和解析html的框架一抓一大把,各種工具直接拿來(lái)用就行了,比較省心。缺點(diǎn):首先速度/效率很成問(wèn)題,有一次下載電影海報(bào)的時(shí)候,由于是crontab定期執(zhí)行,也沒(méi)做優(yōu)化,開(kāi)的php進(jìn)程太多,直接把內(nèi)存撐爆了。然后語(yǔ)法方面也很拖沓,各種關(guān)鍵字 符號(hào) 太多,不夠簡(jiǎn)潔,給人一種沒(méi)有認(rèn)真設(shè)計(jì)過(guò)的感覺(jué),寫(xiě)起來(lái)很麻煩。

Node.js。優(yōu)點(diǎn)是效率、效率還是效率,由于網(wǎng)絡(luò)是異步的,所以基本如同幾百個(gè)進(jìn)程并發(fā)一樣強(qiáng)大,內(nèi)存和CPU占用非常小,如果沒(méi)有對(duì)抓取來(lái)的數(shù)據(jù)進(jìn)行復(fù)雜的運(yùn)算加工,那么系統(tǒng)的瓶頸基本就在帶寬和寫(xiě)入MySQL等數(shù)據(jù)庫(kù)的I/O速度。當(dāng)然,優(yōu)點(diǎn)的反面也是缺點(diǎn),異步網(wǎng)絡(luò)代表你需要callback,這時(shí)候如果業(yè)務(wù)需求是線性了,比如必須等待上一個(gè)頁(yè)面抓取完成后,拿到數(shù)據(jù),才能進(jìn)行下一個(gè)頁(yè)面的抓取,甚至多層的依賴關(guān)系,那就會(huì)出現(xiàn)可怕的多層callback!基本這時(shí)候,代碼結(jié)構(gòu)和邏輯就會(huì)一團(tuán)亂麻。當(dāng)然可以用Step等流程控制工具解決這些問(wèn)題。

最后說(shuō)Python。如果你對(duì)效率沒(méi)有極端的要求,那么推薦用Python!首先,Python的語(yǔ)法很簡(jiǎn)潔,同樣的語(yǔ)句,可以少敲很多次鍵盤(pán)。然后,Python非常適合做數(shù)據(jù)的處理,比如函數(shù)參數(shù)的打包解包,列表解析,矩陣處理,非常方便。

到此這篇關(guān)于python和php哪個(gè)更適合寫(xiě)爬蟲(chóng)的文章就介紹到這了,更多相關(guān)php和python哪個(gè)適合做爬蟲(chóng)內(nèi)容請(qǐng)搜索好吧啦網(wǎng)以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持好吧啦網(wǎng)!

標(biāo)簽: Python 編程
相關(guān)文章:
主站蜘蛛池模板: 国产精品久久精品 | www国产亚洲精品 | 黄色毛片在线播放 | www97影院| 国产a爽一区二区久久久 | 免费黄色在线观看 | 中文字幕免费 | 国产小视频在线 | 国产免费一区二区三区网站免费 | 日本三级电影在线免费观看 | 久久久精彩视频 | 91.com视频| 香蕉久久久 | 91免费观看国产 | 激情欧美一区二区三区 | 特级黄色毛片 | 久久久精品视频免费看 | 日韩精品成人 | 精品在线播放 | 在线色网 | 亚洲精品www| 国产一区二区在线视频 | 欧美日韩免费在线 | 91新视频| 国产一区在线视频 | 亚洲一区精品视频 | 国产精品一级在线观看 | 成人蜜桃av | www.日本三级| 玖玖视频免费 | 日本超碰 | 久久精品国产亚洲一区二区三区 | 国产精品一区二区久久久久 | 久久久无码精品亚洲日韩按摩 | 中文字幕一区二区三区四区五区 | 中文av网站 | 久久精品久久综合 | 亚洲一区二区三区在线视频 | 国产免费福利在线 | 国产一级一级毛片 | 久在线视频播放免费视频 |