文章詳情頁

python - Scrapy ItemLoader數據清洗疑問

瀏覽：140日期：2022-06-30 08:28:51

問題描述

在使用scrapy抓取數據時，利用itemloader這個類，使用selector取出的值為空時，進入scrapy.Field()里調用filter()，selector取值不為空的確返回'有值'，如果selector取出[]或'',那么value進入filter()之后，并不會返回'無值'

def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了，熟悉的應該能看的懂 scrapy.Field(filter())

有什么辦法將抓取為空的值，經過filyer()之后變成'無值'

問題解答

回答1：

謝邀~不太了解Scrapy，所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是：1.先是根據正則和一些循環，把要收集的頁面放到隊列里，按類別分類，例如分頁的列表頁一個隊列，列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據，爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據，按照自己所需的標準保存數據。

大體就是這樣，我絕對大部分爬蟲框架也大概都是這種思路吧，無非是在此基礎上增加了，反爬機制，多線程，多進程，增量爬取等等功能。所以，題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。

Python 編程

上一條：python - 面對一串含有亂碼的字符串，如何取下需要的信息下一條：python - 編碼問題求助

相關文章：

1. python 利用subprocess庫調用mplayer時發生錯誤2. python文檔怎么查看？3. html - eclipse 標簽錯誤4. python - pycharm 自動刪除行尾空格5. 安全性測試 - nodejs中如何防mySQL注入6. 請問PHPstudy中的數據庫如何創建索引7. python - Pycharm的Debug用不了8. javascript - 關于apply（）與call（）的問題9. javascript - nginx反向代理靜態資源403錯誤?10. datetime - Python如何獲取當前時間

排行榜

					
					python - pycharm 自動刪除行尾空格
python 利用subprocess庫調用mplayer時發生錯誤
java - spring boot 如何打包成asp.net core 那種獨立應用?
docker - 各位電腦上有多少個容器啊？容器一多，自己都搞混了，咋辦呢？
docker start -a dockername 老是卡住，什么情況？
docker網絡端口映射，沒有方便點的操作方法么？
docker綁定了nginx端口 外部訪問不到
angular.js - angular.ui：dropdown的下拉菜單關閉的偶爾失常問題
javascript - nginx反向代理靜態資源403錯誤?
html - eclipse 標簽錯誤
請問PHPstudy中的數據庫如何創建索引
				

熱門標簽

av一区二区在线观看_亚洲男人的天堂网站_日韩亚洲视频_在线成人免费_欧美日韩精品免费观看视频_久草视

python - Scrapy ItemLoader數據清洗疑問