说明
1、定义数据模块类,名为DataLoader。
2、类中有核心变量data用于保存爬行数据,以及两个相关界面grab_data(爬取数据)和save_data(保存数据到当地)。
实例
grab_data() 的核心代码
defgrab_data(self): #获取入口链接 entries=self.get_entry() #遍历入口链接,解析得到文章链接 links=self.parse4links(entries) #遍历文章链接,解析得到文章内容 datas=self.parse4datas(links) #将相关数据写入变量data self.data=pd.DataFrame(datas)
save_data() 的核心代码
defsave_data(self): #将变量data写入csv文件 self.data.to_csv(self.data_path,index=None)
我们已经爬取并保存好数据 data,数据以 DataFrame 形式存储,保存在 csv 文件,格式如下:
|---------------------------------------------------| |id|link|cont|title| |---------------------------------------------------| |pageid|pagelink|pagecontent|pagetitle| |---------------------------------------------------| |......|......|......|......| |---------------------------------------------------|
以上就是python数据模块类定义的方法,希望对大家有所帮助。更多Python学习指路:Python基础教程
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。
评论(0)