Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱,通过解析文档为用户提供需要抓取的数据,因为简单,所以不需要多少代码就可以写出一个完整的应用程序。
Beautiful Soup自动将输入文档转换为Unicode编码,输出文档转换为utf-8编码。你不需要考虑编码方式,除非文档没有指定一个编码方式,这时,Beautiful Soup就不能自动识别编码方式了。然后,你仅仅需要说明一下原始编码方式就可以了。
Beautiful Soup已成为和lxml、html6lib一样出色的python解释器,为用户灵活地提供不同的解析策略或强劲的速度。
博主使用的是mac,这里面就只介绍在mac下Beautiful Soup的安装方法。python 第三方库安装都很简单,楼主一直都使用pip来安装。
安装pip
easy_install pip
安装Beautiful Soup
pip install beautifulsoup4
有时候我们使用pip install beautifulsoup4 命令来安装会报错,这时候我们需要在命令前加上sudo来获得权限。
sudo pip install beautifulsoup4
到目前为止我们的准备工作就做好了,现在我们可以开始使用Beautiful Soup。本文只使用到了bs4(备注:文章中bs4=beautifulsoup4)部分方法,想要进一步了解bs4的可以查看bs4官方文档,楼主的项目建的很简单index.py和一个html文件夹,里面放有一些.html静态文件
index.py文件
# coding=utf-8import osfrom bs4 import BeautifulSoupimport sys #定义一个list来存放文件路径paths=[]#获取所有的文件路径def get_paths(): for fpathe,dirs,fs in os.walk('html'): for f in fs: #print os.path.join(fpathe,f) #将拼接好的path存放到list中 filepath=os.path.join(fpathe,f) #只放入.html后缀文件路径 if(os.path.splitext(f)[1]==".html"): paths.append(filepath)#读取html文件修改后并写入相应的文件中去def reset_file(path): #判断文件是否存在 if not os.path.isfile(path): raise TypeError(path + " does not exist") #读取文件,bs4自动将输入文档转换为Unicode编码, #
声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。TEL:177 7030 7066 E-MAIL:11247931@qq.com