Python爬虫----Beautiful Soup4 基础

1. Beautiful Soup简介

简单来说，Beautiful Soup是python的一个库，最主要的功能是从网页抓取数据。官方解释如下：

Beautiful Soup提供一些简单的、python式的函数用来处理导航、搜索、修改分析树等功能。它是一个工具箱，通过解析文档为用户提供需要抓取的数据，因为简单，所以不需要多少代码就可以写出一个完整的应用程序。

Beautiful Soup自动将输入文档转换为Unicode编码，输出文档转换为utf-8编码。你不需要考虑编码方式，除非文档没有指定一个编码方式，这时，Beautiful Soup就不能自动识别编码方式了。然后，你仅仅需要说明一下原始编码方式就可以了。

Beautiful Soup已成为和lxml、html6lib一样出色的python解释器，为用户灵活地提供不同的解析策略或强劲的速度。

2. Beautiful Soup安装

可以利用 pip 或者 easy_install 来安装

easy_install beautifulsoup4 pip install beautifulsoup4

3. 开启Beautiful Soup 之旅

官方文档

4. Beautiful Soup笔记

Python爬虫----Beautiful Soup4 基础

注：

bs=BeautifulSop(html,'html.parser') //Beautiful Soup支持Python标准库中的HTML解析器

title1是list //列表

title2是bs4.element.Tag //元素标签

5. Beautiful Soup实战爬虫

 #coding:utf-8

 from bs4 import BeautifulSoup

 import requests

 html = requests.get('https://news.jin10.com/')

 html.encoding='utf-8' #设定编码

 html=html.text

 def title(url):

     bs= BeautifulSoup(url,'html.parser')

     title=bs.select('.jin-slider_title')

     for titles in title:

         print titles.text

         print "\n"

 title(html)

Python爬虫----Beautiful Soup4 基础

秒客网

Python爬虫----Beautiful Soup4 基础

1. Beautiful Soup简介

2. Beautiful Soup安装

3. 开启Beautiful Soup 之旅

4. Beautiful Soup笔记

5. Beautiful Soup实战爬虫

相关文章