您现在的位置是：亿华云 > 系统运维

用Python爬取天气并且语言播报

亿华云2025-10-09 12:59:51【系统运维】9人已围观

简介一、预备知识此案例实现功能：利用网络爬虫，爬取某地的天气，并打印和语音播报。要用到requests库，lxml库，pyttsx3库，没有的，可以先安装一下，都可以通过pip安装：pipinsta

一、用P言播预备知识

此案例实现功能：利用网络爬虫，取天气并且语爬取某地的用P言播天气，并打印和语音播报。取天气并且语要用到requests库，用P言播lxml库，取天气并且语pyttsx3库，用P言播没有的取天气并且语，可以先安装一下，用P言播都可以通过pip安装：

pip install requests pip install lxml pip install pyttsx3

Requests库是取天气并且语个功能很强大的网络请求库，可以实现跟浏览器一样发送各种HTTP请求来获取网站的用P言播数据。

Lxml库是取天气并且语处理XML和HTML功能最丰富，最易于使用的用P言播库，通常用lxml库中的取天气并且语etree使HTML转化为文档。

Pyttsx3库是用P言播一个很简单的播放语音的库，你给它什么，它就读什么，当然别在意生硬的语气。基本用法如下：

import pyttsx3 word = pyttsx3.init() word.say(你好) # 关键一句，没有这行代码，不会播放语音 word.runAndWait()

码字不易废话两句：有需要学习资料的或者有技术问题交流可以私信小编发送“01”即可

爬虫是网站模板爬取网页的相关内容，了解HTML能够帮助你更好的理解网页的结构、内容等。 TCP/IP协议，HTTP协议这些知识了解一下就可以，能够让你了解在网络请求和网络传输上的基本原理，这次的小案例用不到。

二、详细说一说

2.1. get请求目标网址

我们首先导入requests库，然后就用它来获取目标的网页，我们请求的是天气网站中的北京天气。

import requests # 向目标url地址发送请求，返回一个response对象 req = requests.get(https://www.tianqi.com/beijing/) # .text是response对象的网页html print(req.text)

打印出的结果就是网站上显示的内容，浏览器就是通过这些内容“解析”出来我们看到的结构如下：

我们请求后的获得的数据

注意啦，小伙伴们有很大可能运行之后得不到网页代码，b2b供应网而是显示403，这是什么意思呢?

403错误是一种在网站访问过程中，常见的错误提示，表示资源不可用。服务器理解客户的请求，但拒绝处理它。

我们写的爬虫一般会默认告诉服务器，自己发送一个Python爬取请求，而很多的网站都会设置反爬虫的机制，不允许被爬虫访问的。

所以，我们想让目标服务器响应，那就把我们的爬虫进行一下伪装。此小案例就用常用的更改User-Agent字段进行伪装。

改一下之前的代码，将爬虫伪装成浏览器请求，这样就可以进行正常的访问了。

import requests headers = { content-type:application/json, User-Agent:Mozilla/5.0 (Xll; Ubuntu; Linux x86_64; rv:22.0) Gecko/20100101 Firefox/22.0} # 向目标url地址发送请求，返回一个response对象 req = requests.get(https://www.tianqi.com/beijing/,headers=headers) # .text是response对象的源码下载网页html print(req.text)

User-Agent字段怎么来的呢?我们以Chrome浏览器为例子，先随便打开一个网页，按键盘的F12或在空白处点击鼠标右键选择“检查”;然后刷新网页，点击“Network”再点击“Doc”，点击Headers，在信息栏查看Request Headers的User-Agent字段，直接复制，咱们就可以用啦。

2.2. lxml.etree登场

我们从网页请求获得的数据繁杂，其中只有一部分是我们真正想得到的数据，例如我们从天气的网站中查看北京的天气，只有下图中使我们想要得到的，我们如如何提取呢?这就要用到lxml.etree。