爬取中国天气网获取全国城市编码并存入mysql数据库

阅读量：

对以下小型演示过程进行记录：通过中国天气网的文字信息获取全国各城市的编码信息，并将这些城市编码数据存储至MySQL数据库中。

分析

通过初步分析发现，《中国天气网》文字版网站按照地区将内容划分为若干区域，并共分为八个板块。

对应的url简单的用缩写表示：‘hb’, ‘db’, ‘hd’, ‘hz’, ‘hn’, ‘xb’, ‘xn’, ‘gat’

检查网页源代码，查看标签情况，找到我们需要的城市编码。

再折叠起来查看标签大体情况。

选取中国华北地区作为研究对象后发现，在div标签下设置为class属性为" conMidtab "的区域中包含5个省/直辖市即北京天津河北山西和内蒙古每个省份均对应一个div标签并设置class属性为" conMidtab2 "

经分析可知，在线获取城市编码和相关城市信息时，默认情况下它们会被存储在一个固定宽度和高度设置为td width=83 height=23的表格单元格中。随后我们可以采用path、beautifulsoup4以及正则表达式来进行数据提取工作。在这里我们选择了正则表达式作为提取工具。至此为止的分析已经较为充分。需要注意的是：单独获取该标签内容确实能够满足基本需求但如上文所示一个网页内总共包含一周七天的城市预报数据其中六天的数据被隐藏需要执行过滤操作否则将导致每次页面访问都重复提取七次城市编码信息

代码展示

复制代码

    import re
    import requests
    import pymysql
    
    # 定制请求头
    headers = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/67.0.3396.87 Safari/537.36'
    }
    # 用列表存储爬取下来编码和城市名
    cites_codes = []
    
    # 爬取解析一个网页的函数
    def parse_url(url):
    response = requests.get(url, headers=headers)
    text = response.content.decode('utf-8')
    # 先滤去后面六个，只留下第一个
    info = re.findall(
        r'<div class="conMidtab">.*?<div class="conMidtab" style="display:none;">',text,re.DOTALL)[0]
    # 获得我们要的信息
    infos = re.findall(
        r'<td width="83" height="23".*?<a .*?weather/(.*?)\.s.*?>(.*?)</a>', info, re.DOTALL)
    # 获取的信息遍历存入列表
    for i in infos:
        city_code = [i[1],i[0]]
        cites_codes.append(city_code)
    
    # 存储到数据库函数
    def store_2_mysql():
    # 连接数据库
    conn = pymysql.connect(host='localhost', user='root',
                           password='712688', database='test_demo', port=3306)
    cursor = conn.cursor()
    # 遍历列表存入数据库
    for i in cites_codes:
        sql = '''
            insert into city_code values(0,'%s','%s')''' % (i[0], i[1])
        cursor.execute(sql)
    # 提交
    conn.commit()
    conn.close()
    
    # 主函数遍历全部八个地区
    def main():
    base_url = 'http://www.weather.com.cn/textFC/{}.shtml'
    cites = ['hb', 'db', 'hd', 'hz', 'hn', 'xb', 'xn', 'gat']
    # 获得每个地区的url
    for i in cites:
        url = base_url.format(i) 
        # 开始爬取一个地区的信息
        parse_url(url)
    # 存储到数据库中
    store_2_mysql()
    
    
    if __name__ == '__main__':
    main()
    
    
    AI写代码
![](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-30/37EemMzsFW1qawoihVZnQpOfB6Gv.png)

查看数据库中存储情况：

全部评论 (0)

还没有任何评论哟~

爬取中国天气网获取全国城市编码并存入mysql数据库

简单的记录一个小demo，利用中国天气网文字版本获取全国城市编码并存入mysql数据库中。分析首先观察发现，中国天气网文字版按地区分成8个部分。对应的url简单的用缩写表示：‘hb’,‘db’,...

中国天气网城市代码爬取

想试着收集一些气象数据，记得之前气象数据共享平台可以下，结果发现需要实名认证还要提交证件照之类的，想了想，脸黑，估计认证不过，还是算了。于是又网上找了找，发现在美国noaa网站可以下载，包含中国大概7...

全国城市数据获取 mysql全国城市数据

全国城市数据@TOC 全国城市数据数据来源中华人民共和国民政部根据国家发布的最新城市数据进行处理访问页面查看数据 2020年中华人民共和国县以上行政区划代码（截止2020年12月31日）点击后可...

c#获取中国城市天气编号代码

代码写得有点久了，好像由于天气预报接口需要中国省市编码号，我就一气之下，写了些代码，将中国天气网天气预报中出现的省、市、县爬取下来，数据还在我数据库中，谁想要可以留言，我可以发到他/她邮箱中。（别惹学...

[python]爬取全国城市历史天气数据

python爬取全国城市历史天气数据爬取全国城市2011至2020每天天气数据以requests+BeautifulSoup的方式抓取数据多线程爬取按城市名爬取后按省份存为xls 从全国城市名...

全国各城市天气信息数据爬取

第一章数据采集与预处理的概述如今，社会中各个机构、部门、公司、团体等正在实时不断地产生大量的信息，这些信息需要以简单的方式进行处理，同时又要十分准确且能迅速满足各种类型的数据（信息）需求者。这给我们...

使用python爬取全国天气数据并导入MySQL数据库表

文章目录 1、分析网页 2、分析完毕，开始编写代码： 3、使用MySQL创建数据库跟表 4、导入数据 5、完整代码： 6、遇到的问题 1、分析网页首先开始观察要爬取的网页（此处为中国天气网天气预报）...

中国天气网数据爬取

中国天气网数据爬取全部 importrequests frombs4importBeautifulSoup frompyechartsimportBar表格库 defmain: urls= ‘[htt...

中国天气网数据爬取

爬取中国天气网数据：目标数据：地区名最低气温，最高气温存入cvs表中知识点一、开启多线程 classQueue.QueuemaxsizeFIFO先进先出 Queue.qsize返回队列的大小 ...

[python爬虫]爬取天气网全国所有县市的天气数据

[python爬虫]爬取天气网全国所有县市的天气数据访问URL 解析数据保存数据所要用到的库 importrequests fromlxmlimportetree importxlwt 访问UR...

是否确定退出登录?

爬取中国天气网获取全国城市编码并存入mysql数据库

分析

代码展示

全部评论 (0)

相关文章推荐

爬取中国天气网获取全国城市编码并存入mysql数据库

中国天气网城市代码爬取

全国城市数据获取 mysql全国城市数据

c#获取中国城市天气编号代码

[python]爬取全国城市历史天气数据

全国各城市天气信息数据爬取

使用python爬取全国天气数据并导入MySQL数据库表

中国天气网数据爬取

中国天气网数据爬取

[python爬虫]爬取天气网全国所有县市的天气数据