博客
关于我
python爬虫实践之爬取hao123音乐音乐导航
阅读量:250 次
发布时间:2019-03-01

本文共 895 字,大约阅读时间需要 2 分钟。

目录


概述

爬取hao123上的所有音乐导航链接

准备

所需模块

  • re模块
  • requests模块

涉及知识点

  • python基础
  • requests模块基础
  • re模块基础

运行效果

控制台打印:

完成爬虫

1. 分析网页

打开音乐导航,按F12分析网页

因此可以使用URL:请求该网页的HTML源代码进行数据获取。

2. 爬虫代码

import re  import requests  音乐导航网址:http://www.hao123.com/music/wangzhi 请求头 header = { "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/69.0.3497.81 Safari/537.36" } 请求的URL url = "http://www.hao123.com/music/wangzhi" 发送请求,获取响应 response = requests.get(url, headers=header).text 正则表达式:获取音乐导航链接URL pat_music_url = r'' 正则表达式:获取音乐导航名字 pat_music_name = r'[\s\s]?(.?)[\s\s]*?' 音乐导航URL列表 music_url_list = re.findall(pat_music_url, response.strip()) 音乐导航名字列表 music_name_list = re.findall(pat_music_name, response) 循环遍历 if len(music_url_list) == len(music_name_list): for i in range(0, len(music_url_list)): print(music_name_list[i], ":", music_url_list[i])

运行代码结果如上所示,主要的难点就是使用正则表达式提取数据。

转载地址:http://vqzx.baihongyu.com/

你可能感兴趣的文章
Nginx下配置codeigniter框架方法
查看>>
nginx添加模块与https支持
查看>>
Nginx的Rewrite正则表达式,匹配非某单词
查看>>
Nginx的使用总结(一)
查看>>
Nginx的是什么?干什么用的?
查看>>
Nginx访问控制_登陆权限的控制(http_auth_basic_module)
查看>>
nginx负载均衡器处理session共享的几种方法(转)
查看>>
nginx负载均衡的5种策略(转载)
查看>>
nginx负载均衡的五种算法
查看>>
Nginx配置ssl实现https
查看>>
Nginx配置TCP代理指南
查看>>
Nginx配置代理解决本地html进行ajax请求接口跨域问题
查看>>
Nginx配置参数中文说明
查看>>
Nginx配置好ssl,但$_SERVER[‘HTTPS‘]取不到值
查看>>
Nginx配置实例-负载均衡实例:平均访问多台服务器
查看>>
NIFI大数据进阶_连接与关系_设置数据流负载均衡_设置背压_设置展现弯曲_介绍以及实际操作---大数据之Nifi工作笔记0027
查看>>
Nio ByteBuffer组件读写指针切换原理与常用方法
查看>>
NIO Selector实现原理
查看>>
nio 中channel和buffer的基本使用
查看>>
NISP一级,NISP二级报考说明,零基础入门到精通,收藏这篇就够了
查看>>