案例：使用BeautifuSoup4的爬虫

2019-11-22 10:31:13

IT技术资源共享

我们以腾讯社招页面来做演示：http://hr.tencent.com/position.php?&start=10#a

使用BeautifuSoup4解析器，将招聘网页上的职位名称、职位类别、招聘人数、工作地点、发布时间，以及每个职位详情的点击链接存储出来。

# bs4_tencent.py


from bs4 import BeautifulSoup
import urllib
import json # 使用了json格式存储

def tencent():
 url = 'http://hr.tencent.com/'
 request = urllib.request.Request(url + 'position.php?&start=10#a')
 response =urllib.request.urlopen(request)
 resHtml = response.read()

 output =open('tencent.json','w')

 html = BeautifulSoup(resHtml,'lxml')

# 创建CSS选择器
 result = html.select('tr[class="even"]')
 result2 = html.select('tr[class="odd"]')
 result += result2

 items = []
 for site in result:
 item = {}

 name = site.select('td a')[0].get_text()
 detailLink = site.select('td a')[0].attrs['href']
 catalog = site.select('td')[1].get_text()
 recruitNumber = site.select('td')[2].get_text()
 workLocation = site.select('td')[3].get_text()
 publishTime = site.select('td')[4].get_text()

 item['name'] = name
 item['detailLink'] = url + detailLink
 item['catalog'] = catalog
 item['recruitNumber'] = recruitNumber
 item['publishTime'] = publishTime

 items.append(item)

 # 禁用ascii编码，按utf-8编码
 line = json.dumps(items,ensure_ascii=False)

 output.write(line.encode('utf-8'))
 output.close()

if __name__ == "__main__":
 tencent()

分享好友

分享这个小栈给你的朋友们，一起进步吧。

应用开发

创建时间：2020-06-17 15:31:04

应用软件开发是指使用程序语言C#、java、 c++、vb等语言编写，主要是用于商业、生活应用的软件的开发。

展开

订阅须知

• 所有用户可根据关注领域订阅专区或所有专区

• 付费订阅：虚拟交易，一经交易不退款；若特殊情况，可3日内客服咨询

• 专区发布评论属默认订阅所评论专区（除付费小栈外）

技术专家

查看更多

栈栈
专家