绑定完请刷新页面
取消
刷新

分享好友

×
取消 复制
案例:使用BeautifuSoup4的爬虫
2019-11-22 10:31:13

IT技术资源共享



我们以腾讯社招页面来做演示:http://hr.tencent.com/position.php?&start=10#a

使用BeautifuSoup4解析器,将招聘网页上的职位名称、职位类别、招聘人数、工作地点、发布时间,以及每个职位详情的点击链接存储出来。

# bs4_tencent.py


from bs4 import BeautifulSoup
import urllib
import json # 使用了json格式存储

def tencent():
 url = 'http://hr.tencent.com/'
 request = urllib.request.Request(url + 'position.php?&start=10#a')
 response =urllib.request.urlopen(request)
 resHtml = response.read()

 output =open('tencent.json','w')

 html = BeautifulSoup(resHtml,'lxml')

# 创建CSS选择器
 result = html.select('tr[class="even"]')
 result2 = html.select('tr[class="odd"]')
 result += result2

 items = []
 for site in result:
 item = {}

 name = site.select('td a')[0].get_text()
 detailLink = site.select('td a')[0].attrs['href']
 catalog = site.select('td')[1].get_text()
 recruitNumber = site.select('td')[2].get_text()
 workLocation = site.select('td')[3].get_text()
 publishTime = site.select('td')[4].get_text()

 item['name'] = name
 item['detailLink'] = url + detailLink
 item['catalog'] = catalog
 item['recruitNumber'] = recruitNumber
 item['publishTime'] = publishTime

 items.append(item)

 # 禁用ascii编码,按utf-8编码
 line = json.dumps(items,ensure_ascii=False)

 output.write(line.encode('utf-8'))
 output.close()

if __name__ == "__main__":
 tencent()


分享好友

分享这个小栈给你的朋友们,一起进步吧。

应用开发
创建时间:2020-06-17 15:31:04
应用软件开发是指使用程序语言C#、java、 c++、vb等语言编写,主要是用于商业、生活应用的软件的开发。
展开
订阅须知

• 所有用户可根据关注领域订阅专区或所有专区

• 付费订阅:虚拟交易,一经交易不退款;若特殊情况,可3日内客服咨询

• 专区发布评论属默认订阅所评论专区(除付费小栈外)

技术专家

查看更多
  • 栈栈
    专家
戳我,来吐槽~