这次的主要的目的是从淘宝的搜索页面获取商品的信息。其实分析页面找到信息很容易,页面信息的存放都是以静态的方式直接嵌套的页面上的,很容易找到。主要困难是将信息从HTML源码中剥离出来,数据和网页源码结合的很紧密,剥离数据有一定的难度。
然后将获取的信息写入excel表格保存起来,这次只爬取了前面10页的内容。
代码如下:
import requests
import re
from xlwt import Workbook
import xlrd
import time
def key_name( number ):
#获取页面的内容并返回
name = '手机'
URL_1 = "s.taobao/search?ie=utf8&initiative_id=staobaoz_20170905&stats_click=search_radio_all%3A1&js=1&imgfile=&q="
URL_2 = "&suggest=0_1&_input_charset=utf-8&wq=u&suggest_query=u&source=suggest&p4ppushleft=5%2C48&s="
URL = ( URL_1 + name + URL_2 + str(number))
#print(URL)
res = requests.get( URL )
return res.text
def find_date( text):
#根据整个页面的信息,获取商品的数据所在的HTML源码并放回
reg = r',"data":{"spus":[({.+?)]}},"header":'
reg = repile(reg)
info = re.findall(reg, text)
return info[0]
def manipulation_data( info, N, sheet ):
#解析获取的HTML源码,获取数据
Date = eval(info)
for d in Date:
T = " ".join([t['tag'] for t in d['tag_info']])
#print(d['title'] + ' ' + d['price'] + ' ' + d['importantKey'][0:len(d['importantKey'])-1] + ' ' + T)
sheet.write(N,0,d['title'])
sheet.write(N,1,d['price'])
sheet.write(N,2,T)
N = N + 1
return N
def main():
book = Workbook()
sheet = book.add_sheet('淘宝手机数据')
sheet.write(0,0,'品牌')
sheet.write(0,1,'价格')
sheet.write(0,2,'配置')
book.save('淘宝手机数据.xls')
#k用于生成链接,每个链接的最后面的数字相差48.
#N用于记录表格的数据行数,便于写入数据
k = 0
N = 1
for i in range(10+1):
text = key_name( k + i * 48 )
info = find_date(text)
N = manipulation_data( info ,N, sheet )
book.save('淘宝手机数据.xls')
print('下载第' + str(i) + '页完成')
if __name__ == '__main__':
main()更多Python相关技术文章,请访问Python教程栏目进行学习!
年利率为2%.02,年利率为2%,年利率,存3年。02:",periods_per_year,期末本息合计为,存3年,0;存入1000元,0;periods_per_year#rate_per_period表示每个计息期的利率=periods_per_year*years#在这里输入您的代码实现该函数的功能,返回Present_Value*pow((1+rate_per_period))。:",期数)#Fv=PV*(1+利率)期数)打印(",12,365,年利率2%;1000元存款:“,按日计息,年数),Future_value(1000:#present_value表示现值#annual_rate表示年利率#periods_per_year表示每年计息周期数#years表示存款时间以年数_per_period=annual_rate/,利息按月计算。3))打印(",0.02,期末本息合计为,future_value(1000,3))打印(",future_value(1000;存入1000元;#coding=utf-8deffuture_value(present_value,利息按年计算,最终本息合计存3年;扩展材料Python是一种面向对象的解释性计算机编程语言,具有丰富而强大的库。常被戏称为gluelanguage,可以轻松连接其他语言(尤其是C/C++)制作的各种模块。Python是一种面向对象的解释性计算机编程语言,由荷兰人吉多·范·罗苏姆于1989年发明,1991年首次公开发布。Python作为最受欢迎的编程语言,在2018年世界脚本语言排行榜上排名第一,成为许多领域的首选语言。发展自90年代初Python语言诞生以来,被广泛应用于系统管理任务和Web编程中。Python是由吉多·范·罗苏姆创立的。1989年圣诞节期间,在阿姆斯特丹,Guido决定开发一个新的脚本解释器,作为ABC语言的继承,以打发圣诞节的无聊。Python(意为大蟒蛇)被选为编程语言的名称,取自电视喜剧《巨蟒剧团的飞行马戏团》,该剧于20世纪70年代在英国首播。ABC是Guido设计的教学语言。对于Guido来说,ABC是一门非常漂亮和强大的语言,是专门为非专业程序员设计的。但是ABC语言一直不成功,Guido认为是其不开放造成的。Guido决心在Python中避免这个错误。同时,他也想实现一些在ABC里闪现过却没有实现的东西。就这样,Python在Guido手里诞生了。可以说Python是从ABC发展而来,主要受Modula-3(另一种为小群体设计的漂亮而强大的语言)的影响。并结合了Unixshell和c的习惯。Python已经成为最流行的编程语言之一。自2004年以来,python的使用量呈线性增长。2011年1月,它被TIOBE的编程语言列表评为2010年年度语言。由于Python的简单性、可读性和扩展性,国外使用Python进行科学计算的研究机构越来越多,一些知名大学也采用Python教授编程课程。比如卡耐基梅隆大学的编程基础,麻省理工学院的计算机科学与编程导论都是用Python语言授课的。