您的位置:首页 > 脚本大全 > > 正文

python中生成字符串序列(python实现字符串加密 生成唯一固定长度字符串)

更多 时间:2021-11-05 14:48:08 类别:脚本大全 浏览量:1884

python中生成字符串序列

python实现字符串加密 生成唯一固定长度字符串

背景

有时候爬虫爬过的url需要进行指纹核对,比如Scrapy就是进行指纹核对,如果是指纹重复则不再爬取。当然在入库的时候我还是需要做一次核对,否则如果爬虫有漏掉,进入数据库就不合适了。

思路

根据Scrapy的指纹生成方式,这次的指纹生成方式也是用hash的MD5对目标URL进行加密,生成固定长度的字符串,然后在数据库里面将字段设置成unique,这样的话在保证url固定长度的情况下还能够保证入库后的唯一性,进最大努力避免出现重复的数据。

指纹生成代码

新建一个文件,然后在里面编写指纹生成的方法,在使用的时候from import进来,调用方法即可。代码为:

  • ?
  • 1
  • 2
  • 3
  • 4
  • 5
  • 6
  • 7
  • 8
  • 9
  • 10
  • 11
  • 12
  • 13
  • import hashlib
  •  
  • def get_md5(url):
  •  """
  •  由于hash不处理unicode编码的字符串(python3默认字符串是unicode)
  •   所以这里判断是否字符串,如果是则进行转码
  •   初始化md5、将url进行加密、然后返回加密字串
  •  """
  •  if isinstance(url, str):
  •   url = url.encode("utf-8")
  •  md = hashlib.md5()
  •  md.update(url)
  •  return md.hexdigest()
  • 为了验证代码的可用性,再加上代码:

  • ?
  • 1
  • 2
  • 3
  • if __name__ == "__main__":
  •  urls = "http://www.baidus.com"
  •  print(get_md5(urls))
  • 在本地运行无误,再把下面这串删除。等到调用的时候from import get_md5把文件和方法引入,就可以使用了

    以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持开心学习网。

    原文链接:https://blog.csdn.net/QuinnSpider/article/details/82847152

    您可能感兴趣