PyComicPackRouMan/utils/HtmlUtils.py
2022-12-06 10:16:29 +08:00

54 lines
1.6 KiB
Python
Raw Blame History

This file contains invisible Unicode characters

This file contains invisible Unicode characters that are indistinguishable to humans but may be processed differently by a computer. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

from fake_useragent import UserAgent
import requests
from lxml import html
from utils.comic.ComicStr import comicStr
import os
class htmlUtils:
headers = {'User-Agent': UserAgent().random}
url_data = {}
@classmethod
def getHTML(cls, curl):
rstr = r"[\/\\\:\*\?\"\<\>\|\.]" #  '/ \ : * ? " < > |'
#file_url = re.sub(rstr, "_", curl)
keys = cls.url_data.keys()
url_text = cls.url_data.get(curl)
#数据为空则获取数据
if url_text == None:
print("请求地址:",curl)
res = requests.get(curl, headers=cls.headers)
url_text = html.fromstring(res.text)
data = { curl : url_text}
cls.url_data.update(data)
return url_text
@classmethod
def getBytes(cls, url):
return requests.get(url, headers=cls.headers,stream=True)
@classmethod
def getJSON(cls,curl):
res = requests.get(curl, headers=cls.headers)
data_json = res.json()
return data_json
@classmethod
def xpathData(cls,c_xpath,url=None,num=None,not_eq=None):
if url == None:
url = cls.temp_url
else:
cls.temp_url = url
result = []
#获取html实体数据
et = cls.getHTML(url)
#比对数据
count = 1
xpaths = et.xpath(c_xpath)
for x in xpaths:
if not x == not_eq:
result.append(x)
count +=1
if not num == None:
result = result[num]
return result