使用的 Python3 版本,基于 flask 写的 web 网站,python3 app.py 直接跑起来后,用 nginx 做代理访问。本机测试时可以爬取网页内容,放在服务器上就报: urllib.error.HTTPError: HTTP Error 503: Service Temporarily Unavailable。 测试过服务器和要爬的地址是通的,代理 ip 也是可用的。
直接上源码:
def search(name):
headers = {
'User-Agent': 'Mozilla/5.0 (Windows NT 6.2; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/27.0.1453.94 Safari/537.36'}
chaper_url = "https://cn.torrentkitty.tv/search/%s/" % parse.quote(name)
cookie = cookiejar.CookieJar()
handler = request.HTTPCookieProcessor(cookie)
proxy_handler = request.ProxyHandler({'http': 'http://101.96.11.5:80'})
opener = request.build_opener(handler, proxy_handler)
myRequest = request.Request(url=chaper_url, headers=headers)
myResponse = opener.open(myRequest)
1
findstrx 2018-07-20 17:57:36 +08:00
你需要一个 Docker...
|
2
godwow OP @findstrx 能说清楚点吗,docker 和服务器有什么区别吗,对了我是放在国外的 vps 上跑有问题
|
3
misaka19000 2018-07-20 18:10:38 +08:00
我有点晕了 你究竟是把网站放到服务器上面还是把爬虫放到服务器上面?
|
4
godwow OP @misaka19000 网站放服务器上了,里面有段爬网页的代码
|
5
misaka19000 2018-07-20 18:21:07 +08:00
这个 503 是你自己的服务报的还是远程主机返回的
|
6
godwow OP @misaka19000 远程主机报的错误,爬页面的时候报错了,上面是爬页面的代码
|
7
godwow OP 又要沉了,真心想不到什么原因😭
|
8
yongzhong 2018-07-20 18:38:42 +08:00
本机->代理->爬取页 √
服务器->代理->爬取页 × 检查过服务器到代理是否可行?代理是否如期成功? |