网站是如何识别像 Puppeteer 这样采用 chrome headless 模式的 node js 爬虫的？

This topic created in 2976 days ago, the information mentioned may be changed or developed.

最近想用 Puppeteer 爬取这个网站的数据，发现爬取几个数据之后就很快被识别为机器人，弹出 recaptcha 的验证，已设置 UA 和 Cookie，模拟浏览器人工操作还是被封禁。这个网站是如何识别检测 puppeteer 爬虫的？

5 replies • 2018-04-20 13:58:32 +08:00

gzlock

Apr 19, 2018

瓶颈在 ip，上代理池

miyuki

Apr 19, 2018

可能是 IP 频率？

soli

Apr 20, 2018

道高一尺，魔高一丈。

复杂一点的，可以分析用户鼠标、键盘等动作。

yamedie

Apr 20, 2018 via Android

操作频率太快了，设置点间隔

Sparetire

Apr 20, 2018