Java自学者论坛

 找回密码
 立即注册

手机号码,快捷登录

恭喜Java自学者论坛(https://www.javazxz.com)已经为数万Java学习者服务超过8年了!积累会员资料超过10000G+
成为本站VIP会员,下载本站10000G+会员资源,会员资料板块,购买链接:点击进入购买VIP会员

JAVA高级面试进阶训练营视频教程

Java架构师系统进阶VIP课程

分布式高可用全栈开发微服务教程Go语言视频零基础入门到精通Java架构师3期(课件+源码)
Java开发全终端实战租房项目视频教程SpringBoot2.X入门到高级使用教程大数据培训第六期全套视频教程深度学习(CNN RNN GAN)算法原理Java亿级流量电商系统视频教程
互联网架构师视频教程年薪50万Spark2.0从入门到精通年薪50万!人工智能学习路线教程年薪50万大数据入门到精通学习路线年薪50万机器学习入门到精通教程
仿小米商城类app和小程序视频教程深度学习数据分析基础到实战最新黑马javaEE2.1就业课程从 0到JVM实战高手教程MySQL入门到精通教程
查看: 1607|回复: 0

selenium 淘宝登入反爬虫解决方案(亲测有效)

[复制链接]
  • TA的每日心情
    奋斗
    2024-11-24 15:47
  • 签到天数: 804 天

    [LV.10]以坛为家III

    2053

    主题

    2111

    帖子

    72万

    积分

    管理员

    Rank: 9Rank: 9Rank: 9

    积分
    726782
    发表于 2021-4-14 13:57:44 | 显示全部楼层 |阅读模式

    前言

      目前在对淘宝进行数据爬取的时候都会碰到,登入时的滑块问题,无论是手动还是脚本都不成功。这里的很重要一个原因是很多的网站都对selenium做了反爬虫机制。接下来是笔者参考网上的网友们的方法亲自测试的一个方法,希望可以帮助到大家。注意这里使用的浏览器是Chrome。所以使用的驱动也是chromedriver

    一,淘宝反扒js

      在淘宝登入页面加载的js中,可以看到怎么一行代码,如下图:

      

      上图的这一行代码就对selenium进行了检测。所以我们只需要修改驱动的改行代码就可以。

    二,修改chromedriver.exe

       vim chromedriver.exe

    1. cdc_通过键入/cdc_并按下来搜索return
    2. 按下启用编辑a
    3. 删除任意数量的内容$cdc_lasutopfhvcZLmcfl并用等量字符替换已删除的内容。如果不这样做,chromedriver将会失败。
    4. 完成编辑后,按esc
    5. 要保存更改并退出,请键入:wq!并按return

      完成上述步骤就可以了:下图是笔者的修改,就将最后一个字符l 改为 a

      

     三,测试代码

      注意下面代码的:chrome_option 以开发者模式,否则依然需要滑块

    #!/usr/bin/env python
    # -*- coding: utf-8 -*-
    
    from selenium import webdriver
    from selenium.webdriver.support.ui import WebDriverWait
    from selenium.webdriver.common.by import By
    from selenium.webdriver.support import expected_conditions as EC
    
    chrome_option = webdriver.ChromeOptions()
    chrome_option.add_experimental_option('excludeSwitches', ['enable-automation'])  # 以开发者模式
    
    driver = webdriver.Chrome(options=chrome_option)
    wait = WebDriverWait(driver, 10)
    
    
    def search():
        driver.get('https://www.taobao.com')
        try:
            search_input = wait.until(
                EC.presence_of_element_located((By.CSS_SELECTOR, '#q'))
            )
            search_submit = wait.until(
                EC.presence_of_element_located((By.CSS_SELECTOR, '#J_TSearchForm > div.search-button > button'))
            )
        finally:
            pass
        search_input.send_keys('美食'.decode('utf-8'))
        search_submit.click()
        login()
    
    
    def login():
        try:
            login_before = wait.until(
                EC.presence_of_element_located((By.CSS_SELECTOR, '#J_QRCodeLogin > div.login-links > a.forget-pwd.J_Quick2Static'))
            )
            login_before.click()
    
            username = wait.until(
                EC.presence_of_element_located((By.CSS_SELECTOR, '#TPL_username_1'))
            )
            password = wait.until(
                EC.presence_of_element_located((By.CSS_SELECTOR, '#TPL_password_1'))
            )
            username.send_keys('xxxxx')  # 用户名
            password.send_keys('xxxxx')  # 密码
            login_submit = wait.until(
                EC.presence_of_element_located((By.CSS_SELECTOR, '#J_SubmitStatic'))
            )
            login_submit.click()
        finally:
            pass
        
        
    def main():
        search()
    
    
    if __name__ == '__main__':
        main()

     

    哎...今天够累的,签到来了1...
    回复

    使用道具 举报

    您需要登录后才可以回帖 登录 | 立即注册

    本版积分规则

    QQ|手机版|小黑屋|Java自学者论坛 ( 声明:本站文章及资料整理自互联网,用于Java自学者交流学习使用,对资料版权不负任何法律责任,若有侵权请及时联系客服屏蔽删除 )

    GMT+8, 2025-1-21 18:45 , Processed in 0.060323 second(s), 30 queries .

    Powered by Discuz! X3.4

    Copyright © 2001-2021, Tencent Cloud.

    快速回复 返回顶部 返回列表