当前位置:首页 > 随笔 > 正文内容

使用Selenium实现自动化数据采集实战

访客 随笔 2026年8月16日 1

本文演示如何利用Selenium框架结合Python,从指定站点提取公开报告数据并下载相关文档。

法律与道德声明

本项目仅用于教育和研究目的。禁止将代码或采集结果用于任何违反法律法规、侵犯隐私、干扰服务或商业牟利的行为。

核心目标

环境准备

安装Selenium

pip install -i https://pypi.douban.com/simple selenium

浏览器驱动配置(以Edge为例)

  1. 在浏览器设置中查看版本号:菜单 → 设置 → 关于Microsoft Edge
  2. 前往官方驱动页面下载对应版本
  3. 解压后将驱动文件置于系统PATH路径或脚本同目录

核心逻辑实现

1. 浏览器初始化

from selenium import webdriver
from selenium.webdriver.edge.options import Options

opts = Options()
opts.add_argument('--ignore-certificate-errors')
opts.add_argument('--disable-extensions')
opts.add_argument('--no-sandbox')
opts.add_argument('--disable-gpu')

browser = webdriver.Edge(options=opts)

2. 动态加载内容

from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.common.by import By
import time

browser.get('https://report.iresearch.cn/')

waiter = WebDriverWait(browser, 10)
click_count = 0

while click_count < 10:
    try:
        btn = waiter.until(
            EC.element_to_be_clickable((By.ID, 'loadbtn'))
        )
        btn.click()
        click_count += 1
        print(f"已触发加载 {click_count} 次")
        time.sleep(2)
    except:
        break

time.sleep(3)  # 等待最终渲染

3. 数据提取与存储

import pandas as pd

records = []
items = browser.find_elements(By.CSS_SELECTOR, 'li[id^="freport."]')

for item in items:
    try:
        title_elem = item.find_element(By.TAG_NAME, 'h3')
        link_elem = item.find_element(By.TAG_NAME, 'a')
        desc_elem = item.find_elements(By.TAG_NAME, 'p')
        tag_elems = item.find_elements(By.CSS_SELECTOR, '.link a')
        time_elem = item.find_element(By.CSS_SELECTOR, '.time span')

        record = {
            "标题": title_elem.text.strip(),
            "链接": link_elem.get_attribute('href'),
            "描述": desc_elem[0].text.strip() if desc_elem else "",
            "标签": ", ".join([t.text for t in tag_elems]),
            "发布日期": time_elem.text.strip()
        }
        records.append(record)
    except Exception as ex:
        continue

df = pd.DataFrame(records)
df.to_csv('reports_summary.csv', encoding='utf-8-sig', index=False)

4. 构建下载链接

import re

with open('found_links.txt', 'r', encoding='utf-8') as f:
    raw_urls = [line.strip() for line in f.readlines()]

pattern = r'/(\d+)\.shtml'
download_urls = []

for url in raw_urls:
    match = re.search(pattern, url)
    if match:
        report_id = match.group(1)
        download_url = f'https://report.iresearch.cn/include/ajax/user_ajax.ashx?reportid={report_id}&work=rdown&url=https%3A%2F%2Freport.iresearch.cn%2Freport%2F202505%2F{report_id}.shtml'
        download_urls.append(download_url)

with open('download_queue.txt', 'w', encoding='utf-8') as f:
    f.write('\n'.join(download_urls))

5. 自动化下载(需登录状态)

import random

# 初始化浏览器并注入会话Cookie
browser.get('https://report.iresearch.cn/')

session_cookies = [
    {'name': 'iRsUserId', 'value': 'YOUR_ID'},
    {'name': 'iRsUserType', 'value': '49'},
    {'name': 'iRsUserGroup', 'value': '48'}
]

for cookie in session_cookies:
    browser.add_cookie(cookie)

browser.refresh()
time.sleep(3)

# 执行下载请求
with open("download_queue.txt", "r", encoding="utf-8") as f:
    urls = [line.strip() for line in f if line.strip()]

for i, target_url in enumerate(urls, 1):
    try:
        browser.get(target_url)
        print(f"[{i}/{len(urls)}] 请求下载: {target_url}")
        time.sleep(random.uniform(2, 5))
        
        if random.random() < 0.15:
            browser.refresh()
            time.sleep(2)
            
    except Exception as e:
        print(f"失败: {str(e)[:60]}...")
        continue

browser.quit()

相关文章

可以按小时收费的VPS

很多 VPS 提供商都支持 按小时计费(hourly billing),想短期试用 / 临时搭建节点、测试网络、短期项目等场景非常合适。下面是当前最主流且靠谱的按小时 VPS 选项,分别按不同需求场景整理: 1. Vultr(全球节点,包括日本) 按小时计费 可选机房:东京 / 大阪 / 洛杉矶 / 法兰克福 / 伦敦 … 支持 PayPal(部分情况),但更常用信用卡/PayPal+卡价格参考$...

在 iPhone 上下载国外App

地区/国家限制App Store 会根据 Apple ID 的国家或地区限制应用下载。如果你的 Apple ID 绑定的是中国大陆,就可能无法下载 OpenAI 官方的 ChatGPT 应用,因为它在大陆 App Store 不上架。解决办法:换成美国、加拿大、香港等地区的 Apple ID。或者在现有 Apple ID 上更改地区。注册一个国外 Apple ID(推荐)比如注册 美国区 Appl...

Node.js 中的异步编程:回调与 Promise

Node.js 是一个基于 JavaScript 构建的单线程、非阻塞运行环境,它通过异步编程机制来高效处理多个操作。在执行如文件读取、API 请求或数据库查询等任务时,Node.js 不会等待这些操作完成,而是使用回调函数和 Promise 来避免阻塞主线程。 回调方式实现异步 那么当异步操作完成后,Node.js 如何知道接下来要做什么呢?这就要用到 回调函数(callback)。 回调本质上...

Selenium自动化测试入门指南

Selenium自动化测试入门指南

什么是自动化测试? 自动化测试是指利用软件工具自动执行测试用例,模拟用户操作,如打开网页、点击链接、输入文本等,并验证结果是否符合预期。 其主要优点包括: 大幅减少人工成本 测试速度快 可以在非工作时间运行 支持持续集成和交付 然而,它也存在一些局限性,例如开发成本较高、不适合快速变化的项目、依赖稳定的UI界面等。 自动化测试的应用条件 适合引入自动化测试的情况包括: 手动测试耗时且需要大量...

MariaDB Galera集群故障快速恢复指南

OpenStack控制节点采用三节点MariaDB Galera集群架构。当数据库集群因故障重启时,有时会出现Galera集群无法正常启动的问题。虽然有多种方法可以恢复数据库服务,但如何实现快速启动同时确保数据完整性呢? 通过分析日志发现,MariaDB Galera集群节点宕机时会在日志中输出以下信息: [Note] WSREP: 新集群视图:全局状态: 874d8e7e-5980-11e8-8...

Android 中 EventBus 的通信机制与实现原理深度解析

EventBus 核心设计思想 EventBus 是一个基于观察者模式的事件总线框架,广泛应用于 Android 平台以实现组件解耦。它通过中心化的消息分发机制,使不同层级、不同线程的对象能够以"发布-订阅"方式通信,避免了传统接口回调或广播带来的强依赖问题。 核心角色说明 事件(Event):任意 Java 对象,作为数据载体,如网络状态变更通知、用户登录信息等。 发布者(Publi...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。