可直接运行的代理爬虫案例
围绕真实采集流程提供完整代码:配置123Proxy网关、请求目标、解析字段、处理分页或滚动,并把结果写入JSON、JSON Lines或CSV。
框架9种完整案例网关123Proxy固定域名测试目标3类公开沙箱交付结构化文件
01
CHOOSE A FRAMEWORK
按你的技术栈打开完整案例
每个案例都包含安装、启动、代理认证、采集循环、终止条件和结构化输出,不省略最关键的工程代码。
Python
Requests + BeautifulSoup
静态分页网页
quotes.jsonl
Python
Scrapy
列表 + 详情 + 分页
books.jsonl
Python
Playwright
JavaScript渲染
quotes-playwright.json
Python
Selenium 4
JavaScript渲染
quotes-selenium.json
Node.js
Puppeteer
无限滚动页面
quotes-puppeteer.json
Node.js
Axios + Cheerio
静态分页网页
quotes-axios.jsonl
Go
Colly
并发分页采集
quotes-colly.csv
Java
Jsoup
HTML目录页面
books-jsoup.csv
PHP
cURL + DOMXPath
静态分页网页
quotes-php.json
02
123PROXY GATEWAYS
代码中直接使用代理网关域名
默认案例使用隧道代理爬虫混合池。复制后只需设置 PROXY_USER 与 PROXY_PASS。切换其他动态产品时使用下表网关;最终端口和完整路由用户名以控制台生成结果为准。
代理产品网关域名端口适合任务
隧道代理
proxy.123proxy.cn36923混合池 / 纯住宅池隧道住宅代理
residential.123proxy.cn33000国家地区与SESSION不限量动态住宅
unlimit.residential.123proxy.cn10253不限流量住宅任务两类静态代理
控制台分配的固定代理IP返回端口直连IP,无网关域名三个动态产品都使用123Proxy固定网关
隧道代理、隧道住宅和不限量动态住宅分别使用上表中的固定域名与端口。两类静态代理没有网关域名,必须直连控制台分配的代理IP和返回端口。
03
VERIFY FIRST
先确认账密与代理出口
运行任何爬虫前,先用同一组网关和代理账密访问HTTP测试服务。成功返回出口IP后,再排查框架、解析器或目标页面。
export PROXY_USER="替换为控制台代理用户名"
export PROXY_PASS="替换为控制台代理密码"
curl --fail-with-body --silent --show-error \
--proxy "http://proxy.123proxy.cn:36923" \
--proxy-user "${PROXY_USER}:${PROXY_PASS}" \
--connect-timeout 15 \
--max-time 30 \
"https://httpbin.org/ip"
04
SAFE TEST TARGETS
案例使用公开采集沙箱
httpbin
验证出口IP、请求头、状态码与超时,不承担业务采集。
https://httpbin.org/ipQuotes to Scrape
覆盖静态分页、JavaScript渲染和无限滚动页面。
https://quotes.toscrape.com/Books to Scrape
覆盖商品列表、详情页、相对链接和多页目录。
https://books.toscrape.com/这些站点专用于爬虫学习和技术验证。迁移到业务目标前,仍需确认访问授权、robots规则、服务条款、个人信息和数据使用边界。
05
PRODUCT MAPPING
按采集行为选择代理套餐
采集行为推荐起点代码调整
高频HTTP列表与详情隧道代理爬虫混合池默认网关即可运行
明确国家与连续SESSION隧道住宅代理替换网关并使用完整路由用户名
持续浏览器自动化不限量动态住宅固定网关端口10253
目标系统要求固定出口长效静态代理先分配IP,再把返回代理写入代码