URL 发现与调度
按站点、栏目和更新时间管理采集边界。
面向 Scrapy、requests、Playwright、Selenium 与内部爬虫,以高带宽代理承载规模化采集,并按地区需求补充住宅代理。
网页数量、文档体积、页面渲染和地区差异决定代理选择,不能只用单一请求成功率评价。
按站点、栏目和更新时间管理采集边界。
区分轻量网页、PDF 和其他公开文档的传输方式。
需要本地化结果时使用可指定国家或地区的住宅代理。
抽取正文、字段和文档关系,过滤重复与低质量内容。
高带宽代理承载大规模网页和文档下载,住宅代理提供明确的国家或地区出口。
按站点和时间持续发现、抓取并抽取公开文章。
保持主题、分页和回复关系,控制抓取节奏。
下载文档并保存来源、版本、格式和文本解析结果。
轻量 HTML、浏览器页面和 PDF 文档使用独立队列与代理配置。
记录公开来源、栏目、更新时间和允许抓取范围。
大规模下载使用高带宽代理,地区内容使用住宅代理。
HTML、浏览器页面和文档进入不同工作队列。
输出正文、字段、时间、来源和质量状态。
网页和文档主链路使用高带宽代理;本地化搜索、新闻和地区内容使用隧道住宅代理。
监控有效文档数、抓取与解析成功率、地区匹配率、重复率和来源字段完整性。
项目带宽以聚合容量提供;目标响应、对象大小、并发、工作节点和存储会影响实际吞吐。
按站点、HTML、浏览器页面和文档下载队列配置标准代理。
import scrapy
proxy = "http://user:pass@proxy.123proxy.cn:9000"
request = scrapy.Request(
"https://target.example/public-document",
meta={"proxy": proxy},
cb_kwargs={"source": "public-web"},
)
代理选择、工具接入、下载性能、失败重试与数据完整性。
大规模网页和文档下载的主要瓶颈通常是带宽与总传输成本,因此高带宽代理更适合作为主链路。只有明确依赖国家或地区身份时才补充住宅代理。
隧道住宅代理覆盖 190+ 国家和地区,可在鉴权中指定国家或地区与 SESSION。具体可选位置以控制台为准。
先读取响应和重试提示,按站点设置并发、延迟、指数退避与失败上限,再用代表性任务评估代理池。代理不应被用来绕过登录、验证码或访问控制。
可使用 Playwright 等浏览器工具并配置标准代理。浏览器会并行加载多种资源,应单独评估节点性能、页面完成时间和带宽。
不建议。PDF 体积、超时和校验方式与 HTML 不同,应拆分队列并使用不同并发、超时和重试参数。
标准代理方案不包含业务解析。正文抽取、语言识别、去重和质量过滤由客户数据管道负责,项目制服务需单独确认。
使用不同地区进行小规模对比,观察页面内容、搜索结果、可见字段或返回状态是否变化,再决定是否使用住宅代理。
各爬虫节点可接入同一项目网关,并按站点或队列使用不同 SESSION。并发、延迟、超时和重试应在爬虫侧按域名控制,最终以有效文档吞吐评估单项目容量。
按站点配置并发、延迟、超时和重试,遵守 robots、服务条款和合理访问边界,不应以代理绕过访问控制。
建议为每个文档保留原始 URL、站点、抓取时间、内容版本、地区策略和处理状态,便于审计与数据治理。