sourcecode.school接单
Crawler · Reverse engineering · Data

记录数据采集、逆向分析与数据工程的实际过程

写自媒体与电商平台的数据采集、接口协议还原、参数加密分析,以及采集系统与数据管道在长期运行中遇到的实际问题。文章只写验证过的内容。同时承接相关的数据采集与分析需求。

REQUEST
GET /api/v2/item?id=1024&sign=c41d8f…9e2b
403invalid signature
  1. 定位生成位置
  2. 剥离混淆
  3. 脱环境复现
200OK

盐值随版本变动怎么办:从静态资源里自动提取

写死盐值的采集脚本会在对方发版当天全线失效。把提取动作做成运行时的一步,比每次手工重新逆向划算得多。

采集与逆向JS 逆向工程化2 min

从一个 sign 参数入手:还原某电商平台商品详情接口的签名算法

商品详情接口带一个 32 位的 sign,改动任意查询参数都会返回 403。整个过程分三步:定位生成位置、剥离混淆、脱离浏览器环境复现。

采集与逆向JS 逆向抓包3 min

一套运行两年的采集系统,调度与去重上的实际问题

爬虫写完只是开始。任务调度、失败重试、增量去重、代理池健康度,才是长期维护的主要成本。记录两年里改过三版的几个设计。

数据工程与开发工程化数据管道3 min

主流平台接口收紧这一年:几个可观察到的趋势

开放接口减少、风控前移、客户端加密普及。对采集方来说,成本结构和技术选型都在变。

科技时事行业风控1 min