Crawler · Reverse engineering · Data
记录数据采集、逆向分析与数据工程的实际过程
写自媒体与电商平台的数据采集、接口协议还原、参数加密分析,以及采集系统与数据管道在长期运行中遇到的实际问题。文章只写验证过的内容。同时承接相关的数据采集与分析需求。
GET /api/v2/item?id=1024&sign=c41d8f…9e2b
403invalid signature
- 定位生成位置
- →剥离混淆
- →脱环境复现
200OK
盐值随版本变动怎么办:从静态资源里自动提取
写死盐值的采集脚本会在对方发版当天全线失效。把提取动作做成运行时的一步,比每次手工重新逆向划算得多。
采集与逆向JS 逆向工程化2 min
从一个 sign 参数入手:还原某电商平台商品详情接口的签名算法
商品详情接口带一个 32 位的 sign,改动任意查询参数都会返回 403。整个过程分三步:定位生成位置、剥离混淆、脱离浏览器环境复现。
采集与逆向JS 逆向抓包3 min
一套运行两年的采集系统,调度与去重上的实际问题
爬虫写完只是开始。任务调度、失败重试、增量去重、代理池健康度,才是长期维护的主要成本。记录两年里改过三版的几个设计。
数据工程与开发工程化数据管道3 min
主流平台接口收紧这一年:几个可观察到的趋势
开放接口减少、风控前移、客户端加密普及。对采集方来说,成本结构和技术选型都在变。
科技时事行业风控1 min