在实验室帮老师做文献计量那阵,最头疼的就是采集公开学术库。免费库大多有频控,出口一变就被限,好不容易跑起来的抓取任务说断就断。后来固定出口才算稳住。
我的做法分两层。日常大批量归档,用天行长效静态出口,IP一直不变,配个合理的请求间隔,跑公开文献元数据、政府开放数据平台很稳。间歇性需要像真人浏览去翻详情页、下载附件,就切鲸云独享住宅,真家庭宽带出口,不容易被识别成机房批量流量。
公开采集的边界我一直守得很死,之前那篇讲公开网页采集合规的(公开网页采集合规)把红线捋得很清楚。医疗健康类我也写过合规采集的做法(医疗健康合规采集),思路一致:只看公开、不碰隐私、不越权、遵守 robots 和频控。长期挂着跑的任务,我参照竞品价格舆情监控那套(竞品价格舆情监控)和常年跑脚本监控的经验(常年跑脚本监控)来排调度。
协议上SOCKS5和HTTP都备着:脚本里设HTTP代理头最方便,整段应用走SOCKS5做进程隔离。软路由全局出口得挑L2TP,不过采集任务大多是单进程单出口,HTTP/SOCKS5够用。
合规声明:只采集公开发布的学术与开放数据,严格守频控、不绕过任何访问限制、不碰需授权的非公开内容、不囤积个人隐私。






