服务

四类活,都能单独接,也能组合成一条长期运行的数据管道。每一项都是我自己动手写代码, 交付的是清洗过的结构化数据,不是一堆原始 HTML。

网页数据抓取

大规模采集公开网页数据。字段结构先跟你确认好,再跑全量 —— 不会交付一堆你用不上的列。

  • 适用:门店名录、电商商品目录、行业黄页、社媒公开内容
  • 交付:CSV / JSON / Excel,已清洗去重,附字段说明
  • 跑过的数据类型:Google Maps 与 Yahoo Japan 门店信息、电商店铺商品目录

浏览器自动化

把重复的浏览器操作脚本化。基于 Chrome DevTools Protocol 和 Playwright, 能处理登录、翻页、动态加载、验证码之外的常见反爬流程。

  • 适用:没有 API 的后台系统、批量导出报表、表单填写、动态渲染页面采集
  • 交付:可复用脚本 + 使用说明,也可以由我托管定时运行
  • 技术:Node.js / Python + Playwright + CDP

线索与联系方式采集

按关键词、行业、国家定向挖掘 B2B 联系人,提取公开可得的邮箱与电话。 每条记录都带来源 URL,方便你自己复核。

  • 适用:海外经销商 / 维修商 / 门店名单、行业采购联系人
  • 交付:结构化表格 + 去重 + 来源链接 + 采集时间与关键词
  • 覆盖:按国家与城市定向,支持西班牙语等非英语关键词

定制数据管道

定时采集、存储、交付。数据集自动更新,不会过期 —— 适合需要长期跟踪价格、库存、名录或竞品的场景。

  • 适用:价格监控、竞品目录跟踪、名录定期刷新
  • 交付:定时任务 + 增量更新 + 失败告警,数据落到你指定的位置
  • 周期:按天 / 周 / 月,按你的节奏

边界:什么不做

只采集公开可得的数据。不绕过付费墙、不登录未授权的账号、不访问私有系统。 如果某个数据源的服务条款禁止采集,我会在开工前直接告诉你,而不是先接单再说。

需要登录才能看到的内容、有反爬法律风险的源、个人隐私数据 —— 这几类不接。

怎么开始

  1. 说明需求。目标站点、要哪些字段、数据量、交付格式。
  2. 24 小时内给你固定报价。含工期,不满意可以不做。
  3. 样本试跑。你验收小批量数据,通过后再跑全量。