如何用Dataify一键提取亚马逊商品结构化数据
1、背景
我司计划在海外电商平台亚马逊采购一批电脑显示器。采购部门给出的核心指标为 4K 分辨率 和 100Hz 刷新率,但其他需求较为模糊,缺乏明确的市场定位参考。
为辅助采购决策,技术部门需要采集市场上主流显示器的价格、配置、评分等结构化数据。然而,电商数据采集面临以下核心挑战:
页面结构复杂:电商页面并非规范的静态 HTML,核心数据(价格、库存、评分等)通常由 JavaScript 动态注入,DOM 结构碎片化且异步加载。
反爬机制严格:高频访问会触发验证码、IP 封禁等防护机制。
维护成本高:基于正则或 CSS 选择器的硬编码解析规则,在页面结构变更后需要人工修复,技术债沉重。
如果选择自建爬虫方案,还需额外投入代理轮换、浏览器指纹模拟、验证码识别、动态渲染等工程能力,开发和运维成本较高。
Dataify 是一款数据采集服务平台,其核心思路是将网页解析交由智能识别引擎处理。开发者只需调用网页采集 API,页面理解、反爬对抗、动态渲染、结构化输出等环节均由平台自动处理,使团队能够将精力集中于数据本身。
2、实践演示:从混乱 HTML 到干净表格
需求确认
数据目标: 通过亚马逊平台,搜索关键词4K + 100hz显示屏,提取前20页的显示屏产品数据;产品数据关键指标:商品标题、品牌、价格、评分,配置,描述信息等
技术选型
在此完成需求之前,先让我们看了解亚马逊商品信息网页展示的技术方案:
作为电商巨头,为了应对巨量的访问量和恶意的数据爬取
亚马逊商品页面的核心数据由 JavaScript 动态注入,DOM 结构碎片化,价格、库存、评分常常嵌套在多层 div 里异步加载。
而非直接嵌入HTML源码,传统的静态解析方案无法触发这些异步加载请求
因此,有效的数据抓取工具必须具备完整的浏览器环境模拟能力,以执行页面脚本并捕获真实内容
目前我们有两种方案:
1.自建脚本/正则匹配
2.Dataify API模式
立即体验:https://dataify.com?utm_source=rabcdxbb&utm_term=01
最小方案验证
我们先选定一个商品URL,分别以上面两种方案来进行提取数据
https://www.amazon.com/-/zh/dp/B0C8ZKV5R9/ref=sr_1_1?__mk_zh_CN=%E4%BA%9A%E9%A9%AC%E9%80%8A%E7%BD%91%E7%AB%99&crid=2W0DTAFLXTOYZ&dib=eyJ2IjoiMSJ9.IZHGd1goaPpPUHpUx1qGs3S9kSyl-JEBCOXPYkw1dRgSvQ3aU_UWVPK0dHU9qkguMC4kgbVjGn-vR8wnkOBTnjsH_aSJgQ_g0jznl8lW55uzdcTa07csrwMUs1euoUsZM47nXsVQkANGEVMyDIW2AytfmMk0K3_dVhE1cNFov5_nu-KhC8sQuIMs29dUslqC4UcwZXtoJfl95yAOmQEZdetRRY-niPzbVjiblAbCkN4.CfZA6cN_g97uzTMogbPu93cD2pn-vDwCeQx4Bpwo8HI&dib_tag=se&keywords=%E6%98%BE%E7%A4%BA%E5%99%A8&qid=1783844180&sprefix=xain%2Bshi%2Bq%2Caps%2C377&sr=8-1&th=1

核心信息:Philips 飞利浦 24寸 、100HZ、现价S$96.86 市场价: S$116.26、平均评级:4.6 星
自建脚本/正则匹配
我们写了一个基于 Node.js + Puppeteer 的脚本 amazon_crawler.cjs。
它的核心思路很简单:用无头浏览器加载亚马逊商品页,等 JavaScript 渲染完成后,通过 HTML 选择器解析 DOM 读取标题、价格、评分、库存、图片等信息;URL 里的 ASIN 则通过正则匹配 /dp/XXXXXXXXXX 提取。
- 核心代码
// 1. 等页面核心元素渲染出来
await page.waitForSelector("#productTitle");
// 2. 在页面上下文中用 CSS 选择器提取字段
const data = await page.evaluate(() => {
const title = document.querySelector("#productTitle")?.innerText.trim();
const price = document
.querySelector(".a-price .a-offscreen")
?.innerText.trim();
const rating = document
.querySelector('span[data-hook="rating-out-of-text"]')
?.innerText.trim();
return { title, price, rating };
});
// 3. 用正则从 URL 提取 ASIN
const asin = url.match(/\/dp\/([A-Z0-9]{10})/)?.[1];
为了降低被反爬识别概率,脚本还配合了 puppeteer-extra-plugin-stealth 并覆盖 navigator.webdriver、plugins 等自动化指纹。
运行方式:node amazon_crawler.cjs,结果会输出到 amazon_product_result.json。

虽然是英文,但是可以看到提取数据吻合核心信息
证明可行
问题也很明显由于过多的策略,导致这个脚本非常臃肿
特别是在数据提取上很多的死策略,必需为指定每个数据指标的编写提取策略
工作量巨大,且不够灵活,无法应对亚马逊高频次的网页结构变化
只能短期使用
Dataify网页采集API

Dataify 在"网页采集商店"里已经内置了专门针对亚马逊的采集工具。以"Amazon 产品详情采集工具-通过URL采集"为例,进入工具后只需要做三件事:
- 填入目标商品 URL;
- 设置邮政编码(例如 94107),用于获取对应地区的配送与价格信息;
- 点击"运行请求"。
平台会自动生成对应的 Node.js / Python 调用示例,右侧代码片段里可以看到请求地址、spider_name、spider_id、spider_parameters 等核心参数。整个过程中不需要写任何 HTML 解析规则,也不需要处理动态渲染和反爬问题。
该工具按量计费,当前价格为 ¥8.00 / 1,000 条结果,采集失败不扣费。

提交任务后,可以在"任务列表"页面统一查看执行状态。从图中可以看到本次演示创建的 3 个任务:
列表中同时出现了成功和失败的任务。失败任务结果数为 0,消耗显示为 ¥0.00,说明 Dataify 确实是"不成功不收费"。
成功任务会显示"下载"按钮,提供了JSON、CSV、XLSX格式。
下载第一个任务的数据看看

可以看到其中包含了 商品名称title,品牌brand、描述description、价格final_price、评论数reviews_count,评分rating等信息
这些数据指标都没有让我们自己配置
完全是Dataify平台内部的AI数据引擎帮我们处理的
可以看到返回的数据中也基本吻合最小验证商品的核心信息
较之自建脚本的方案,使用Dataify的方案整个过程流畅丝滑
当然在工作量大的情况,需要部分工作链路自动化
Dataify平台也提供了整套完善的API服务
具体查看官网文档:新手指南文档 - Dataify
方案对比
下面从优势、劣势和维护成本三个维度,把两种方案放在一起对比:
|
维度 |
正则 / 手写 HTML 解析 |
Dataify 网页采集 API |
|
核心原理 |
用固定规则匹配文本或 DOM 路径 |
智能识别引擎自动推断页面字段 |
|
初期成本 |
低,几行正则或选择器就能开始 |
低,注册后调用 API 即可,无需写规则 |
|
维护成本 |
高,页面 class、标签嵌套、加载顺序一变,规则就要重写 |
低,页面结构变化由平台自动适配 |
|
动态渲染 |
不支持,只能拿到初始 HTML,拿不到 JS 注入的数据 |
内置浏览器环境,可执行页面脚本并捕获异步加载内容 |
|
反爬能力 |
需自行解决代理、指纹、验证码等问题 |
平台内置代理轮换、指纹模拟、验证码识别 |
|
数据质量 |
规则失效时容易丢字段或拿到脏数据 |
返回统一格式的结构化 JSON,字段完整 |
|
数据格式 |
要手动处理转化提取后的数据,转为json或者excel |
平台就自动提供json、csv、xlsx格式 |
|
适用场景 |
页面结构稳定、字段极少的小型任务 |
电商监控、竞品分析、规模化数据采集 |
从选型分析来看
自建正则/HTML解析的方案,收到的限制较多,仅适用目标网页模版固定的数据获取
且编写脚本代码的工作量巨大,需要每个数据指标编写对应的提取策略(哭死)
而Dataify网页采集API在绝大部分场景都能很好的适配
3、Dataify 核心优势
Dataify 的核心价值在于把“理解网页”和“对抗反爬”这两件最耗时的事交给平台,开发者只需关注要什么数据。
- 智能识别引擎:不用写正则或 CSS 选择器,平台自动识别商品标题、价格、评分、库存、描述等字段,页面结构变化也能自动适配。
- 一站式反爬基建:内置代理轮换、浏览器指纹模拟、验证码识别和动态渲染能力,不需要自己维护 Puppeteer 和代理池。
- 开箱即用:覆盖 120+ 主流网站、20+ 内置采集模板,按量计费,采集失败不收费,适合从小规模验证到大规模监控。
- 产品矩阵延伸:除了网页采集,还提供视频采集 API、搜索引擎 API(Google/Bing/Yandex 等),方便把数据能力拓展到更多场景。
4、总结与成本对比
从这次显示器采集需求来看,两种方案的总拥有成本(TCO)差异很明显:
|
维度 |
正则 / 手写解析 |
Dataify 网页采集 API |
|
配置方式 |
每个字段写选择器或正则 |
填入 URL,自动识别字段 |
|
维护成本 |
页面一改就需人工修复 |
平台自动适配页面变化 |
|
反爬与稳定性 |
需自行解决代理、验证码、渲染 |
平台一站式兜底 |
|
数据产出 |
需二次清洗、转格式 |
直接输出 JSON / CSV / XLSX |
如果只是临时抓几条数据,自建脚本可以快速验证;但面对亚马逊这样结构高频变化、反爬严格的平台,Dataify 能让团队把精力放在数据分析而不是修爬虫上。感兴趣可以直接注册 Dataify,领取免费积分,体验从混乱 HTML 到干净结构化数据的“一键魔法”。
更多推荐


所有评论(0)