Bright Data CLI 实战教程:一行命令抓取 Amazon、LinkedIn 任意网站数据(2026 完整指南)

一、引言

如果只需要在终端里敲一行命令,就能抓取 AmazonLinkedIn任意网站的数

据,而且永远不用担心被封禁*------*你愿意试试吗?

大多数开发者认为网页抓取是一套繁琐流程:配置代理、搭建爬虫框架、处理 CAPTCHA、

解析输出。Bright Data CLI 将这一切压缩进了几条终端命令。本文是一篇手把手实战教

程,演示如何在终端中抓取真实网站、从 40+ 平台提取结构化数据,乃至控制远程浏览器

------全部通过 Bright Data CLI 完成,无需搭建任何基础设施。

无需搭建代理,无需维护浏览器,一行命令即可开始网页数据采集。

👉 立即免费体验 Bright Data CLI


二、Bright Data CLI 是什么?

Bright Data 是一个网络数据平台,帮助用户收集、处理和扩展对公共网络数据的访问。它支持 120+ 主流网站的数据采集模板,并可通过 Scraper Studio 为任意网站创建 AI Scraper。让用户可以专注于使用数据,而非构建和维护爬虫基础设施。而Bright Data CLI 是封装了整个 Bright Data 平台的官方 npm CLI 工具。Bright Data CLI 可以爬取网站、搜索网络、从40+平台提取结构化数据,并从终端管理你的Bright Data账户。

核心价值:零配置、自动代理、CAPTCHA 自动处理、JSON 结构化输出

免费额度:每月5000 Credits,无需信用卡,具体 Credits 与可调用产品范围可能随官方政策调整,请以官方控制台显示为准。

安装命令:npm 方式 vs. curl 一键安装脚本


三、安装与配置

通过 npm 或 curl 安装 Bright Data CLI,并在 1 分钟内用 API 密钥认证你的账户,包含设置验证命令。

1.安装CLI

运行 Bright Data CLI 最快的方式是 ,它执行最新版本且无需全局安装:npx

bash 复制代码
npx -p @brightdata/cli brightdata --version

在这些文档中的任何命令前都加上一个,让它以同样的方式运行,无需维护全局依赖。Bright Data 的 CLI 要求 Node.js 20 或更晚。npx -p @brightdata/cli 为了获得持久命令和更快的启动,建议全局安装CLI:brightdata

验证全局安装:

bash 复制代码
brightdata --version

2.认证

运行登录命令连接您的 Bright Data 账户:

bash 复制代码
brightdata login

这会打开你的浏览器以实现安全的OAuth认证。完成后,CLI:

  1. 验证并存储您的API密钥

  2. 自动创建所需的代理区(,cli_unlockercli_browser)

  3. 设置合理的默认值,让你能立即开始


3.替代认证方法

无头/SSH环境:

当没有浏览器时,使用设备流程:

bash 复制代码
brightdata login --device

这会打印一个网址和一个代码。在任何设备上打开URL,输入代码,CLI即可完成认证。

直接API密钥

对于CI/CD管道或非交互式环境,直接传递你的API密钥:

bash 复制代码
brightdata login --api-key YOUR_API_KEY

你可以在明亮数据控制面板.

环境变量

要完全跳过登录步骤,可以设置环境变量 :BRIGHTDATA_API_KEY

bash 复制代码
export BRIGHTDATA_API_KEY=YOUR_API_KEY

这对 Docker 容器、GitHub Actions 及其他自动化环境非常有用。


4.交互式设置向导

首次体验时请使用初始化命令:

bash 复制代码
brightdata init

它一步步带你完成认证、区域选择和默认配置。

|-----------------------|---------------|
| 旗帜旗帜 | 描述 |
| --skip-auth | 如果已经登录,跳过认证步骤 |
| -k, --api-key <key> | 直接提供API密钥 |


5.核实你的设置

登录后,确认一切正常:

bash 复制代码
# Check your configuration brightdata config 
# Verify API connectivity brightdata budget 
# Try a quick scrape brightdata scrape https://example.com

6.配置存储在哪里

CLI将凭据和配置存储在本地:

|-------|------------------------------------------------|
| 操作系统 | 路径 |
| macOS | ~/Library/Application Support/brightdata-cli/ |
| Linux | ~/.config/brightdata-cli/ |
| 窗户 | %APPDATA%\brightdata-cli\ |

会创建两个文件:

|------------------|------------|-------------|
| 档案 | 目的 | 权限 |
| credentials.json | API密钥 | 0o600(仅限业主) |
| config.json | 区域、输出格式、偏好 | 标准 |

完成安装后,不妨立即运行第一个 Scraper。

只需几分钟,即可体验从网页到 JSON 的完整数据采集流程。

👉 免费创建 Bright Data 账号


四、一句话实现抓取可用数据

Bright Data CLI 是调用 Bright Data 平台能力的命令行工具,而 Scraper Studio 是用于创建 AI Scraper 的可视化平台。CLI 可以调用由 Scraper Studio 创建的 Scraper,实现自动化运行。

使用 Bright Data CLI,可以通过一条命令运行已创建的 Scraper,并输出结构化 JSON、CSV 或 XLSX 数据。

我们选择 Amazon 的 电脑 检索结果页,并将数据锁定"价格"前十的数据。


1.先明确采集范围

进入 Scraper Studio 后,先粘贴目标页面地址,再用自然语言描述需要的数据。这里不能只写"抓取 电脑",还要把字段、排除条件和缺失值规则说清楚。

本次使用的提示词为:

抓取当前 Amazon 搜索结果页中与 电脑 相关的商品,价格前十的电脑,提取商品标题、价格、评分、评论数量和详情页链接。


2.检查 AI 生成的数据结构

提交需求后,系统会先识别页面类型,再生成输出 Schema。这里展示的并不是一段难以判断对错的代码,而是每条数据最终应包含的字段,例如商品标题、价格、评分、评论数量和商品链接,并附带页面中的实际样例。

这一步值得认真检查。标题和链接通常比较直观,价格、评分和评论数则需要留意数据类型。价格可能同时包含数值和币种,评论数可能带有千位分隔符,部分商品还可能缺少某个字段。字段结构确认得越清楚,后续导出的数据越容易直接使用。

系统还会生成输入参数,例如目标网址和搜索关键词。这样一来,同一套采集规则可以继续用于结构相似的页面,而不必每次重新创建任务。


3.生成 Scraper,并用真实结果验证

确认字段后,系统开始生成采集逻辑。完成后,用户可以进入运行页面填写本次采集的网址,也可以通过批量输入处理更多页面。

真正需要关注的,并不是"生成成功"这几个字,而是实际结果是否符合最初的需求。运行完成后,商品标题、价格、评分、评论数量和详情链接会被整理为独立字段,原本分散在商品卡片中的信息,也因此变得更适合筛选和分析。

结果可以下载为 JSON、CSV、NDJSON 或 XLSX。对于开发者,JSON 更方便接入后续程序;对于需要直接查看和筛选数据的业务人员,CSV 或 XLSX 会更直观。


打开导出的表格后,可以看到原本分散在 Amazon 商品卡片中的信息已经按列排列。除了核心字段,结果中还保留了输入网址、警告和错误信息,方便后续定位异常数据。

采集结果除了可以下载为 JSON、CSV、NDJSON 和 XLSX,还可以设置交付方式。当前界面提供 Amazon S3、Google Cloud Storage、Azure、SFTP、Google Pub/Sub、阿里云 OSS 和 API 下载等选项,也可以通过电子邮件或 Webhook 接收任务完成通知。


五、Self-Healing:让爬虫维护不再从头开始

爬虫真正难维护的地方,通常不是第一次抓到数据,而是目标网站之后发生的变化。页面层级调整、CSS 类名修改,或原有字段被新的组件替换,都可能让已经运行稳定的任务突然返回空值。传统做法往往需要重新检查页面结构、定位失效的选择器,再手动修改代码并完成测试。

例如,某电商网站原本将商品标题放在:

html 复制代码
<h2 class="title">

改版后调整为

html 复制代码
<h3 class="product-title">

对于依赖 h2.title 的传统 Scraper 来说,页面仍然可以正常打开,但商品标题字段可能已经无法提取。开发者需要重新分析 DOM,找到新的节点和类名,再修改解析规则。

Scraper Studio 的 Self-Healing 正是用来处理这类变化。用户可以描述失效字段或页面调整,AI 会根据当前页面重新生成受影响的解析逻辑,并在原有 Scraper 上完成修改,而不是重新开发整个项目。修复结果仍需经过预览和数据检查,确认字段与实际页面对应后再发布。

对于长期运行的价格监控、商品追踪或市场数据任务,自愈能力的价值不只是"自动改一行代码",而是缩短从发现异常到恢复采集的时间,让原有任务在网站改版后仍能继续使用。

如果你已经厌倦频繁修改 XPath、CSS Selector 或处理网站改版,不妨亲自体验 Scraper Studio 的 Self-Healing 功能。👉免费体验 AI 自愈 Scraper


六、定时调度与数据交付:让采集结果持续更新

一次抓取只能回答"现在是什么情况",而价格监控、库存追踪等任务更关心数据如何持续变化。Scraper Studio 可以在采集器发布后设置每日、每周或自定义周期运行。例如,将前面的 Amazon 商品任务安排在每天夜间执行,新结果便会按照固定频率更新,无需人工反复进入后台启动。

结果可按使用场景输出为 JSON、NDJSON、CSV、XLSX 或 Parquet:程序处理更适合 JSON,业务人员查看可选择 CSV 或 XLSX,大批量数据则可使用 Parquet。采集完成后,文件还能发送至 Webhook、Amazon S3、Google Cloud Storage、Azure、SFTP 等位置,或通过 API 下载,让商品价格从网页直接进入存储和分析流程。(Bright Data Docs)


七、通过 CLI 或 API 接入自动化流程

控制台更适合创建、调试和检查 Scraper;当任务进入长期运行阶段,CLI 和 API 的价值才会真正体现出来。它们可以把采集任务接入现有系统,由程序根据业务条件自动触发,而不必依赖人工登录后台操作。

Scraper Studio 可以作为企业数据管道中的一个采集节点,通过 API 自动启动任务,并将返回的 JSON 数据继续送入 ETL、BI 看板、AI Workflow 或 RAG 系统。这样,网页数据不再停留在"下载一个文件"的阶段,而是能够直接参与后续清洗、分析、检索和模型调用。

例如,开发者可以先通过 CLI 创建 Scraper,再读取返回的 collector_id 触发运行:

bash 复制代码
brightdata scraper create <url> \ "提取商品标题、价格、评分和评论数量" \ -o create.json COLLECTOR_ID=$(jq -r '.collector_id' create.json) brightdata scraper run "$COLLECTOR_ID" <url>

对于已经创建好的 Scraper,也可以直接通过 REST API 调用,并把这一步写入定时任务、CI/CD 流水线或内部数据服务。相比在控制台中手动启动,API 接入更适合批量网址、周期更新和多系统协同的场景。


八、竞品对比表


九、使用场景与业务价值

抓取任何网站

获取干净的标记、HTML、JSON或截图,包含任何URL的截图------包括反机器人绕过和JS渲染。

搜索网络

查询Google、必应或Yandex,获得结构化的结果,包含自然列表、广告和"人也问"。

与AI一起发现

AI驱动的网页发现------通过意图查找、排名并提取内容,并带有相关性评分。

提取结构化数据

从亚马逊、LinkedIn、Instagram和TikTok等40+平台上获取产品详情、资料、评论等内容。

控制浏览器

使用带有持久状态的真实远程浏览器会话,导航、点击、输入、截图和阅读页面。

增强AI代理

安装技能或将Bright Data的MCP服务器添加到Claude Code、Cursor、Codex及其他AI编码代理中。

管理分区和预算

列出代理区,检查配置,监控账户余额和各区成本。

管理分区和预算

列出代理区,检查配置,监控账户余额和各区成本。


十、常见问题 FAQ

Bright Data CLI 的常见问题解答和故障排除:brightdata 和 bdata 的别名、认证、安装问题以及抓取器常见错误。

(1)用 Bright Data CLI 抓取网站合法吗?

是否合法取决于目标网站的使用条款、当地法律法规以及数据用途。Bright Data 提供的是公共网页数据访问工具,建议仅采集公开可访问的数据,并遵守目标网站的 Terms of Service。

(2)免费额度会过期吗?

你存储的API密钥不再有效。重新认证:

bash 复制代码
brightdata login

(3) 触发限速后怎么办?

你已经达到你所在区域的速率上限了。选项:

等一下,再试一次

用于大型作业以避免阻塞--async

请联系你的账户经理以提高额度

(4) 能在 CI/CD 流水线中使用吗?

是的。该CLI完全支持管道友好。当stdout不是TTY时,颜色和旋转器会自动被禁用。用于机器可读输出,环境变量用于非交互式认证。--jsonBRIGHTDATA_API_KEY

(5)Bright Data CLI 支持哪些浏览器自动化框架?

Browser API 支持 Puppeteer、Playwright 与 Selenium,可通过 CLI 管理和调用。

(6)Bright Data CLI 能抓取 Google 搜索结果吗?

可以,但建议使用 Bright Data SERP API,而不是直接通过代理访问 Google,以获得更高成功率。


十一、总结 + CTA

网页采集的难点,从来不只是把数据抓下来,更在于能否长期稳定运行。Bright Data Scraper Studio 将 AI 生成、云端运行、自愈修复、定时调度和数据交付整合到同一套流程中,让团队不必反复处理服务器、代理和脚本维护等基础工作。

对于需要持续获取公开网页数据的团队,Scraper Studio 更适合承担一条"长期运行的数据链路",而不是只解决某一次抓取任务。字段规则仍需根据业务目标确认,结果也要经过必要校验,但页面访问、运行调度和数据交付这些重复环节可以被统一管理。团队因此能把精力更多放在数据是否有用、如何进入后续分析,而不是反复处理采集环境和脚本故障。

如果你的目标是建立稳定、长期运行的数据采集系统,而不是不断修复失效的爬虫,如果你希望将网页数据采集从"一次性脚本"升级为"长期稳定的数据管道",Bright Data CLI 与 Scraper Studio 可以帮助你快速完成整个流程。

无论是 Amazon 商品监控、LinkedIn 数据采集,还是 AI Agent 的实时网页访问,都可以在同一个平台完成。

👉立即免费开始使用 Bright Data CLI ,体验无需维护代理、浏览器和反爬逻辑的现代 Web Scraping 工作流。

相关推荐
程序员洲洲9 个月前
使用亮数据爬虫API一键式爬取Facebook数据
大数据·数据·亮数据·bright data·爬虫api
是店小二呀10 个月前
整合亮数据Bright Data与Dify构建自动化分析系统
大数据·自动化·dify·mcp·bright data
wei_shuo1 年前
使用 Bright Data Web Scraper API + Python 高效抓取 Glassdoor 数据:从配置到结构化输出全流程实战
python·亮数据·bright data·web scraper api
fanstuck1 年前
AI 数据采集实战指南:基于 Bright Data 快速获取招标讯息
服务器·人工智能·php·亮数据·bright data
ζ小菜鸡1 年前
我用Deepseek + 亮数据爬虫神器 1小时做出輿情分析器
爬虫·bright data
程序员洲洲1 年前
探索亮数据Web Unlocker API:让谷歌学术网页科研数据 “触手可及”
亮数据·web unlocker·web scraper·serp api·bright data