跳转至

Scrape Web 网页正文内容爬取与文本提取节点

节点核心功能 (What is it?)

Scrape Web 节点是一个实用的网络爬虫工具,允许创作者通过指定目标 URL 地址,自动抓取并提取目标网页中的主体正文文本。

典型适用场景 (When would I use it?)

在以下情况下使用该节点:

  • 从特定网站的公开网页中提取正文文稿;
  • 抓取新闻报道、技术博客或在线百科资讯;
  • 为 downstream AI 模型构建实时网络数据源或外部知识库;
  • 实现全自动化的网页内容定时监控与抓取管线。

使用指南 (How to use it)

基础配置流程 (Basic Setup)

  1. 在工作流画布中添加 Scrape Web 节点。
  2. 配置待抓取目标页面的 URL 参数。
  3. 将提取出的正文输出引脚连接至需要消费网页内容的下游节点(例如 Agent 或 SummarizeText)。

参数输入插槽 (Parameters)

  • url:待抓取网页的完整网络访问地址(string,例如 "https://example.com/article")。

输出引脚 (Outputs)

  • output:从目标网页中解析提取出的纯文本字符串工件(已自动剥离无用 HTML 标签与脚本冗余)。

典型工作流示例 (Example)

从指定科技新闻页面抓取报道并自动生成简报:

  1. 在画布中添加一个 Scrape Web 节点。
  2. 将 url 参数设置为目标科技资讯文章地址。
  3. 将 Scrape Web 的 output 输出引脚连接至 SummarizeText 节点的 text 输入插槽。
  4. 即可全自动完成从网络爬取到 AI 自动提炼核心要点的完整链路。

实现细节 (Implementation Details)

Scrape Web 节点底层集成了专业的网页抓取与 DOM 解析能力。能够智能定位网页的核心内容区块,自动过滤广告、导航栏与脚本噪音,并内置了完备的网络超时与异常容错机制,确保网络抖动时不中断整个工作流。