Scrape Web 网页正文内容爬取与文本提取节点
节点核心功能 (What is it?)
Scrape Web 节点是一个实用的网络爬虫工具,允许创作者通过指定目标 URL 地址,自动抓取并提取目标网页中的主体正文文本。
典型适用场景 (When would I use it?)
在以下情况下使用该节点:
- 从特定网站的公开网页中提取正文文稿;
- 抓取新闻报道、技术博客或在线百科资讯;
- 为 downstream AI 模型构建实时网络数据源或外部知识库;
- 实现全自动化的网页内容定时监控与抓取管线。
使用指南 (How to use it)
基础配置流程 (Basic Setup)
- 在工作流画布中添加 Scrape Web 节点。
- 配置待抓取目标页面的 URL 参数。
- 将提取出的正文输出引脚连接至需要消费网页内容的下游节点(例如
Agent或SummarizeText)。
参数输入插槽 (Parameters)
- url:待抓取网页的完整网络访问地址(
string,例如"https://example.com/article")。
输出引脚 (Outputs)
- output:从目标网页中解析提取出的纯文本字符串工件(已自动剥离无用 HTML 标签与脚本冗余)。
典型工作流示例 (Example)
从指定科技新闻页面抓取报道并自动生成简报:
- 在画布中添加一个 Scrape Web 节点。
- 将
url参数设置为目标科技资讯文章地址。 - 将 Scrape Web 的
output输出引脚连接至SummarizeText节点的text输入插槽。 - 即可全自动完成从网络爬取到 AI 自动提炼核心要点的完整链路。
实现细节 (Implementation Details)
Scrape Web 节点底层集成了专业的网页抓取与 DOM 解析能力。能够智能定位网页的核心内容区块,自动过滤广告、导航栏与脚本噪音,并内置了完备的网络超时与异常容错机制,确保网络抖动时不中断整个工作流。