Fetch 网页内容抓取 MCP 服务器 (Fetch MCP Server)
Fetch MCP Server 为 AI 智能体赋予了对互联网页面的即时抓取与语义解析能力。它能够自动将抓取到的复杂 HTML 文档精炼转换为整洁的 Markdown 格式,消除冗余标签与脚本干扰,非常适用于自动化调研、竞品监控、长文本提炼与网页信息爬取。
安装与配置流程 (Installation)
- 打开 Griptape Nodes,进入 Settings → MCP Servers;
- 点击 + New MCP Server;
-
配置各项参数:
- Server Name/ID:
fetch - Connection Type:
Local Process (stdio) - Configuration JSON:
{ "transport": "stdio", "command": "uvx", "args": ["mcp-server-fetch"], "env": {}, "encoding": "utf-8", "encoding_error_handler": "strict" } - Server Name/ID:
-
点击 Create Server 完成创建。
提供的可用工具集 (Available Tools)
fetch— 根据传入的 HTTP/HTTPS URL 抓取网页源码,并自动将其重构转换为结构清晰的 Markdown 格式文本返回给智能体。
深度调优配置选项 (Configuration Options)
你可以通过在 env 字典中注入环境变量,精细化定制抓取客户端的请求行为:
{
"transport": "stdio",
"command": "uvx",
"args": ["mcp-server-fetch"],
"env": {
"FETCH_TIMEOUT": "30000",
"FETCH_USER_AGENT": "MyApp/1.0",
"FETCH_MAX_SIZE": "10485760"
},
"encoding": "utf-8",
"encoding_error_handler": "strict"
}
可用环境变量说明
FETCH_TIMEOUT— 单次 HTTP 请求的响应超时时间,单位为毫秒(默认值:30000,即 30 秒);FETCH_USER_AGENT— 发起请求时随 Header 发送的 User-Agent 客户端指纹标识(默认值:mcp-server-fetch);FETCH_MAX_SIZE— 允许读取的单个页面最大响应字节数(默认值:10485760字节,即 10MB)。
常见疑难排查 (Troubleshooting)
服务未响应或挂起 (Server Not Responding)
- 检查当前宿主机的互联网连接状态;
- 在普通浏览器中手动粘贴该 URL,排查该站点是否处于停机维护状态;
- 先使用简单的静态页面(如
https://example.com)测试服务连通性。
无法提取页面内容 (Content Not Loading)
- 目标站点可能存在严格的 Cloudflare 或反爬虫防护;
- 尝试通过
FETCH_USER_AGENT将其伪装为常见的桌面级浏览器 User-Agent; - 检查该站点是否需要账号登录或特定 Cookie 鉴权。
请求频繁超时 (Timeout Errors)
- 将
FETCH_TIMEOUT调整增大(例如增加至60000毫秒); - 优先抓取内容紧凑的页面,避开包含超大媒体资源的超长重型单页。
非法 URL 报错 (Invalid URLs)
- 确保传入的网址包含完整的网络协议头(必须显式携带
http://或https://); - 检查是否存在特殊字符未经过 URL 编码的问题。