Wigolo:开源本地网页检索MCP工具,零密钥免费爬虫适配AI智能体

AI新闻 dotaai
62

一、Wigolo 是什么

Wigolo 是开源本地优先网页检索与爬虫MCP工具,基于 Node.js 开发,专为各类AI智能体、代码编辑器AI助手打造,核心实现零API密钥、全本地运行、无云端计费的网页搜索、抓取、全站爬取、网页信息提取能力。

项目遵循 MCP 标准协议,同时提供 REST 接口、Python/TypeScript SDK,无需依赖 Tavily、Firecrawl 这类付费云端搜索服务,所有网页缓存、语义向量、浏览器渲染引擎全部存储在本地设备,检索原始数据不会上传第三方服务器,兼顾隐私安全与零使用成本,适配本地开发、私有化AI代理、离线资料调研等场景,当前处于公开Beta版本,支持 Windows、macOS、Linux 全平台部署。

Wigolo:开源本地网页检索MCP工具,零密钥免费爬虫适配AI智能体

二、功能特色

  1. 多引擎融合本地搜索
    内置18套公共搜索引擎聚合检索,搭配本地轻量化机器学习模型完成结果重排序,支持批量并行查询、域名黑白名单、时间范围筛选,无调用次数上限,重复查询依靠本地缓存秒级返回结果。

  2. 全类型网页智能抓取
    自动适配静态页面、SPA单页应用、PDF文档,内置无头浏览器自动处理动态渲染、反爬拦截;支持页面滚动、点击交互、网页截图,分层抓取策略平衡速度与兼容性。

  3. 全站合规爬取
    提供BFS/DFS两种爬取模式,自动解析站点地图,严格遵循 robots.txt 协议,单域名访问限流、重复内容自动去重,可限定爬取深度与页面数量。

  4. 结构化数据提取
    自定义 JSON Schema 模板,自动提取网页元数据、表格、商品信息、文章正文、JSON-LD 结构化数据,输出标准化结构化内容供给AI处理。

  5. 本地混合持久缓存系统
    采用关键词+语义向量双索引存储所有访问页面,支持离线翻阅历史网页、对比页面版本差异、定时监控网页内容变更,缓存文件统一存放于本地 ~/.wigolo/ 目录。

  6. AI自主深度调研工具
    内置 research、agent 两大高级工具,可自动拆解复杂问题、多轮检索汇总、生成附带原文引用的完整调研报告;仅内容总结环节可选接入外部LLM,无LLM密钥也可正常使用基础检索抓取功能。

  7. 多标准接入兼容
    原生支持 MCP stdio 协议对接 Cursor、Claude Code、VS Code、Windsurf 等编辑器AI;提供独立 REST HTTP 服务、官方 TS/Python SDK,兼容 LangChain、CrewAI、LlamaIndex 主流AI框架。

  8. 页面差异对比与变更监控
    diff 工具比对网页历史缓存版本文字与结构差异;watch 工具定时轮询目标站点,内容发生变动后可通过 Webhook 推送变更通知。

三、技术细节

  1. 基础运行环境
    底层基于 Node.js ≥20 版本开发,整体代码 94.8% 使用 TypeScript 编写,内置完整测试用例7600+;本地资源包总占用磁盘约1.5GB,包含内置无头浏览器、本地嵌入模型、重排序机器学习模型。

  2. 核心运行架构

  • 上层接入层:MCP 标准输入输出、REST API、多语言SDK、第三方AI框架适配包;

  • 工具调度层:统一封装 search、fetch、crawl、extract、cache 等十大核心工具;

  • 核心底层模块:多搜索引擎聚合调度、自适应分层抓取路由、本地向量+关键词混合存储库、端侧轻量化AI模型推理;

  • 可选扩展层:外部大模型对接接口(仅用于报告生成,非基础功能必需);

  • 网络出口:直连公网网页,内置爬虫限流、UA轮换、反爬兼容策略。

  1. 存储机制
    所有网页原始HTML、文本、截图、语义向量缓存保存在用户本地隐藏目录,不经过第三方云端中转;缓存支持手动清理、按时间过期清理、单站点缓存删除。

  2. 部署分发方式
    提供多渠道分发方案:NPM 一键运行 npx 命令、Python PyPI SDK、Docker 容器镜像、MCP 官方应用市场、Homebrew 包管理器,支持单机本地运行与远程私有化自托管。

  3. 开源协议约束
    AGPL-3.0-only 协议,个人本地免费无限制使用;若修改项目源码并对外提供网络服务,必须开源全部修改后的代码;商业企业闭源私有化部署可单独申请商业授权。

四、应用场景

  1. 编程开发场景
    搭配 Cursor、Claude Code、VS Code AI 助手离线检索开发文档、API 接口资料、技术解决方案,替代付费云端搜索工具,消除API调用费用。

  2. 自研AI智能体开发
    接入 LangChain、CrewAI、LlamaIndex 等AI框架,为本地Agent低成本赋予网页联网检索、资料深度调研能力。

  3. 私有化企业离线调研
    企业内网私有化部署,业务资料、检索网页数据全程本地留存,禁止敏感数据外流出内网,满足数据隐私合规要求。

  4. 自动化网页监控采集
    定时监控行业资讯、商品价格、公告页面,自动抓取变更内容,搭配Webhook推送数据用于自动化工作流。

  5. 合规轻量化数据采集
    小规模站点结构化数据抓取,提取文章、商品、表格数据,遵循爬虫规范,适合个人数据分析、内容整理需求。

  6. 离线资料回溯查阅
    依靠本地缓存,断网后可查看历史检索过的全部网页内容,支持对比页面历史更新记录。

anatomy

五、使用方法

1. 一键初始化绑定编辑器AI(推荐新手)

终端执行命令,自动下载浏览器与本地AI模型,生成对应MCP配置文件,一键对接主流编码助手:

npx wigolo init --agents=claude-code,cursor

附加参数说明:

  • --interactive:交互式配置向导,手动选择需要对接的AI客户端;

  • --no-warmup:延迟下载本地模型与浏览器,减少首次启动耗时。

2. 环境状态检测与卸载

# 检测本地组件、缓存、依赖完整度
npx wigolo doctor
# 完整卸载所有缓存、资源、配置文件
npx wigolo config --uninstall --yes

3. 接入外部LLM(仅高级调研功能需要)

仅 research、agent 自动总结报告功能依赖大模型,无密钥不影响基础搜索抓取,以 Gemini 为例配置环境变量:

export WIGOLO_LLM_PROVIDER=gemini
export GEMINI_API_KEY=你的密钥

同时支持 Ollama、OpenAI 等主流大模型服务商。

4. 启动独立REST服务

wigolo serve

默认监听3333端口,自带 OpenAPI 接口文档,可被n8n、远程智能体、自有程序调用。

5. 框架SDK集成

  • TypeScript:npm 安装 wigolo-sdk 嵌入项目;

  • Python:pip install wigolo 快速调用检索、爬取工具;
    配套专用适配包:wigolo-langchain、wigolo-crewai 等,一键完成框架接入。

六、竞品对比

选取两款主流云端网页检索工具 Firecrawl、Tavily 与 Wigolo 对比:

对比维度 WigoloFirecrawl Tavily
运行部署模式 全本地设备运行 云端API服务 云端API服务
是否需要API密钥 基础功能无需密钥 必须申请付费密钥 必须申请付费密钥
使用计费规则 永久免费,无调用限额 按量阶梯收费 按量阶梯收费
本地网页缓存 完整本地持久缓存,支持离线查阅 无本地缓存,数据存储服务商云端 无本地缓存
网页原文字节级引用标注 支持,附带可信度评分 不支持 不支持
全站深度爬取功能 内置完整crawl工具 支持全站爬取 仅单页抓取,无全站爬取
数据隐私 所有检索数据本地存储,不上传第三方 网页内容上传服务商服务器 检索内容上传服务商服务器
MCP协议原生支持 原生适配,开箱即用 需第三方封装改造 需第三方封装改造
离线断网使用历史资料 完全支持 不支持 不支持

七、常见问题解答

Q:Wigolo 基础功能真的完全免费,存在隐藏收费吗?

A:不存在任何隐藏收费。项目浏览器、本地重排序、嵌入模型全部在本机运行,无云端服务器成本;AGPL开源协议禁止第三方将本项目封装为付费闭源服务,仅高级AI总结功能可选付费大模型密钥,不使用外部LLM不会产生任何费用。

Q:运行Wigolo需要占用多少本地存储空间?

A:完整资源包(内置浏览器+本地AI模型)占用磁盘约1.5GB,网页缓存占用空间由用户检索页面数量决定,缓存可随时手动清理释放空间。

Q:搜索引擎偶尔出现检索失败是什么原因,如何解决?

A:项目内置18个公共搜索引擎聚合调度,单一引擎访问限制、IP拦截会导致单源失效;多引擎容错机制会自动切换其他检索源,不影响整体查询结果,也可手动在配置中自定义新增搜索引擎接口。

Q:Wigolo爬取网页是否合规,会存在IP封禁风险吗?

A:工具默认遵循robots.txt爬虫协议,内置域名访问限流、UA轮换机制,定位为个人轻量化调研工具,不适合大规模批量抓取商业站点;若高频大量爬取站点,仍存在IP限制风险,建议合理控制爬取频率。

Q:没有大模型API密钥,Wigolo还能正常使用吗?

A:完全可以。搜索、抓取、爬取、缓存、页面对比等全部基础功能无需LLM密钥;仅自动生成完整调研报告的 research、agent 工具需要对接外部大模型,无密钥时仅返回原始网页素材。

Q:Wigolo支持在服务器Docker容器中私有化部署吗?

A:支持,官方提供标准Docker镜像,容器内可运行MCP服务或鉴权REST接口,适配企业内网私有化离线调研场景。

Q:缓存文件保存在哪个目录,如何手动删除缓存?

A:缓存、配置、模型资源统一存放于 ~/.wigolo/ 隐藏目录;可执行卸载命令一键清空,也可直接进入文件夹手动删除指定站点缓存文件。

八、相关链接

九、总结

Wigolo 是一套轻量化、隐私优先、零使用成本的开源本地网页检索爬虫MCP工具,依托本地浏览器与端侧AI模型替代付费云端检索服务,完整覆盖搜索、抓取、全站爬取、结构化提取、网页监控、离线缓存等全套网页调研能力,原生兼容主流AI编辑器与智能体开发框架,全平台可部署,数据全程本地存储不上传第三方,适合开发人员、AI开发者与有数据隐私需求的企业私有化使用,依靠开源模式免费开放全部核心功能,消除传统网页检索工具按量付费、数据云端留存的两大痛点。

打赏
THE END
作者头像
dotaai
正在和我的聊天机器人谈恋爱,它很会捧场。