Wigolo:开源本地网页检索MCP工具,零密钥免费爬虫适配AI智能体
一、Wigolo 是什么
Wigolo 是开源本地优先网页检索与爬虫MCP工具,基于 Node.js 开发,专为各类AI智能体、代码编辑器AI助手打造,核心实现零API密钥、全本地运行、无云端计费的网页搜索、抓取、全站爬取、网页信息提取能力。
项目遵循 MCP 标准协议,同时提供 REST 接口、Python/TypeScript SDK,无需依赖 Tavily、Firecrawl 这类付费云端搜索服务,所有网页缓存、语义向量、浏览器渲染引擎全部存储在本地设备,检索原始数据不会上传第三方服务器,兼顾隐私安全与零使用成本,适配本地开发、私有化AI代理、离线资料调研等场景,当前处于公开Beta版本,支持 Windows、macOS、Linux 全平台部署。

二、功能特色
多引擎融合本地搜索
内置18套公共搜索引擎聚合检索,搭配本地轻量化机器学习模型完成结果重排序,支持批量并行查询、域名黑白名单、时间范围筛选,无调用次数上限,重复查询依靠本地缓存秒级返回结果。全类型网页智能抓取
自动适配静态页面、SPA单页应用、PDF文档,内置无头浏览器自动处理动态渲染、反爬拦截;支持页面滚动、点击交互、网页截图,分层抓取策略平衡速度与兼容性。全站合规爬取
提供BFS/DFS两种爬取模式,自动解析站点地图,严格遵循 robots.txt 协议,单域名访问限流、重复内容自动去重,可限定爬取深度与页面数量。结构化数据提取
自定义 JSON Schema 模板,自动提取网页元数据、表格、商品信息、文章正文、JSON-LD 结构化数据,输出标准化结构化内容供给AI处理。本地混合持久缓存系统
采用关键词+语义向量双索引存储所有访问页面,支持离线翻阅历史网页、对比页面版本差异、定时监控网页内容变更,缓存文件统一存放于本地~/.wigolo/目录。AI自主深度调研工具
内置 research、agent 两大高级工具,可自动拆解复杂问题、多轮检索汇总、生成附带原文引用的完整调研报告;仅内容总结环节可选接入外部LLM,无LLM密钥也可正常使用基础检索抓取功能。多标准接入兼容
原生支持 MCP stdio 协议对接 Cursor、Claude Code、VS Code、Windsurf 等编辑器AI;提供独立 REST HTTP 服务、官方 TS/Python SDK,兼容 LangChain、CrewAI、LlamaIndex 主流AI框架。页面差异对比与变更监控
diff 工具比对网页历史缓存版本文字与结构差异;watch 工具定时轮询目标站点,内容发生变动后可通过 Webhook 推送变更通知。
三、技术细节
基础运行环境
底层基于 Node.js ≥20 版本开发,整体代码 94.8% 使用 TypeScript 编写,内置完整测试用例7600+;本地资源包总占用磁盘约1.5GB,包含内置无头浏览器、本地嵌入模型、重排序机器学习模型。核心运行架构
上层接入层:MCP 标准输入输出、REST API、多语言SDK、第三方AI框架适配包;
工具调度层:统一封装 search、fetch、crawl、extract、cache 等十大核心工具;
核心底层模块:多搜索引擎聚合调度、自适应分层抓取路由、本地向量+关键词混合存储库、端侧轻量化AI模型推理;
可选扩展层:外部大模型对接接口(仅用于报告生成,非基础功能必需);
网络出口:直连公网网页,内置爬虫限流、UA轮换、反爬兼容策略。
存储机制
所有网页原始HTML、文本、截图、语义向量缓存保存在用户本地隐藏目录,不经过第三方云端中转;缓存支持手动清理、按时间过期清理、单站点缓存删除。部署分发方式
提供多渠道分发方案:NPM 一键运行 npx 命令、Python PyPI SDK、Docker 容器镜像、MCP 官方应用市场、Homebrew 包管理器,支持单机本地运行与远程私有化自托管。开源协议约束
AGPL-3.0-only 协议,个人本地免费无限制使用;若修改项目源码并对外提供网络服务,必须开源全部修改后的代码;商业企业闭源私有化部署可单独申请商业授权。
四、应用场景
编程开发场景
搭配 Cursor、Claude Code、VS Code AI 助手离线检索开发文档、API 接口资料、技术解决方案,替代付费云端搜索工具,消除API调用费用。自研AI智能体开发
接入 LangChain、CrewAI、LlamaIndex 等AI框架,为本地Agent低成本赋予网页联网检索、资料深度调研能力。私有化企业离线调研
企业内网私有化部署,业务资料、检索网页数据全程本地留存,禁止敏感数据外流出内网,满足数据隐私合规要求。自动化网页监控采集
定时监控行业资讯、商品价格、公告页面,自动抓取变更内容,搭配Webhook推送数据用于自动化工作流。合规轻量化数据采集
小规模站点结构化数据抓取,提取文章、商品、表格数据,遵循爬虫规范,适合个人数据分析、内容整理需求。离线资料回溯查阅
依靠本地缓存,断网后可查看历史检索过的全部网页内容,支持对比页面历史更新记录。

五、使用方法
1. 一键初始化绑定编辑器AI(推荐新手)
终端执行命令,自动下载浏览器与本地AI模型,生成对应MCP配置文件,一键对接主流编码助手:
npx wigolo init --agents=claude-code,cursor
附加参数说明:
--interactive:交互式配置向导,手动选择需要对接的AI客户端;--no-warmup:延迟下载本地模型与浏览器,减少首次启动耗时。
2. 环境状态检测与卸载
# 检测本地组件、缓存、依赖完整度 npx wigolo doctor # 完整卸载所有缓存、资源、配置文件 npx wigolo config --uninstall --yes
3. 接入外部LLM(仅高级调研功能需要)
仅 research、agent 自动总结报告功能依赖大模型,无密钥不影响基础搜索抓取,以 Gemini 为例配置环境变量:
export WIGOLO_LLM_PROVIDER=gemini export GEMINI_API_KEY=你的密钥
同时支持 Ollama、OpenAI 等主流大模型服务商。
4. 启动独立REST服务
wigolo serve
默认监听3333端口,自带 OpenAPI 接口文档,可被n8n、远程智能体、自有程序调用。
5. 框架SDK集成
TypeScript:npm 安装 wigolo-sdk 嵌入项目;
Python:pip install wigolo 快速调用检索、爬取工具;
配套专用适配包:wigolo-langchain、wigolo-crewai 等,一键完成框架接入。
六、竞品对比
选取两款主流云端网页检索工具 Firecrawl、Tavily 与 Wigolo 对比:
| 对比维度 | Wigolo | Firecrawl | Tavily |
|---|---|---|---|
| 运行部署模式 | 全本地设备运行 | 云端API服务 | 云端API服务 |
| 是否需要API密钥 | 基础功能无需密钥 | 必须申请付费密钥 | 必须申请付费密钥 |
| 使用计费规则 | 永久免费,无调用限额 | 按量阶梯收费 | 按量阶梯收费 |
| 本地网页缓存 | 完整本地持久缓存,支持离线查阅 | 无本地缓存,数据存储服务商云端 | 无本地缓存 |
| 网页原文字节级引用标注 | 支持,附带可信度评分 | 不支持 | 不支持 |
| 全站深度爬取功能 | 内置完整crawl工具 | 支持全站爬取 | 仅单页抓取,无全站爬取 |
| 数据隐私 | 所有检索数据本地存储,不上传第三方 | 网页内容上传服务商服务器 | 检索内容上传服务商服务器 |
| MCP协议原生支持 | 原生适配,开箱即用 | 需第三方封装改造 | 需第三方封装改造 |
| 离线断网使用历史资料 | 完全支持 | 不支持 | 不支持 |
七、常见问题解答
Q:Wigolo 基础功能真的完全免费,存在隐藏收费吗?
A:不存在任何隐藏收费。项目浏览器、本地重排序、嵌入模型全部在本机运行,无云端服务器成本;AGPL开源协议禁止第三方将本项目封装为付费闭源服务,仅高级AI总结功能可选付费大模型密钥,不使用外部LLM不会产生任何费用。
Q:运行Wigolo需要占用多少本地存储空间?
A:完整资源包(内置浏览器+本地AI模型)占用磁盘约1.5GB,网页缓存占用空间由用户检索页面数量决定,缓存可随时手动清理释放空间。
Q:搜索引擎偶尔出现检索失败是什么原因,如何解决?
A:项目内置18个公共搜索引擎聚合调度,单一引擎访问限制、IP拦截会导致单源失效;多引擎容错机制会自动切换其他检索源,不影响整体查询结果,也可手动在配置中自定义新增搜索引擎接口。
Q:Wigolo爬取网页是否合规,会存在IP封禁风险吗?
A:工具默认遵循robots.txt爬虫协议,内置域名访问限流、UA轮换机制,定位为个人轻量化调研工具,不适合大规模批量抓取商业站点;若高频大量爬取站点,仍存在IP限制风险,建议合理控制爬取频率。
Q:没有大模型API密钥,Wigolo还能正常使用吗?
A:完全可以。搜索、抓取、爬取、缓存、页面对比等全部基础功能无需LLM密钥;仅自动生成完整调研报告的 research、agent 工具需要对接外部大模型,无密钥时仅返回原始网页素材。
Q:Wigolo支持在服务器Docker容器中私有化部署吗?
A:支持,官方提供标准Docker镜像,容器内可运行MCP服务或鉴权REST接口,适配企业内网私有化离线调研场景。
Q:缓存文件保存在哪个目录,如何手动删除缓存?
A:缓存、配置、模型资源统一存放于 ~/.wigolo/ 隐藏目录;可执行卸载命令一键清空,也可直接进入文件夹手动删除指定站点缓存文件。
八、相关链接
GitHub仓库地址:https://github.com/KnockOutEZ/wigolo
九、总结
Wigolo 是一套轻量化、隐私优先、零使用成本的开源本地网页检索爬虫MCP工具,依托本地浏览器与端侧AI模型替代付费云端检索服务,完整覆盖搜索、抓取、全站爬取、结构化提取、网页监控、离线缓存等全套网页调研能力,原生兼容主流AI编辑器与智能体开发框架,全平台可部署,数据全程本地存储不上传第三方,适合开发人员、AI开发者与有数据隐私需求的企业私有化使用,依靠开源模式免费开放全部核心功能,消除传统网页检索工具按量付费、数据云端留存的两大痛点。
版权及免责申明:本文由@dotaai原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/wigolo.html

