Claude-Video:为Claude大模型实现视频解析的开源预处理工具
一、Claude-Video是什么
claude-video专为解决原生Claude模型无法直接读取、解析视频文件与网络视频链接而开源的AI技能插件,其承担视频预处理中间层。它通过下载视频、提取字幕、音频转写、智能画面抽帧,将视频转化为Claude可识别的图片帧+带时间戳文本,补齐Claude视频理解能力短板。
工具可适配本地视频文件、各大平台在线视频链接,兼容网页版Claude、Claude Code、Cursor等多种AI客户端。
二、功能特色
双信息源解析:优先抓取平台原生字幕;无字幕时自动提取音频,调用Whisper完成带时间戳语音转写。画面+音频文本结合,提升视频理解准确度。
智能关键帧抽取:内置重复帧去重算法,自动过滤静态画面,减少图片Token浪费;提供多档位抽帧策略自由切换。
多源视频兼容:支持YouTube、TikTok、Loom等yt-dlp覆盖的流媒体链接,同时支持MP4、MOV、MKV等本地视频文件。
跨客户端部署:支持Claude Code插件市场一键安装、CLI全局部署、网页Claude手动导入三种安装方式。
自动化环境管理:首次运行自动检测ffmpeg、yt-dlp依赖,根据操作系统给出安装方案;分析结束自动清理临时缓存文件。
精细化参数控制:支持自定义视频起止时间、输出画面分辨率、最大采样帧数、开启/关闭音频转录、关闭帧去重等高级配置。

三、技术细节
核心依赖
yt-dlp:负责在线视频下载、原生字幕抓取;
ffmpeg:视频切片、音频分离、画面帧提取;
Whisper(Groq/OpenAI后端):音频语音识别,生成时间戳字幕;
帧去重机制
采用16×16灰度像素差值比对,不依赖OpenCV等重型图像处理库,仅依靠Python标准库识别重复静态画面,削减送入大模型的图像数量。四种内置抽帧模式
模式 特性 资源消耗 适用场景 transcript 仅生成字幕,不提取画面 极低 只需音频文字内容 efficient 提取场景切换关键帧,上限50帧 低 长视频快速概览 balanced(默认) 均衡采样,上限100帧 中等 日常通用视频分析 token-burner 无帧数限制,完整采样 极高 需要精细画面审查 执行流程
接收视频地址/本地路径 → 获取在线字幕(优先)→ 下载视频/截取指定片段 → ffmpeg抽帧+重复帧过滤 → 音频提取+语音转写 → 图像帧+时间戳文本封装送入Claude → 自动清理临时文件。
四、应用场景
视频内容总结:课程、发布会、播客视频提炼核心观点,快速梳理长视频内容。
录屏故障排查:上传软件操作录屏,让Claude结合画面与操作描述定位程序BUG。
短视频内容分析:拆解短视频脚本结构、镜头设计、文案话术,用于竞品调研。
视频素材知识库整理:批量解析播放列表,生成结构化笔记,搭建视频资料库。
定点片段深度解读:限定视频起止时间,针对关键画面进行问答、文字提取。
五、使用方法
1. Claude Code(推荐)
/plugin marketplace add bradautomates/claude-video /plugin install watch@claude-video
安装完成后使用指令:/watch 视频链接,追加参数可自定义模式:/watch --mode balanced https://xxx.mp4
2. 通用AI客户端(Cursor等)
npx skills add bradautomates/claude-video -g
3. 网页版 claude.ai
从仓库下载 .skill 安装包,在Claude设置-能力面板手动导入。
4. 本地手动部署
Git克隆仓库,配置环境变量写入Whisper API密钥;可增加--no-whisper参数,仅使用画面分析,不启用音频转录。
六、竞品对比
选取Video Helper for Claude、LLaVA视频解析工具作为对比
| 项目 | claude-video | Video Helper for Claude | LLaVA(本地多模态模型) |
|---|---|---|---|
| 定位 | Claude专用视频预处理插件 | Claude网页端简易视频解析脚本 | 独立开源多模态大模型 |
| 运行方式 | 本地预处理,输出素材给Claude | 浏览器前端处理,功能受限 | 独立推理,无需调用Claude |
| 字幕支持 | 原生字幕优先+Whisper音频转写 | 仅基础音频转录,无原生字幕抓取 | 无原生字幕获取能力 |
| 智能去重抽帧 | ✅内置灰度帧去重 | ❌无重复帧过滤 | ❌不具备预处理优化逻辑 |
| 支持在线流媒体链接 | ✅yt-dlp支持全平台 | ❌仅支持本地文件 | ❌需手动下载视频 |
| 依赖 | ffmpeg、yt-dlp、Whisper API | 浏览器媒体API | 显卡算力、庞大模型权重 |
| 适用对象 | 持续使用Claude生态用户 | 仅网页Claude临时使用 | 希望脱离云端大模型的本地部署人群 |
七、常见问题解答
Q:运行工具提示缺少ffmpeg、yt-dlp怎么办?
A:工具启动时会自动识别操作系统,输出对应的安装命令。Windows使用包管理器、macOS通过brew、Linux使用apt/yum安装对应程序即可。
Q:是否必须配置Groq/OpenAI密钥才能使用?
A:不是强制要求。如果视频自带平台原生字幕,无需密钥;只有视频无内嵌字幕,需要音频转写时,才需要配置Whisper后端密钥,也可以使用--no-whisper关闭音频转录,只依靠画面分析。
Q:解析1小时以上长视频效果不理想是什么原因?
A:默认balanced模式会稀疏采样画面。长视频建议使用--start和--end截取重点片段分析,提升画面采样密度;或者切换token-burner模式,但会大幅增加token消耗。
Q:可以商用修改二次开发吗?
A:项目采用MIT开源协议,允许自由修改、商用二次开发,仅需要遵守协议基础规范。
Q:能否批量解析多个视频?
A:原生未封装批量命令,可基于项目源码二次开发循环调用逻辑,实现批量处理。
八、官方链接
九、总结
claude-video是一款轻量化、面向Claude生态的开源视频预处理工具,解决原生Claude无法直接读取视频的痛点,依靠yt-dlp与ffmpeg实现多源视频接入,搭配智能抽帧与字幕提取策略平衡解析精度与token开销,适配多种主流AI客户端,适合需要频繁让Claude分析在线视频与本地录屏的开发者、内容从业者,同时宽松的MIT协议也方便开发者基于自身需求进行定制改造。
版权及免责申明:本文由@人工智能研究所原创发布。该文章观点仅代表作者本人,不代表本站立场。本站不承担任何相关法律责任。
如若转载,请注明出处:https://www.aipuzi.cn/ai-news/claude-video.html

