Claude-Video:为Claude大模型实现视频解析的开源预处理工具

AI新闻 人工智能研究所
67

一、Claude-Video是什么

claude-video专为解决原生Claude模型无法直接读取、解析视频文件与网络视频链接而开源的AI技能插件,其承担视频预处理中间层。它通过下载视频、提取字幕、音频转写、智能画面抽帧,将视频转化为Claude可识别的图片帧+带时间戳文本,补齐Claude视频理解能力短板。

工具可适配本地视频文件、各大平台在线视频链接,兼容网页版Claude、Claude Code、Cursor等多种AI客户端。

二、功能特色

  1. 双信息源解析:优先抓取平台原生字幕;无字幕时自动提取音频,调用Whisper完成带时间戳语音转写。画面+音频文本结合,提升视频理解准确度。

  2. 智能关键帧抽取:内置重复帧去重算法,自动过滤静态画面,减少图片Token浪费;提供多档位抽帧策略自由切换。

  3. 多源视频兼容:支持YouTube、TikTok、Loom等yt-dlp覆盖的流媒体链接,同时支持MP4、MOV、MKV等本地视频文件。

  4. 跨客户端部署:支持Claude Code插件市场一键安装、CLI全局部署、网页Claude手动导入三种安装方式。

  5. 自动化环境管理:首次运行自动检测ffmpeg、yt-dlp依赖,根据操作系统给出安装方案;分析结束自动清理临时缓存文件。

  6. 精细化参数控制:支持自定义视频起止时间、输出画面分辨率、最大采样帧数、开启/关闭音频转录、关闭帧去重等高级配置。

Claude-Video(图1)

三、技术细节

  1. 核心依赖

    • yt-dlp:负责在线视频下载、原生字幕抓取;

    • ffmpeg:视频切片、音频分离、画面帧提取;

    • Whisper(Groq/OpenAI后端):音频语音识别,生成时间戳字幕;

  2. 帧去重机制
    采用16×16灰度像素差值比对,不依赖OpenCV等重型图像处理库,仅依靠Python标准库识别重复静态画面,削减送入大模型的图像数量。

  3. 四种内置抽帧模式

    模式 特性 资源消耗 适用场景
    transcript 仅生成字幕,不提取画面 极低 只需音频文字内容
    efficient 提取场景切换关键帧,上限50帧 长视频快速概览
    balanced(默认) 均衡采样,上限100帧 中等 日常通用视频分析
    token-burner 无帧数限制,完整采样 极高 需要精细画面审查
  4. 执行流程
    接收视频地址/本地路径 → 获取在线字幕(优先)→ 下载视频/截取指定片段 → ffmpeg抽帧+重复帧过滤 → 音频提取+语音转写 → 图像帧+时间戳文本封装送入Claude → 自动清理临时文件。

四、应用场景

  1. 视频内容总结:课程、发布会、播客视频提炼核心观点,快速梳理长视频内容。

  2. 录屏故障排查:上传软件操作录屏,让Claude结合画面与操作描述定位程序BUG。

  3. 短视频内容分析:拆解短视频脚本结构、镜头设计、文案话术,用于竞品调研。

  4. 视频素材知识库整理:批量解析播放列表,生成结构化笔记,搭建视频资料库。

  5. 定点片段深度解读:限定视频起止时间,针对关键画面进行问答、文字提取。

五、使用方法

1. Claude Code(推荐)

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

安装完成后使用指令:/watch 视频链接,追加参数可自定义模式:
/watch --mode balanced https://xxx.mp4

2. 通用AI客户端(Cursor等)

npx skills add bradautomates/claude-video -g

3. 网页版 claude.ai

从仓库下载 .skill 安装包,在Claude设置-能力面板手动导入。

4. 本地手动部署

Git克隆仓库,配置环境变量写入Whisper API密钥;可增加--no-whisper参数,仅使用画面分析,不启用音频转录。

六、竞品对比

选取Video Helper for Claude、LLaVA视频解析工具作为对比

项目 claude-video Video Helper for Claude LLaVA(本地多模态模型)
定位 Claude专用视频预处理插件 Claude网页端简易视频解析脚本 独立开源多模态大模型
运行方式 本地预处理,输出素材给Claude 浏览器前端处理,功能受限 独立推理,无需调用Claude
字幕支持 原生字幕优先+Whisper音频转写 仅基础音频转录,无原生字幕抓取 无原生字幕获取能力
智能去重抽帧 ✅内置灰度帧去重 ❌无重复帧过滤 ❌不具备预处理优化逻辑
支持在线流媒体链接 ✅yt-dlp支持全平台 ❌仅支持本地文件 ❌需手动下载视频
依赖 ffmpeg、yt-dlp、Whisper API 浏览器媒体API 显卡算力、庞大模型权重
适用对象 持续使用Claude生态用户 仅网页Claude临时使用 希望脱离云端大模型的本地部署人群

七、常见问题解答

Q:运行工具提示缺少ffmpeg、yt-dlp怎么办?

A:工具启动时会自动识别操作系统,输出对应的安装命令。Windows使用包管理器、macOS通过brew、Linux使用apt/yum安装对应程序即可。

Q:是否必须配置Groq/OpenAI密钥才能使用?

A:不是强制要求。如果视频自带平台原生字幕,无需密钥;只有视频无内嵌字幕,需要音频转写时,才需要配置Whisper后端密钥,也可以使用--no-whisper关闭音频转录,只依靠画面分析。

Q:解析1小时以上长视频效果不理想是什么原因?

A:默认balanced模式会稀疏采样画面。长视频建议使用--start--end截取重点片段分析,提升画面采样密度;或者切换token-burner模式,但会大幅增加token消耗。

Q:可以商用修改二次开发吗?

A:项目采用MIT开源协议,允许自由修改、商用二次开发,仅需要遵守协议基础规范。

Q:能否批量解析多个视频?

A:原生未封装批量命令,可基于项目源码二次开发循环调用逻辑,实现批量处理。

八、官方链接

九、总结

claude-video是一款轻量化、面向Claude生态的开源视频预处理工具,解决原生Claude无法直接读取视频的痛点,依靠yt-dlp与ffmpeg实现多源视频接入,搭配智能抽帧与字幕提取策略平衡解析精度与token开销,适配多种主流AI客户端,适合需要频繁让Claude分析在线视频与本地录屏的开发者、内容从业者,同时宽松的MIT协议也方便开发者基于自身需求进行定制改造。

打赏
THE END
作者头像
人工智能研究所
发现AI神器,探索AI技术!