阅影
让 Claude Code、Cursor 这类 AI 编程助手看懂视频的小工具
应用平台
- Windows / macOS / Linux(Python 3.9+,命令行工具 + Claude Code 技能)
推荐类型
【开发者自荐】
是否收费
免费,开源(MIT)。全程本地运行,不需要任何 API Key。
一句简介
一条命令把本地视频或 B站 / YouTube 链接变成带时间戳的文字稿 + 关键帧九宫格,AI 编程助手读完就能照着教程干活、整理笔记、回答问题。
应用简介
用 Claude Code 写东西时经常遇到一个尴尬:想让它照着一个 B站 教程做,或者把一节课的视频整理成笔记,它读不了视频(只能读图片和文字)。所以做了「阅影」,把视频拆成它能读的东西:
- 文字稿:优先抓平台自带字幕;没有就本地跑语音识别(faster-whisper),中、英、日、韩、法、德、俄等几十种语言自动检测,带时间戳,输出 txt 和 srt
- 关键帧:在画面明显变化的地方抽帧,每张左下角烧上编号和时间,再拼成九宫格总览图,AI 一眼看完全片走向;需要看清某一刻的代码、PPT 再打开单帧大图
- 一份 report.md:简介、章节、画面总览、关键帧清单、按段落的文字稿,AI 读这一个文件就能开始干活
- 支持本地文件和 B站 / YouTube / 抖音 / 小红书 等链接(yt-dlp 能下的都行)
- 有 NVIDIA 显卡自动用 GPU(一个 6 分钟的 B站 视频从下载到出报告约 90 秒),没有就退回 CPU,可以换小模型
装好之后在 Claude Code 里直接说「帮我看看这个视频,把步骤整理成笔记」,它会自己调用,引用内容时还会带上时间点方便回看。
安装
pip install yueying
yueying --install-skill
Windows 也可以下载仓库后双击 install.cmd,会自动创建独立环境并装好一切。ffmpeg 自带,不用单独装。第一次做语音识别会下载模型(约 1.6 GB),之后全程离线。
已知问题
- 语音识别会把专有名词、同音字听错(下面截图里「月读」就被听成了「阅读」),画面上有字的话 AI 会对照纠正
- B站 的 AI 字幕要登录后才抓得到,加
--cookies-from-browser chrome即可;不登录就走本地语音识别
截图预览
一段 24 秒演示视频(月读的四张截图配中文旁白)跑出来的九宫格:
对应的文字稿:
[00:00] 这是阅读,一个安静的桌面小说阅读器。整本书连续滚动,按段落记住进度。第二个画面是桌面模式,窗口变透明,只留文字浮在桌面上。第三个画面是伪装皮肤,一键变成代码编辑器。最后是伪装成表格的样子。
