一条视频进来,产出关键帧拼图、逐字稿与带时间线的增强报告,全程在你自己的机器上完成。
自动按时间抽样关键帧,拼成一张总览图,一眼定位重点画面,帧时间戳与逐字稿对齐。
本地 faster-whisper 转写,支持中英,输出 SRT / TXT / JSON。音频不出本机。
把视觉证据与逐字稿按时间对齐,生成带时间线的增强报告,结论与论点可编辑保存。
拖入视频即出结果:媒体信息、拼图、结论、核心论点、完整逐字稿(可搜索下载)。
中文视频指定 --language zh 准确率显著提升;未指定时自动检测语言。
纯标准库 + 本地模型,无账号、无上传、可离线长期运行。
招投标底价、客户资料、未公开讲义,这些视频一旦上传,控制权就不在你手里。libofu-video-insight 把转写放在你自己的 CPU 上跑,模型权重走国内镜像下载,全程不联网推理。你得到的是一份留在本机的结构化知识,而不是一份被第三方看过的副本。
本机已验证环境为 macOS + WorkBuddy 内置 Python;其他平台步骤一致,路径按实际调整。
# macOS
brew install ffmpeg
# 或下载 evermeet 静态版,放入 PATH(如 ~/.local/bin)
# Windows
# 下载 ffmpeg 静态构建,解压后把 bin 目录加入系统 PATH
# 验证
ffmpeg -version
从 libofu.cn 下载安装包(或向作者索取),解压到 skills 目录,WorkBuddy 用户可直接识别。
# 目标路径(WorkBuddy 用户)
~/.workbuddy/skills/libofu-video-insight/
# 其他平台:放到对应 skills 路径即可
python3 -m venv venv
venv/bin/pip install faster-whisper
# 国内拉取模型权重(设置环境变量)
export HF_ENDPOINT=https://hf-mirror.com
export HF_HUB_DISABLE_XET=1
# 方式一:双击启动(自动开浏览器)
webapp/launch.command
# 方式二:命令行
bash webapp/start.sh
# 打开 http://127.0.0.1:8765
在网页里粘贴本地视频路径或拖入文件,选模型(small.en / 中文用 --language zh),点开始。
# 想直接看成品?网页右上角「载入已有任务」填:
db5638c3e3ca
源视频《健康的时间观念》(6 分 27 秒,854×480),small.en 模型,96 段转写,全程本地离线完成。
这个工具我已经在本地完整跑通。欢迎对本地 AI、视频知识库、招投标资料自动化感兴趣的爱好者来交流。需要环境适配或想看更多样例,直接联系我。
