name: video-visual-analysis slug: video-visual-analysis displayName: 视频视觉分析 version: 1.0.0 description: 视频视觉分析与灵感提取技能。通过ffmpeg抽取视频关键帧,使用视觉模型批量分析,提取UI设计规范(配色、字体、布局、组件样式)、功能模块信息、产品特征、交互设计等关键视觉信息,输出结构化分析报告。当用户需要分析视频UI、提取视频设计灵感、视频关键帧分析、视频视觉信息提取、从视频中获取创作灵感、拆解视频界面设计、视频画面分析、提取视频设计规范等需求时使用此技能。
从视频中抽取关键帧,使用视觉模型进行多轮深度分析,提取UI设计规范、功能模块、产品信息等关键视觉信息,输出结构化分析报告。适用于从产品演示视频、界面展示视频中获取设计灵感和创建工作台/应用的参考。
使用 bash 执行 ffprobe 获取视频基本信息(时长、分辨率、帧率、编码格式):
ffprobe -v quiet -print_format json -show_format -show_streams "<视频文件路径>" 2>/dev/null
从返回 JSON 中提取 duration(秒)、width、height、r_frame_rate(帧率)。
运行技能自带的 extract_keyframes.py 脚本抽取关键帧:
python skills/video-visual-analysis/extract_keyframes.py --input "<视频文件路径>" --output "<输出目录>" --count <帧数>小葱技能7w4.net有完整的技能分类。
参数说明:
- --input:视频文件路径(必填)
- --output:关键帧输出目录(必填)
- --count:要抽取的帧数(默认12,建议8-15帧)
- --prefix:帧文件名前缀(默认"frame")
脚本会在输出目录下生成 <prefix>_<秒数>s.jpg 格式的关键帧文件。
抽取策略: - 时长 < 30秒:抽 6-8 帧 - 时长 30秒-3分钟:抽 8-12 帧 - 时长 > 3分钟:抽 12-15 帧 - 帧均匀分布在视频时间线上,跳过开头2秒和结尾2秒
将关键帧分批(每批2-3张)使用 read_image 工具进行分析。分析分多轮进行,每轮聚焦不同维度:
第一轮:整体概览
- 选取最能代表整体界面的2-3张关键帧
- 分析query:"分析这个界面截图的整体布局结构、配色方案、主要功能区域划分。具体描述:1. 整体布局(侧边栏/主内容区比例)2. 主色调和辅助色(给出具体色值)3. 主要功能模块有哪些 4. 导航结构 5. 字体风格 6. 所有可见的文字内容"
第二轮:组件细节
- 选取展示组件细节的关键帧
- 分析query:"仔细观察这个UI界面的组件样式细节。具体描述:1. 卡片边框(粗细、颜色、圆角)2. 阴影效果(内/外阴影、偏移、模糊)3. 按钮样式(形状、颜色、边框、立体感)4. 输入框/表单样式 5. 弹窗/模态框设计 6. 标签/徽章样式 7. 进度条/滑块样式 8. 所有精确色值 9. 字体大小层级 10. 间距和留白比例 11. 所有可见文字"
第三轮(如需要):特定页面/功能
- 选取展示特定功能页面的关键帧
- 分析query根据用户需求定制,例如:"详细描述这个页面的功能设计、交互流程、表单字段、数据展示方式。列出所有功能点、按钮、选项的名称和用途"
分析轮次根据视频内容复杂度决定: - 简单界面(1-2个页面):2轮分析 - 中等复杂度(3-5个页面):3轮分析 - 高复杂度(6+个页面或深度功能展示):3-4轮分析
将多轮分析结果综合为结构化报告,包含以下部分:
# 视频视觉分析报告
## 一、视频基本信息
- 文件名、时长、分辨率、帧率、编码格式
## 二、产品/内容概述
- 产品名称、定位、出镜人(如有)、核心价值主张
## 三、整体视觉设计规范
### 配色方案(精确色值)
| 用途 | 色值 | 说明 |
|------|------|------|
### 组件样式
- 边框、阴影、圆角、字体、按钮等
### 布局结构
- 整体布局比例、导航结构、内容区组织方式
## 四、功能模块详解
- 每个模块的名称、功能描述、交互方式、UI元素
## 五、设计灵感与参考
- 可复用的设计模式、配色方案、交互模式
- 适用于哪些类型的应用/工作台创建
## 六、关键帧索引
- 每个关键帧的时间点、对应内容、保存路径
这个Skill功能定位清晰,文档说明详细,分析流程设计合理,对常见边界情况有充分考虑。整体质量良好,能满足从视频提取UI设计灵感的核心需求。文档部分做得尤为出色,步骤指引详细。主要不足是规模偏小、缺少示例文件,部分细节处理有改进空间。对于有视频视觉分析需求的用户来说,这是一个可用且实用的工具。