TRAE 绿皮书
TRAE Work 实战指南 / 汇报演示 & 设计创作

实战指南|一句话让 TRAE 帮你剪辑 Vlog

提示

TRAE 是面向开发者、职场人与学生的 AI 办公平台,有 TRAE Work TRAE IDE 两款产品。

TRAE Work 侧重学习、办公与工程执行场景,无论你是开发者、职场人、学生,都可以用它写方案、做分析、处理文件、推进协作,并完成需要持续执行、检查和产出结果的自动化任务。支持 桌面端网页版移动端,多端协作,随时发起任务、查看进展、持续推进。

TRAE IDE 适合写代码、读项目、改 Bug 等开发工作,更适合期望精细控制自己的代码改动和执行过程的开发者。

前言

你有没有过这样的体验?出去旅行拍了几十段视频,满心期待剪出好看的成片,可回来光是整理素材就花掉大把时间。打开剪辑软件更是犯难,不知道配什么音乐、怎么排序、字幕写什么,越剪越焦虑。折腾半天,热情被慢慢耗尽,精心拍摄的素材最后只能静静躺在硬盘里。

如果有一种方式,只需要一句话描述你想要的效果,AI 就能在你的电脑上直接完成从素材分析到成片输出的全流程,你愿意试试吗?

今天,我们带来的正是这样一个方案——依托英特尔酷睿 Ultra的端侧 AI 算力,搭配TRAE IDE 的 AI 编排能力,通过「video-editing-skills」智能技能,让你真正体验「一句话出片」的创作自由。

为什么视频剪辑需要端云协同?

当我们谈论 AI 视频剪辑时,云端大模型的强大已经可以很好处理此类任务,但为什么说端云协同其实是最优解,AI PC在其中能提供哪些价值?

痛点

云端方案的困境

AI PC 优势

网络延迟&云端存储成本

一次旅行拍摄的原始素材轻松超过 10GB。上传到云端需要较长的网络传输时间和相应的云端存储成本

在 AI PC 上,素材就在本地硬盘,零传输延迟,即开即用。

隐私顾虑

家庭录像、公司会议、个人生活……这些视频天然带有隐私属性。上传云端意味着数据离开你的掌控。

AI PC 端侧处理,数据始终在你的设备上,隐私安全有保障。

Token 成本

云端多模态大模型按 token 计费,一段 20 秒视频的 VLM 分析约需 3 万 token。当视频素材较多时,例如示例中的22 段视频就是 66 万 token

本地视频分析 0 Token成本

这套 Skill 的核心是基于英特尔酷睿 Ultra 的AI PC的强大算力把端侧工具链(VLM模型,FFmpeg 工具等)和视频剪辑工作流有机结合到一起专为 AI PC 打造的视频剪辑技能包。

端云协同架构

整个工作流采用「端侧重计算 + 云端轻决策」的分工模式:

AI PC 端

  • 硬件加速视频解码
  • 智能关键帧抽取与分片
  • GPU本地VLM 多模态模型推理分析
  • 英特尔OpenVINO性能加速
  • FFmpeg 视频分割/拼接/合成

云端大模型

  • 理解用户创作意图
  • 故事大纲与叙事弧线设计
  • 智能片段筛选与排序
  • 情感化字幕生成
  • BGM 风格匹配与选曲
提示

简单来说:大模型擅长创意决策(故事编排、字幕撰写、节奏把控),但视频素材的「重活」——解码、抽帧、多模态理解——交给 AI PC 本地算力来处理,才是最高效、最经济、最安全的方案。这就是「端云协同」的核心理念。

实战教程

本次实战使用 TRAE IDE 进行演示

下面,我们手把手演示如何使用 TRAE + video-editing-skills 完成一次完整的 AI 视频剪辑。整个过程只需要 6 个核心步骤,全程由 AI 自动完成,你只需确认即可。

环境要求

硬件:英特尔 AI PC(酷睿Ultra MTL/LNL/ARL/PTL 平台 +集成显卡)或 Arc A770/B580 独立显卡

内存:16GB 以上

软件:TRAE 中国版(https://www.trae.cn)

素材:一个包含多段视频文件的文件夹

第一步:打开 TRAE,加载视频素材目录

打开 TRAE 中国版,选择「文件 - 打开文件夹」(Ctrl+O),选择存放视频素材的目录。TRAE 会将这个目录作为工作空间,后续所有操作都在这里进行。

图片展示的是电脑文件夹界面,文件夹名为“test3”,位于D盘下的“data”和“videos”文件夹中。界面中显示了多段以“VID_”开头的MP4视频文件,如“VID_20250202_105648_new.mp4”等,部分视频文件名带有数字序号,如“VID_20250125_141053_new.mp4”。该图片与文档中“视频素材目录结构”部分对应,直观呈现了视频素材文件的存储情况。
img-528 · 图片展示的是电脑文件夹界面,文件夹名为“test3”,位于D盘下的“data”和“videos”文件夹中。界面中显示了多

视频素材目录结构

图片展示了TRAE界面中视频素材目录结构。左侧文件夹“007_input”下有多个以“test”开头的视频文件,如“test001.mp4”至“test21.mp4”。右侧显示“与Builder协作”相关操作,有“@Builder”指令及“MistMax M2.5”等信息。该图片与文档中“视频素材目录结构”部分对应,直观呈现了本次演示中使用的22段手机拍摄短视频的目录及文件情况。
img-529 · 图片展示了TRAE界面中视频素材目录结构。左侧文件夹“007_input”下有多个以“test”开头的视频文件,如“te

素材文件列表——本次演示使用 22 段手机拍摄的短视频

第二步:安装 video-editing-skills 技能

在 TRAE 的设置中找到「规则和技能」,点击「创建技能」:

图片展示了TRAE软件界面,用于说明安装video-editing-skills技能的操作步骤。界面左侧为素材文件列表,中间是设置区域,其中“规则和技能”选项被红色框突出显示,下方有“创建”按钮。右侧是TRAE主界面,右上角有“Builder”标识。该图片与上文“在TRAE的设置中找到「规则和技能」,点击「创建技能」”的内容对应,直观呈现了操作位置,帮助用户准确找到并点击“创建”按钮。
img-530 · 图片展示了TRAE软件界面,用于说明安装video-editing-skills技能的操作步骤。界面左侧为素材文件列表,

进入技能管理界面

选择下载好的技能 zip 包上传(可从 GitHub 开源仓库 获取),上传完成后点击确认即可。

图片展示了在TRAE中安装video-editing-skills技能的操作界面。左侧是视频素材目录结构,显示多段手机拍摄的短视频。中间弹出“Open”窗口,显示“video-editing-skills-main.zip”压缩包,下方有“Open”和“Cancel”按钮。右侧是TRAE界面,有“与Builder协作”等板块。该图片与上下文紧密相关,是“第二步:安装video-editing-skills技能”操作步骤中选择下载好的技能zip包上传的展示,直观呈现了操作场景。
img-531 · 图片展示了在TRAE中安装video-editing-skills技能的操作界面。左侧是视频素材目录结构,显示多段手机拍

选择 video-editing-skills 压缩包

图片展示的是TRAE中创建技能的界面。界面显示“video-editing-skills-main.zip”文件上传并解析成功,技能类型为全局,技能名称为“video-editing-skills”。右下角有“取消”和“确认”按钮,其中“确认”按钮被红色框突出显示。该图片与上文“安装video-editing-skills技能”内容相关,是上传技能zip包后确认安装技能的界面示例,帮助用户直观了解操作步骤。
img-532 · 图片展示的是TRAE中创建技能的界面。界面显示“video-editing-skills-main.zip”文件上传并解

确认安装技能

重要:在对话流设置中选择「IDE - 自动运行」,这样 AI 在执行过程中可以自动调用各种工具,无需每次手动确认。

图片展示了TRAE智能体的对话流设置界面。左侧为功能导航栏,其中“对话流”被红色箭头突出显示。右侧是对话流设置区域,包含代码审查、自动运行等设置项。其中“命令运行方式”下“IDE”选项被红色框线突出显示,其右侧有“自动运行”选项,表明在对话流设置中选择“IDE - 自动运行”,AI在执行过程中可自动调用各种工具,无需每次手动确认,这与上下文提到的开启自动运行模式,让AI自主完成全流程相呼应。
img-533 · 图片展示了TRAE智能体的对话流设置界面。左侧为功能导航栏,其中“对话流”被红色箭头突出显示。右侧是对话流设置区域,包含

开启自动运行模式,让 AI 自主完成全流程

第三步:一句话,启动 AI 剪辑

在 TRAE 的对话框里,用自然语言告诉 AI 你想要什么样的视频:

PLAIN TEXT
请帮我把这些视频剪成一个 30 秒的 vlog,风格要有节日气息、连贯流畅、富有动感。

接下来选择你希望使用的大模型,然后点击发送。这里我们选择使用 Minimax。

图片展示了TRAE界面中与Builder协作的对话框。画面中央有“与Builder协作”的文字及说明,下方红框内显示指令“使用这个文件夹内的视频素材,创建一个主题要求是有节日气氛的30秒的Mog视频”。该图片与上下文紧密相关,上下文提到在对话框输入视频剪辑指令,此图直观呈现了输入指令的操作界面,是AI全自动工作流启动前的指令输入环节,帮助用户理解如何在TRAE中进行视频剪辑指令的输入。
img-534 · 图片展示了TRAE界面中与Builder协作的对话框。画面中央有“与Builder协作”的文字及说明,下方红框内显示指令

在对话框输入视频剪辑指令

第四步:AI 全自动工作

点击发送后,TRAE 会自动调用 video-editing-skills 技能,开始全自动的 AI 剪辑工作流。你可以清楚地看到 AI 正在执行的每一个步骤:

图片展示了TRAE AI剪辑Vlog的运行界面。上方显示“1/5 已完成”,并有“新任务 - 一键开始创作”等步骤提示。下方代码区域显示运行“prepare_workspace.py”脚本,用于视频剪辑工作流准备,还列出多个视频文件名。界面右上角有“后台运行”“取消”等操作按钮。该图片与上下文紧密相关,直观呈现了AI自动启动剪辑工作流运行中,首次运行时自动下载工具链和本地VLM模型等操作情况。
img-535 · 图片展示了TRAE AI剪辑Vlog的运行界面。上方显示“1/5 已完成”,并有“新任务 - 一键开始创作”等步骤提示。

AI 自动启动剪辑工作流运行中

首次运行时,技能会自动下载所需的工具链和本地 VLM 模型(基于 OpenVINO 优化的 Qwen2.5-VL),后续使用无需重复下载。

图片展示的是TRAE视频剪辑技能的准备运行界面。左侧显示Python脚本运行命令及依赖库信息,如numpy、opencv-python等。右侧有“打开终端”按钮,以及“后台运行”“取消”按钮。下方有ffmpeg / ffprobe的下载信息,目标位置为C: \Users\SAS\AppData\Local\Temp\tmprnwkx9gv\ffmpeg.zip(超时120s)。该图片与上下文紧密相关,直观呈现了视频剪辑技能准备运行时的环境及操作界面。
img-536 · 图片展示的是TRAE视频剪辑技能的准备运行界面。左侧显示Python脚本运行命令及依赖库信息,如numpy、opencv
图片展示的是TRAE视频编辑技能的运行界面。左侧显示“test3 自动运行”及指令内容,右侧是运行结果。结果显示模型目录、目标目录等信息,还提示下载文件较大需耐心等待。下方有“打开终端”按钮,点击可进入终端。界面底部显示“命令运行中...”及下载进度等信息。该图片与上下文紧密相关,直观呈现了用户输入指令后,TRAE视频编辑技能自动运行及模型下载等操作情况。
img-537 · 图片展示的是TRAE视频编辑技能的运行界面。左侧显示“test3 自动运行”及指令内容,右侧是运行结果。结果显示模型目录

自动下载工具链和本地 VLM 模型

你输入的自然语言指令会被保存为 user_input.txt,AI 会从中提取主题、氛围、节奏等创作要素:

图片展示了TRAE软件界面,左侧为资源管理器,显示文件夹及文件,其中“user_input.txt”被红色箭头指向。右侧是“user_input.txt”内容窗口,显示用户输入的自然语言指令“帮我把这些视频剪成一个30秒的vlog,风格要有节日气息、连贯流畅、富有动感”。该图片与上下文紧密相关,直观呈现了用户输入自然语言指令的操作界面,是“第三步:一句话,启动AI剪辑”步骤的示例,体现了用户创作意图被结构化提取的过程。
img-538 · 图片展示了TRAE软件界面,左侧为资源管理器,显示文件夹及文件,其中“user_input.txt”被红色箭头指向。右侧

用户的创作意图被结构化提取

第五步:视频分析

这是整个流程中最能体现 AI PC 价值的环节。Skill在你的英特尔GPU 上启动本地 VLM 推理,逐段分析每一个视频片段的内容:

这张图片展示了TRAE AI剪辑工具在英特尔GPU上运行视频分析时的系统资源使用情况,核心体现了AI PC的性能价值。右侧Windows任务管理器的性能界面显示,英特尔Arc(TM) Pro B50图形处理器的GPU利用率被拉满,达到49%,正在调用GPU的媒体引擎进行视频解码,同时在GPU计算单元上运行VLM多模态推理,界面中还高亮标注了“Compute”模块;左侧的命令行窗口则呈现了工具运行时的代码执行过程,用户输入的剪辑指令被处理,系统正在加载相关配置与模型资源。
img-539 · 这张图片展示了TRAE AI剪辑工具在英特尔GPU上运行视频分析时的系统资源使用情况,核心体现了AI PC的性能价值。右

由英特尔GPU运行本地 VLM 分析

注意看上图——GPU 的利用率被拉满,Skill 正在调用 GPU 的媒体引擎进行视频解码,同时在 GPU 计算单元上运行 VLM 多模态推理。22 段视频、平均每段 20 秒,全部在本地完成语义级别的深度分析

分析完成后,输出结构化的 JSON 文件,包含每段视频的场景描述、人物动作、画面构图等语义信息:

图片展示的是在终端中运行的代码界面,显示了名为“output_vlm.json”的文件内容。文件中包含“processed_videos”数组,其下有“input_video”路径、“prompt”描述及“segments”数组。每个“segments”包含“seg_id”、“seg_start”、“seg_end”和“seg_desc”等信息,如“seg_desc”描述了视频中不同场景的语义信息,如充满生机的花园、盛开的黄色花朵等。该图片与上文提到的分析完成后输出结构化JSON文件的内容相呼应,直观呈现了视频语义分析结果。
img-540 · 图片展示的是在终端中运行的代码界面,显示了名为“output_vlm.json”的文件内容。文件中包含“processe

output_vlm.json —— 视频语义分析结果

第六步:大模型处理「分镜脚本 + 智能合成

有了视频分析阶段生成的视频语义数据,云端大模型开始发挥创意:自动设计叙事弧线、筛选最佳片段、编排画面顺序、撰写情感化字幕、匹配背景音乐——一份完整的专业分镜脚本(storyboard.json)就此诞生。

这张图片是包含分镜脚本信息的storyboard.json文件内容,呈现于代码编辑界面中。内容涵盖storyboard_metadata(如版本、生成时间)、story_outline,其中用序号1至5列出多个分镜段落,每个段落标注了名称、时长占比及对应描述,如“开始部分”“引入”等。还包含与分镜对应的clips模块,展示了片段序号、视频源路径、对应分镜段落、分镜描述、时间戳,以及时长、转场、voiceover等剪辑相关信息,该内容对应文档中云端大模型生成专业分镜脚本的环节。
img-541 · 这张图片是包含分镜脚本信息的storyboard.json文件内容,呈现于代码编辑界面中。内容涵盖storyboard_

云端大模型自动生成专业分镜脚本

最后,技能调用本地 FFmpeg 工具,根据分镜脚本对视频进行精准分割、拼接、字幕烧录、BGM 混音,生成最终成片。

图片展示了云端大模型自动生成专业分镜脚本后,技能调用本地FFmpeg工具对视频进行处理时,工作流执行过程产出的temp目录中的中间产物。目录内有多个以“clip”命名的raw和sub文件,以及以“clip_”命名的xt文件,还有“merged_no_bgm”文件夹。这些文件是视频素材剪辑的片段,是30秒精剪Vlog从素材到成片全自动完成过程中产生的中间产物,体现了工作流执行过程中的产出情况。
img-542 · 图片展示了云端大模型自动生成专业分镜脚本后,技能调用本地FFmpeg工具对视频进行处理时,工作流执行过程产出的temp目

temp 目录中的中间产物——从视频素材中剪辑的片段

图片展示了TRAE工作流执行过程产出的文件。在“editing_20260327_132800”文件夹下,有“temp”文件夹,内含“节日日影_30s_bgm.mp4”视频片段;还有“output_vlm.json”“runtime_env.json”“storyboard.json”“user_input.txt”等文件。这些文件是技能调用本地FFmpeg工具,根据分镜脚本对视频进行精准分割、拼接、字幕烧录、BGM混音后生成的最终成片的中间产物,体现了从视频素材到成片全自动完成的工作流程。
img-543 · 图片展示了TRAE工作流执行过程产出的文件。在“editing_20260327_132800”文件夹下,有“temp”

工作流执行过程产出文件

图片展示的是30秒精剪Vlog的最终成片截图。画面中是一条街道,街道两旁是具有传统建筑风格的房屋,屋顶为瓦片结构,墙面多为砖石材质。街道上悬挂着多种颜色的灯笼和伞,增添了节日氛围。街道两侧摆放着一些盆栽植物,地面上铺有石板。画面底部显示“街道上的节日装饰”,并有播放进度条,当前时间为0:07,总时长为0:30。该图片与上文介绍的技能调用本地FFmpeg工具,根据分镜脚本对视频进行精准分割、拼接、字幕烧录、BGM混音,生成最终成片的内容相呼应。
img-544 · 图片展示的是30秒精剪Vlog的最终成片截图。画面中是一条街道,街道两旁是具有传统建筑风格的房屋,屋顶为瓦片结构,墙面多

最终成片截图——30 秒精剪 Vlog,从素材到成片全自动完成

AI PC x TRAE:Agent 时代的全新应用形态

这个项目不仅仅是一个视频剪辑工具,它更代表了一种全新的应用范式——AI PC 端侧算力 + 云端大模型 + Agent 编排框架 = 即插即用的AI应用体验

当 TRAE 的 Skills 机制与 AI PC 端侧算力相结合,它不再只是程序员的工具,而是可以服务于所有人的 AI Agent 平台:

维度

TRAE + AI PC Skills

目标用户

所有人(创作者、运营、学生……)

核心能力

代码 + 视频 + 图像 + 音频……

算力来源

端云协同(AI PC + 云端)

应用形态

通用 AI Agent 平台

video-editing-skills 只是一个开始。围绕英特尔OpenVINO生态积累的开源模型支持,英特尔也在规划更丰富的端侧 AI Skill,充分发挥 AI PC 的硬件潜力:

能力方向

具体功能

应用场景

语音智能

TTS 语音合成、ASR 语音识别

AI 配音旁白、语音转字幕、多语言翻译

文字理解

OCR 文字识别、通用 SLM 小模型

视频中文字信息提取、智能摘要生成

视觉分析

目标检测/识别/分割/定位

自动追踪主体、智能裁切、竖屏适配

画质增强

超分辨率、视频增强、风格编辑

老视频修复、画质提升、风格化滤镜

欢迎大家立即开启体验!期待你们的 Vlog 展示哦~