TRAE 是面向开发者、职场人与学生的 AI 办公平台,有 TRAE Work 和 TRAE IDE 两款产品。
TRAE Work 侧重学习、办公与工程执行场景,无论你是开发者、职场人、学生,都可以用它写方案、做分析、处理文件、推进协作,并完成需要持续执行、检查和产出结果的自动化任务。支持 桌面端、网页版 和 移动端,多端协作,随时发起任务、查看进展、持续推进。
TRAE IDE 适合写代码、读项目、改 Bug 等开发工作,更适合期望精细控制自己的代码改动和执行过程的开发者。
你有没有过这样的体验?出去旅行拍了几十段视频,满心期待剪出好看的成片,可回来光是整理素材就花掉大把时间。打开剪辑软件更是犯难,不知道配什么音乐、怎么排序、字幕写什么,越剪越焦虑。折腾半天,热情被慢慢耗尽,精心拍摄的素材最后只能静静躺在硬盘里。
如果有一种方式,只需要一句话描述你想要的效果,AI 就能在你的电脑上直接完成从素材分析到成片输出的全流程,你愿意试试吗?
今天,我们带来的正是这样一个方案——依托英特尔酷睿 Ultra的端侧 AI 算力,搭配TRAE IDE 的 AI 编排能力,通过「video-editing-skills」智能技能,让你真正体验「一句话出片」的创作自由。
当我们谈论 AI 视频剪辑时,云端大模型的强大已经可以很好处理此类任务,但为什么说端云协同其实是最优解,AI PC在其中能提供哪些价值?
痛点 | 云端方案的困境 | AI PC 优势 |
网络延迟&云端存储成本 | 一次旅行拍摄的原始素材轻松超过 10GB。上传到云端需要较长的网络传输时间和相应的云端存储成本 |
|
隐私顾虑 | 家庭录像、公司会议、个人生活……这些视频天然带有隐私属性。上传云端意味着数据离开你的掌控。 | AI PC 端侧处理,数据始终在你的设备上,隐私安全有保障。 |
Token 成本 | 云端多模态大模型按 token 计费,一段 20 秒视频的 VLM 分析约需 3 万 token。当视频素材较多时,例如示例中的22 段视频就是 66 万 token | 本地视频分析 0 Token成本 |
这套 Skill 的核心是基于英特尔酷睿 Ultra 的AI PC的强大算力把端侧工具链(VLM模型,FFmpeg 工具等)和视频剪辑工作流有机结合到一起专为 AI PC 打造的视频剪辑技能包。
整个工作流采用「端侧重计算 + 云端轻决策」的分工模式:
AI PC 端
| 云端大模型
|
简单来说:大模型擅长创意决策(故事编排、字幕撰写、节奏把控),但视频素材的「重活」——解码、抽帧、多模态理解——交给 AI PC 本地算力来处理,才是最高效、最经济、最安全的方案。这就是「端云协同」的核心理念。
本次实战使用 TRAE IDE 进行演示
下面,我们手把手演示如何使用 TRAE + video-editing-skills 完成一次完整的 AI 视频剪辑。整个过程只需要 6 个核心步骤,全程由 AI 自动完成,你只需确认即可。
环境要求 硬件:英特尔 AI PC(酷睿Ultra MTL/LNL/ARL/PTL 平台 +集成显卡)或 Arc A770/B580 独立显卡 内存:16GB 以上 软件:TRAE 中国版(https://www.trae.cn) 素材:一个包含多段视频文件的文件夹 |
打开 TRAE 中国版,选择「文件 - 打开文件夹」(Ctrl+O),选择存放视频素材的目录。TRAE 会将这个目录作为工作空间,后续所有操作都在这里进行。

视频素材目录结构

素材文件列表——本次演示使用 22 段手机拍摄的短视频
在 TRAE 的设置中找到「规则和技能」,点击「创建技能」:

进入技能管理界面
选择下载好的技能 zip 包上传(可从 GitHub 开源仓库 获取),上传完成后点击确认即可。

选择 video-editing-skills 压缩包

确认安装技能
重要:在对话流设置中选择「IDE - 自动运行」,这样 AI 在执行过程中可以自动调用各种工具,无需每次手动确认。

开启自动运行模式,让 AI 自主完成全流程
在 TRAE 的对话框里,用自然语言告诉 AI 你想要什么样的视频:
请帮我把这些视频剪成一个 30 秒的 vlog,风格要有节日气息、连贯流畅、富有动感。接下来选择你希望使用的大模型,然后点击发送。这里我们选择使用 Minimax。

在对话框输入视频剪辑指令
点击发送后,TRAE 会自动调用 video-editing-skills 技能,开始全自动的 AI 剪辑工作流。你可以清楚地看到 AI 正在执行的每一个步骤:

AI 自动启动剪辑工作流运行中
首次运行时,技能会自动下载所需的工具链和本地 VLM 模型(基于 OpenVINO 优化的 Qwen2.5-VL),后续使用无需重复下载。


自动下载工具链和本地 VLM 模型
你输入的自然语言指令会被保存为 user_input.txt,AI 会从中提取主题、氛围、节奏等创作要素:

用户的创作意图被结构化提取
这是整个流程中最能体现 AI PC 价值的环节。Skill在你的英特尔GPU 上启动本地 VLM 推理,逐段分析每一个视频片段的内容:

由英特尔GPU运行本地 VLM 分析
注意看上图——GPU 的利用率被拉满,Skill 正在调用 GPU 的媒体引擎进行视频解码,同时在 GPU 计算单元上运行 VLM 多模态推理。22 段视频、平均每段 20 秒,全部在本地完成语义级别的深度分析。
分析完成后,输出结构化的 JSON 文件,包含每段视频的场景描述、人物动作、画面构图等语义信息:

output_vlm.json —— 视频语义分析结果
有了视频分析阶段生成的视频语义数据,云端大模型开始发挥创意:自动设计叙事弧线、筛选最佳片段、编排画面顺序、撰写情感化字幕、匹配背景音乐——一份完整的专业分镜脚本(storyboard.json)就此诞生。

云端大模型自动生成专业分镜脚本
最后,技能调用本地 FFmpeg 工具,根据分镜脚本对视频进行精准分割、拼接、字幕烧录、BGM 混音,生成最终成片。

temp 目录中的中间产物——从视频素材中剪辑的片段

工作流执行过程产出文件

最终成片截图——30 秒精剪 Vlog,从素材到成片全自动完成
这个项目不仅仅是一个视频剪辑工具,它更代表了一种全新的应用范式——AI PC 端侧算力 + 云端大模型 + Agent 编排框架 = 即插即用的AI应用体验
当 TRAE 的 Skills 机制与 AI PC 端侧算力相结合,它不再只是程序员的工具,而是可以服务于所有人的 AI Agent 平台:
维度 | TRAE + AI PC Skills |
目标用户 | 所有人(创作者、运营、学生……) |
核心能力 | 代码 + 视频 + 图像 + 音频…… |
算力来源 | 端云协同(AI PC + 云端) |
应用形态 | 通用 AI Agent 平台 |
video-editing-skills 只是一个开始。围绕英特尔OpenVINO生态积累的开源模型支持,英特尔也在规划更丰富的端侧 AI Skill,充分发挥 AI PC 的硬件潜力:
能力方向 | 具体功能 | 应用场景 |
语音智能 | TTS 语音合成、ASR 语音识别 | AI 配音旁白、语音转字幕、多语言翻译 |
文字理解 | OCR 文字识别、通用 SLM 小模型 | 视频中文字信息提取、智能摘要生成 |
视觉分析 | 目标检测/识别/分割/定位 | 自动追踪主体、智能裁切、竖屏适配 |
画质增强 | 超分辨率、视频增强、风格编辑 | 老视频修复、画质提升、风格化滤镜 |
欢迎大家立即开启体验!期待你们的 Vlog 展示哦~