化視頻剪輯原型開(kāi)發(fā)實(shí)踐)
在實(shí)際視頻剪輯工作中重復(fù)性的素材整理、粗剪、字幕生成和效果添加占據(jù)了大量時(shí)間。對(duì)于開(kāi)發(fā)者或技術(shù)愛(ài)好者而言能否用代碼和AI能力來(lái)“描述”剪輯需求讓工具自動(dòng)執(zhí)行從而解放雙手是一個(gè)極具吸引力的命題。Trae作為一個(gè)新興的AI Agent開(kāi)發(fā)框架其核心能力在于理解和執(zhí)行復(fù)雜的自然語(yǔ)言指令這恰好為構(gòu)建一個(gè)“動(dòng)嘴不動(dòng)手”的AI剪輯工具提供了可能。本文將帶你從零開(kāi)始利用Trae框架構(gòu)建一個(gè)能夠理解“幫我剪一個(gè)30秒的旅行混剪配上快節(jié)奏音樂(lè)和動(dòng)態(tài)字幕”這類指令的AI剪輯原型。整個(gè)過(guò)程不涉及復(fù)雜的圖形界面編程而是通過(guò)定義技能Skill、編排工作流Work來(lái)實(shí)現(xiàn)自動(dòng)化剪輯邏輯。無(wú)論你是想探索AI Agent在創(chuàng)意領(lǐng)域的應(yīng)用還是希望為自己的視頻項(xiàng)目添加自動(dòng)化流水線這篇文章都將提供一條清晰的實(shí)踐路徑。1. 理解 Trae 與 AI 剪輯的結(jié)合點(diǎn)在動(dòng)手之前我們需要厘清幾個(gè)核心概念Trae是什么它如何工作以及為什么它能用于剪輯。1.1 Trae不只是另一個(gè)AI調(diào)用框架Trae是一個(gè)開(kāi)源的AI Agent開(kāi)發(fā)框架。與直接調(diào)用大模型API不同Trae的核心思想是“技能Skill”和“工作流Work”。你可以將各種能力如調(diào)用模型、執(zhí)行代碼、操作軟件封裝成獨(dú)立的Skill然后通過(guò)自然語(yǔ)言描述一個(gè)復(fù)雜任務(wù)Trae會(huì)將其分解并調(diào)用相應(yīng)的Skill序列即Work來(lái)完成。對(duì)于剪輯任務(wù)這意味著我們不需要寫(xiě)一個(gè)龐大的、面面俱到的程序。相反我們可以創(chuàng)建“視頻轉(zhuǎn)碼Skill”、“音頻提取Skill”、“字幕生成Skill”、“片段拼接Skill”。定義一個(gè)“制作混剪視頻”的Work描述這些Skill應(yīng)該如何組合和協(xié)作。用自然語(yǔ)言告訴Trae“做一個(gè)混剪”它就會(huì)自動(dòng)運(yùn)行這個(gè)Work。1.2 AI 剪輯神器的技術(shù)棧構(gòu)成一個(gè)完整的“AI剪輯神器”原型通常由以下幾層構(gòu)成指令理解層由Trae框架和大語(yǔ)言模型LLM負(fù)責(zé)將用戶的自然語(yǔ)言指令解析為結(jié)構(gòu)化任務(wù)。技能執(zhí)行層由我們開(kāi)發(fā)的各個(gè)Skill實(shí)現(xiàn)每個(gè)Skill都是一個(gè)可執(zhí)行單元通常封裝了對(duì)一個(gè)底層工具或庫(kù)的調(diào)用。媒體處理層這是實(shí)際處理視頻、音頻、圖片的“苦力”。我們不會(huì)從頭造輪子而是集成成熟的命令行工具或庫(kù)如FFmpeg視頻處理、MoviePyPython視頻編輯、Whisper語(yǔ)音識(shí)別等。流程編排層由Trae的Work機(jī)制管理決定Skill的執(zhí)行順序、數(shù)據(jù)傳遞和錯(cuò)誤處理。我們的工作重點(diǎn)將放在利用Trae框架搭建指令理解和流程編排層并開(kāi)發(fā)連接媒體處理層的各個(gè)Skill。1.3 為什么選擇“原型”而非“完整產(chǎn)品”需要明確的是在單篇文章的篇幅內(nèi)我們目標(biāo)是構(gòu)建一個(gè)可運(yùn)行、可驗(yàn)證的技術(shù)原型。它能證明“用嘴剪輯”的可行性并處理一個(gè)簡(jiǎn)化但完整的流程例如輸入幾個(gè)視頻文件生成一個(gè)帶有背景音樂(lè)和簡(jiǎn)單字幕的短片。這為你后續(xù)擴(kuò)展功能如特效、轉(zhuǎn)場(chǎng)、色彩校正奠定了堅(jiān)實(shí)的基礎(chǔ)。生產(chǎn)級(jí)的工具還需要考慮性能優(yōu)化、錯(cuò)誤恢復(fù)、用戶界面等更多因素。2. 環(huán)境準(zhǔn)備與項(xiàng)目初始化我們將在一個(gè)干凈的Python虛擬環(huán)境中進(jìn)行開(kāi)發(fā)確保依賴隔離。2.1 基礎(chǔ)環(huán)境與依賴安裝首先確保系統(tǒng)已安裝Python建議3.9以上版本和pip。然后創(chuàng)建并激活虛擬環(huán)境。# 創(chuàng)建項(xiàng)目目錄并進(jìn)入 mkdir ai-video-editor cd ai-video-editor # 創(chuàng)建虛擬環(huán)境 python -m venv venv # 激活虛擬環(huán)境 # Windows: venv\Scripts\activate # Linux/Mac: source venv/bin/activate接下來(lái)安裝核心依賴。除了Trae我們還需要FFmpeg通過(guò)系統(tǒng)安裝和MoviePy。# 安裝 Trae 核心框架 pip install trae-core # 安裝 MoviePy 用于高級(jí)視頻操作其依賴會(huì)安裝imageio, numpy等 pip install moviepy # 安裝用于語(yǔ)音識(shí)別的openai-whisper可選用于生成字幕 pip install openai-whisper # 安裝用于文件操作的常用庫(kù) pip install pydantic python-dotenvFFmpeg 安裝MoviePy 依賴 FFmpeg 來(lái)讀寫(xiě)視頻文件。Ubuntu/Debian:sudo apt update sudo apt install ffmpegmacOS (Homebrew):brew install ffmpegWindows: 從 FFmpeg官網(wǎng) 下載編譯好的二進(jìn)制文件將bin目錄添加到系統(tǒng)環(huán)境變量PATH中。安裝完成后在終端運(yùn)行ffmpeg -version驗(yàn)證是否安裝成功。2.2 初始化 Trae 項(xiàng)目結(jié)構(gòu)Trae項(xiàng)目有約定的結(jié)構(gòu)。我們手動(dòng)創(chuàng)建如下目錄和文件ai-video-editor/ ├── .env # 環(huán)境變量如API密鑰 ├── skills/ # 存放所有Skill定義 │ ├── __init__.py │ ├── video_skills.py # 視頻處理相關(guān)Skill │ ├── audio_skills.py # 音頻處理相關(guān)Skill │ └── subtitle_skills.py # 字幕處理相關(guān)Skill ├── works/ # 存放Workflow定義 │ ├── __init__.py │ └── video_mashup_work.py # 混剪工作流 ├── configs/ # 配置文件 │ └── trae_config.yaml ├── outputs/ # 輸出目錄 ├── inputs/ # 輸入素材目錄手動(dòng)放入測(cè)試視頻 └── main.py # 程序入口創(chuàng)建關(guān)鍵配置文件configs/trae_config.yaml用于指定Trae運(yùn)行時(shí)行為例如默認(rèn)使用的LLM。# configs/trae_config.yaml trae: llm: provider: openai # 或 anthropic, deepseek 等 model: gpt-4o-mini # 根據(jù)你的API選擇合適模型 api_key: ${OPENAI_API_KEY} # 從環(huán)境變量讀取 skill_dir: ./skills work_dir: ./works在.env文件中填入你的LLM API密鑰# .env OPENAI_API_KEYsk-your-openai-api-key-here3. 開(kāi)發(fā)核心剪輯技能SkillsSkill是能力的原子化封裝。我們將開(kāi)發(fā)幾個(gè)最基礎(chǔ)的視頻處理Skill。3.1 視頻信息讀取與剪輯 Skill在skills/video_skills.py中我們創(chuàng)建第一個(gè)SkillGetVideoInfo和CutVideoClip。# skills/video_skills.py import os from typing import List, Optional from pydantic import BaseModel, Field from trae.skill import skill from moviepy.editor import VideoFileClip class GetVideoInfoInput(BaseModel): 獲取視頻信息的輸入?yún)?shù) video_path: str Field(description視頻文件的絕對(duì)路徑) class GetVideoInfoOutput(BaseModel): 視頻信息輸出 duration: float Field(description視頻時(shí)長(zhǎng)秒) fps: float Field(description幀率) size: List[int] Field(description分辨率 [寬, 高]) has_audio: bool Field(description是否包含音頻軌道) skill( nameget_video_info, description讀取指定視頻文件的基本信息包括時(shí)長(zhǎng)、分辨率、幀率等。, input_modelGetVideoInfoInput, output_modelGetVideoInfoOutput ) def get_video_info(video_path: str) - GetVideoInfoOutput: 獲取視頻信息的技能實(shí)現(xiàn) if not os.path.exists(video_path): raise FileNotFoundError(f視頻文件不存在: {video_path}) with VideoFileClip(video_path) as clip: info GetVideoInfoOutput( durationclip.duration, fpsclip.fps, sizelist(clip.size), # 轉(zhuǎn)換為L(zhǎng)ist has_audioclip.audio is not None ) return info class CutVideoClipInput(BaseModel): 剪輯視頻片段的輸入?yún)?shù) source_path: str Field(description源視頻路徑) start_time: float Field(description剪輯開(kāi)始時(shí)間秒, ge0) end_time: Optional[float] Field(description剪輯結(jié)束時(shí)間秒不填則剪到結(jié)尾, defaultNone) output_path: str Field(description輸出視頻路徑) class CutVideoClipOutput(BaseModel): 剪輯視頻輸出 output_path: str Field(description生成的視頻片段路徑) duration: float Field(description生成片段的時(shí)長(zhǎng)秒) skill( namecut_video_clip, description從源視頻中截取指定時(shí)間段的片段。, input_modelCutVideoClipInput, output_modelCutVideoClipOutput ) def cut_video_clip(source_path: str, start_time: float, end_time: Optional[float], output_path: str) - CutVideoClipOutput: 剪輯視頻片段的技能實(shí)現(xiàn) with VideoFileClip(source_path) as video: # 如果未指定end_time則剪到視頻結(jié)尾 if end_time is None or end_time video.duration: end_time video.duration # 執(zhí)行剪輯 subclip video.subclip(start_time, end_time) # 寫(xiě)入輸出文件codec指定編碼器audio_codec確保音頻被保留 subclip.write_videofile(output_path, codeclibx264, audio_codecaac, loggerNone) duration end_time - start_time return CutVideoClipOutput(output_pathoutput_path, durationduration)關(guān)鍵點(diǎn)解釋Pydantic模型每個(gè)Skill的輸入輸出都使用Pydantic的BaseModel進(jìn)行嚴(yán)格定義和類型校驗(yàn)這能讓Trae和LLM更好地理解Skill的用途。skill裝飾器這是Trae框架的核心。它注冊(cè)一個(gè)函數(shù)為Skill并提供了名稱、描述和輸入輸出模型。LLM會(huì)根據(jù)這些元信息來(lái)決定何時(shí)調(diào)用該Skill。MoviePy我們使用VideoFileClip來(lái)加載和處理視頻。subclip方法進(jìn)行裁剪write_videofile進(jìn)行輸出。loggerNone是為了避免MoviePy輸出冗長(zhǎng)的進(jìn)度信息到控制臺(tái)。3.2 音頻處理與字幕生成 Skill接著在skills/audio_skills.py和skills/subtitle_skills.py中創(chuàng)建更多技能。# skills/audio_skills.py from pydantic import BaseModel, Field from trae.skill import skill from moviepy.editor import VideoFileClip, AudioFileClip, CompositeAudioClip class ExtractAudioInput(BaseModel): video_path: str Field(description視頻文件路徑) output_audio_path: str Field(description提取出的音頻文件輸出路徑) class ExtractAudioOutput(BaseModel): audio_path: str Field(description生成的音頻文件路徑) duration: float Field(description音頻時(shí)長(zhǎng)) skill( nameextract_audio_from_video, description從視頻文件中分離出音頻軌道保存為獨(dú)立的音頻文件如MP3。, input_modelExtractAudioInput, output_modelExtractAudioOutput ) def extract_audio_from_video(video_path: str, output_audio_path: str) - ExtractAudioOutput: with VideoFileClip(video_path) as video: if video.audio is None: raise ValueError(該視頻不包含音頻軌道) audio video.audio audio.write_audiofile(output_audio_path, loggerNone) return ExtractAudioOutput(audio_pathoutput_audio_path, durationaudio.duration) class AddBackgroundMusicInput(BaseModel): video_path: str Field(description原視頻路徑) music_path: str Field(description背景音樂(lè)文件路徑) output_path: str Field(description合成后的視頻輸出路徑) music_volume: float Field(description背景音樂(lè)音量系數(shù)0.0-1.0, default0.3, ge0.0, le1.0) skill( nameadd_background_music, description為視頻添加背景音樂(lè)可以調(diào)整音樂(lè)音量。, input_modelAddBackgroundMusicInput, output_modelCutVideoClipOutput # 復(fù)用之前的輸出模型 ) def add_background_music(video_path: str, music_path: str, output_path: str, music_volume: float 0.3) - CutVideoClipOutput: with VideoFileClip(video_path) as video_clip, AudioFileClip(music_path) as music_clip: # 如果背景音樂(lè)比視頻短循環(huán)播放如果長(zhǎng)則截取 if music_clip.duration video_clip.duration: # 計(jì)算需要循環(huán)幾次 n_loops int(video_clip.duration / music_clip.duration) 1 music_clip music_clip.loop(nn_loops) # 截取音樂(lè)至視頻長(zhǎng)度 music_clip music_clip.subclip(0, video_clip.duration) # 調(diào)整音量 music_clip music_clip.volumex(music_volume) # 如果原視頻有音頻則混合否則直接使用背景音樂(lè) if video_clip.audio is not None: final_audio CompositeAudioClip([video_clip.audio, music_clip]) else: final_audio music_clip # 將混合后的音頻設(shè)置給視頻 final_video video_clip.set_audio(final_audio) final_video.write_videofile(output_path, codeclibx264, audio_codecaac, loggerNone) return CutVideoClipOutput(output_pathoutput_path, durationvideo_clip.duration)# skills/subtitle_skills.py import whisper from pydantic import BaseModel, Field from trae.skill import skill from moviepy.editor import VideoFileClip, TextClip, CompositeVideoClip import numpy as np class GenerateSubtitleFromAudioInput(BaseModel): audio_path: str Field(description音頻文件路徑) model_size: str Field(descriptionWhisper模型大小如 base, small, medium, defaultbase) class SubtitleSegment(BaseModel): text: str Field(description字幕文本) start: float Field(description開(kāi)始時(shí)間秒) end: float Field(description結(jié)束時(shí)間秒) class GenerateSubtitleFromAudioOutput(BaseModel): segments: list[SubtitleSegment] Field(description識(shí)別出的字幕片段列表) skill( namegenerate_subtitle_from_audio, description使用語(yǔ)音識(shí)別模型Whisper從音頻文件中生成字幕文本和時(shí)間戳。, input_modelGenerateSubtitleFromAudioInput, output_modelGenerateSubtitleFromAudioOutput ) def generate_subtitle_from_audio(audio_path: str, model_size: str base) - GenerateSubtitleFromAudioOutput: # 加載Whisper模型首次使用會(huì)下載模型 model whisper.load_model(model_size) # 轉(zhuǎn)錄音頻 result model.transcribe(audio_path) # 整理結(jié)果 segments [] for seg in result[segments]: segments.append(SubtitleSegment( textseg[text].strip(), startseg[start], endseg[end] )) return GenerateSubtitleFromAudioOutput(segmentssegments) class BurnSubtitlesToVideoInput(BaseModel): video_path: str Field(description原視頻路徑) subtitle_segments: list[SubtitleSegment] Field(description字幕片段列表) output_path: str Field(description燒錄字幕后的視頻輸出路徑) fontsize: int Field(description字幕字體大小, default24) color: str Field(description字幕顏色, defaultwhite) stroke_color: str Field(description描邊顏色用于提高可讀性, defaultblack) skill( nameburn_subtitles_to_video, description將字幕文本和時(shí)間戳燒錄硬編碼到視頻畫(huà)面上。, input_modelBurnSubtitlesToVideoInput, output_modelCutVideoClipOutput ) def burn_subtitles_to_video(video_path: str, subtitle_segments: list[SubtitleSegment], output_path: str, fontsize: int 24, color: str white, stroke_color: str black) - CutVideoClipOutput: with VideoFileClip(video_path) as video: clips [video] for seg in subtitle_segments: # 為每個(gè)字幕片段創(chuàng)建一個(gè)TextClip txt_clip (TextClip(seg.text, fontsizefontsize, colorcolor, stroke_colorstroke_color, stroke_width1.5) .set_start(seg.start) .set_duration(seg.end - seg.start) .set_position((center, bottom))) # 位置在底部居中 clips.append(txt_clip) # 將所有片段視頻所有字幕合成 final_video CompositeVideoClip(clips) final_video.write_videofile(output_path, codeclibx264, audio_codecaac, loggerNone) return CutVideoClipOutput(output_pathoutput_path, durationvideo.duration)關(guān)鍵點(diǎn)解釋W(xué)hisper集成generate_subtitle_from_audioSkill使用了OpenAI開(kāi)源的Whisper模型進(jìn)行語(yǔ)音識(shí)別。首次運(yùn)行時(shí)會(huì)下載模型base模型約150MB請(qǐng)確保網(wǎng)絡(luò)通暢。字幕燒錄burn_subtitles_to_videoSkill使用MoviePy的TextClip和CompositeVideoClip將字幕疊加到視頻上。這是一種“硬編碼”方式字幕將成為視頻圖像的一部分。錯(cuò)誤處理在實(shí)際項(xiàng)目中這些函數(shù)內(nèi)部需要更完善的異常處理如文件不存在、格式不支持、內(nèi)存不足等此處為簡(jiǎn)潔起見(jiàn)省略。4. 編排剪輯工作流Work有了獨(dú)立的Skill我們需要用Work將它們串聯(lián)起來(lái)形成一個(gè)完整的剪輯流水線。在works/video_mashup_work.py中定義。# works/video_mashup_work.py from typing import List from pydantic import BaseModel, Field from trae.work import work, Context # 導(dǎo)入我們定義的Skill確保它們?cè)赥rae中已注冊(cè) # 注意這里只是類型提示實(shí)際調(diào)用由Trae運(yùn)行時(shí)完成 class VideoMashupInput(BaseModel): 混剪工作流的輸入 video_paths: List[str] Field(description用于混剪的源視頻路徑列表) output_path: str Field(description最終混剪視頻的輸出路徑) target_duration: float Field(description目標(biāo)視頻總時(shí)長(zhǎng)秒, default30.0) music_path: str Field(description背景音樂(lè)文件路徑, default) add_subtitles: bool Field(description是否自動(dòng)生成并添加字幕, defaultFalse) class VideoMashupOutput(BaseModel): 混剪工作流的輸出 final_video_path: str Field(description最終生成的視頻路徑) duration: float Field(description實(shí)際生成的視頻時(shí)長(zhǎng)) clip_count: int Field(description使用的視頻片段數(shù)量) work( namevideo_mashup_workflow, description一個(gè)自動(dòng)化的視頻混剪工作流從多個(gè)視頻中抽取片段拼接成指定時(shí)長(zhǎng)的視頻可選添加背景音樂(lè)和字幕。, input_modelVideoMashupInput, output_modelVideoMashupOutput ) async def video_mashup_workflow(ctx: Context, video_paths: List[str], output_path: str, target_duration: float 30.0, music_path: str , add_subtitles: bool False) - VideoMashupOutput: 混剪工作流實(shí)現(xiàn)。 步驟 1. 獲取每個(gè)視頻的信息。 2. 規(guī)劃從每個(gè)視頻中截取多長(zhǎng)的片段。 3. 依次截取片段并保存為臨時(shí)文件。 4. 將所有臨時(shí)片段拼接成一個(gè)視頻。 5. 可選添加背景音樂(lè)。 6. 可選生成并燒錄字幕。 7. 清理臨時(shí)文件返回最終結(jié)果。 import os import tempfile from pathlib import Path temp_dir tempfile.mkdtemp(prefixtrae_mashup_) temp_clips [] # 步驟1 2: 獲取信息并簡(jiǎn)單規(guī)劃平均分配時(shí)長(zhǎng) clips_per_video target_duration / len(video_paths) used_duration 0.0 clip_count 0 for idx, v_path in enumerate(video_paths): # 調(diào)用 Skill: get_video_info info await ctx.run_skill(get_video_info, {video_path: v_path}) available_duration info.duration # 計(jì)算從這個(gè)視頻中截取多長(zhǎng)不超過(guò)視頻本身長(zhǎng)度 clip_duration min(clips_per_video, available_duration) if clip_duration 0: continue # 跳過(guò)時(shí)長(zhǎng)為0的視頻 # 隨機(jī)或固定起點(diǎn)這里簡(jiǎn)單從中間開(kāi)始 start_time (available_duration - clip_duration) / 2 temp_clip_path os.path.join(temp_dir, fclip_{idx}.mp4) # 調(diào)用 Skill: cut_video_clip clip_result await ctx.run_skill(cut_video_clip, { source_path: v_path, start_time: start_time, end_time: start_time clip_duration, output_path: temp_clip_path }) temp_clips.append(temp_clip_path) used_duration clip_result.duration clip_count 1 if clip_count 0: raise ValueError(未能從任何視頻中提取出有效片段。) # 步驟4: 拼接視頻 (這里簡(jiǎn)化使用MoviePy的拼接功能) # 注意實(shí)際項(xiàng)目中復(fù)雜的拼接可能需要更精細(xì)的處理如轉(zhuǎn)場(chǎng) from moviepy.editor import VideoFileClip, concatenate_videoclips video_clips [VideoFileClip(c) for c in temp_clips] final_clip concatenate_videoclips(video_clips, methodcompose) intermediate_video os.path.join(temp_dir, concatenated.mp4) final_clip.write_videofile(intermediate_video, codeclibx264, audio_codecaac, loggerNone) # 關(guān)閉所有clip以釋放資源 for c in video_clips: c.close() final_clip.close() current_video_path intermediate_video # 步驟5: 添加背景音樂(lè)如果提供了音樂(lè)路徑 if music_path and os.path.exists(music_path): music_video_path os.path.join(temp_dir, with_music.mp4) # 調(diào)用 Skill: add_background_music music_result await ctx.run_skill(add_background_music, { video_path: current_video_path, music_path: music_path, output_path: music_video_path, music_volume: 0.3 }) current_video_path music_video_path # 更新當(dāng)前處理中的視頻路徑 # 步驟6: 生成并添加字幕如果啟用 if add_subtitles: # 首先提取音頻 temp_audio os.path.join(temp_dir, temp_audio.wav) # 調(diào)用 Skill: extract_audio_from_video audio_result await ctx.run_skill(extract_audio_from_video, { video_path: current_video_path, output_audio_path: temp_audio }) # 生成字幕 # 調(diào)用 Skill: generate_subtitle_from_audio subtitle_result await ctx.run_skill(generate_subtitle_from_audio, { audio_path: temp_audio, model_size: base }) # 燒錄字幕到視頻 subtitled_video_path os.path.join(temp_dir, with_subtitles.mp4) # 調(diào)用 Skill: burn_subtitles_to_video burn_result await ctx.run_skill(burn_subtitles_to_video, { video_path: current_video_path, subtitle_segments: [seg.dict() for seg in subtitle_result.segments], output_path: subtitled_video_path }) current_video_path subtitled_video_path # 步驟7: 將最終視頻復(fù)制到用戶指定的輸出路徑 import shutil shutil.copy2(current_video_path, output_path) # 清理臨時(shí)目錄可選調(diào)試時(shí)可保留 # shutil.rmtree(temp_dir, ignore_errorsTrue) return VideoMashupOutput( final_video_pathoutput_path, durationused_duration, clip_countclip_count )關(guān)鍵點(diǎn)解釋work裝飾器類似于skill它定義了一個(gè)工作流。Work可以異步執(zhí)行并利用ctx.run_skill來(lái)調(diào)用已注冊(cè)的Skill。上下文Contextctx參數(shù)提供了運(yùn)行技能、管理狀態(tài)的能力。ctx.run_skill是核心方法它根據(jù)技能名稱和輸入?yún)?shù)來(lái)觸發(fā)對(duì)應(yīng)的Skill函數(shù)。流程編排這個(gè)Work清晰地定義了混剪的步驟獲取信息 - 規(guī)劃 - 裁剪 - 拼接 - 可選加音樂(lè) - 可選加字幕。這是一個(gè)線性的工作流實(shí)際可以設(shè)計(jì)更復(fù)雜的條件分支和循環(huán)。臨時(shí)文件管理視頻處理會(huì)產(chǎn)生大量中間文件。我們使用tempfile.mkdtemp創(chuàng)建臨時(shí)目錄并在最后可選地清理避免磁盤(pán)空間被占用。5. 集成與運(yùn)行讓 Trae 理解自然語(yǔ)言指令現(xiàn)在我們需要一個(gè)入口程序來(lái)加載所有Skill和Work并接受自然語(yǔ)言指令。創(chuàng)建main.py。# main.py import asyncio import os from pathlib import Path from dotenv import load_dotenv from trae import Trae from trae.skill import register_skill from trae.work import register_work # 加載環(huán)境變量 load_dotenv() # 導(dǎo)入我們定義的Skill和Work模塊 from skills import video_skills, audio_skills, subtitle_skills from works import video_mashup_work async def main(): # 1. 初始化Trae實(shí)例加載配置 config_path Path(__file__).parent / configs / trae_config.yaml trae_app Trae.from_config(str(config_path)) # 2. 自動(dòng)注冊(cè)當(dāng)前目錄下所有的Skill和Work # Trae會(huì)根據(jù)裝飾器自動(dòng)發(fā)現(xiàn)但需要先導(dǎo)入模塊。 # 我們也可以手動(dòng)注冊(cè)對(duì)于更復(fù)雜的項(xiàng)目 # 這里我們依賴from imports已經(jīng)完成了模塊加載。 # 3. 定義一個(gè)自然語(yǔ)言任務(wù) user_request 請(qǐng)使用我的視頻素材制作一個(gè)15秒的混剪短片。 素材在 ./inputs 目錄下我有三個(gè)文件beach.mp4, city.mp4, mountain.mp4。 請(qǐng)為它添加一個(gè)輕快的背景音樂(lè)音樂(lè)文件是 ./inputs/bgm.mp3。 最后為視頻生成并加上字幕。 輸出視頻保存到 ./outputs/my_mashup_final.mp4。 # 4. 讓Trae執(zhí)行這個(gè)任務(wù) # Trae會(huì)利用LLM理解請(qǐng)求并匹配到我們定義的 video_mashup_workflow。 print(f用戶請(qǐng)求: {user_request}) print(Trae 正在分析并執(zhí)行任務(wù)...) try: result await trae_app.run(user_request) print(\n 任務(wù)執(zhí)行成功 ) print(f最終輸出: {result.output}) if hasattr(result, final_video_path): print(f視頻已生成: {result.final_video_path}) print(f時(shí)長(zhǎng): {result.duration:.2f}秒, 使用了 {result.clip_count} 個(gè)片段。) except Exception as e: print(f\n!!! 任務(wù)執(zhí)行失敗 !!!) print(f錯(cuò)誤類型: {type(e).__name__}) print(f錯(cuò)誤信息: {e}) # 可以在這里添加更詳細(xì)的日志記錄 if __name__ __main__: asyncio.run(main())關(guān)鍵點(diǎn)解釋Trae初始化Trae.from_config從YAML文件加載配置特別是LLM的配置這是Trae理解自然語(yǔ)言的基礎(chǔ)。模塊導(dǎo)入導(dǎo)入Skill和Work模塊是關(guān)鍵一步這會(huì)使skill和work裝飾器生效將函數(shù)注冊(cè)到Trae的內(nèi)部注冊(cè)表中。自然語(yǔ)言請(qǐng)求我們將一個(gè)具體的剪輯需求描述成一段話。Trae的LLM會(huì)解析這段話識(shí)別出意圖制作混剪、參數(shù)時(shí)長(zhǎng)15秒、素材路徑、音樂(lè)路徑、要字幕并映射到video_mashup_workflow這個(gè)Work。執(zhí)行與結(jié)果trae_app.run(user_request)是核心調(diào)用。Trae會(huì)進(jìn)行任務(wù)規(guī)劃、分解并依次調(diào)用Work中的各個(gè)Skill。最終結(jié)果會(huì)包含Work定義的所有輸出字段。6. 運(yùn)行驗(yàn)證與結(jié)果分析在運(yùn)行前請(qǐng)確保你的inputs目錄下存在測(cè)試視頻如beach.mp4和背景音樂(lè)bgm.mp3。視頻格式最好是MP4編碼為H.264/AAC以保證兼容性。6.1 執(zhí)行程序在項(xiàng)目根目錄下運(yùn)行python main.py你將看到類似以下的輸出具體步驟和日志取決于Trae和LLM的交互用戶請(qǐng)求: 請(qǐng)使用我的視頻素材制作一個(gè)15秒的混剪短片... Trae 正在分析并執(zhí)行任務(wù)... [Trae] 解析用戶請(qǐng)求... [Trae] 匹配到工作流: video_mashup_workflow [Trae] 開(kāi)始執(zhí)行工作流... [Skill: get_video_info] 執(zhí)行中... [Skill: cut_video_clip] 執(zhí)行中... ... 任務(wù)執(zhí)行成功 最終輸出: {final_video_path: ./outputs/my_mashup_final.mp4, duration: 15.2, clip_count: 3} 視頻已生成: ./outputs/my_mashup_final.mp4 時(shí)長(zhǎng): 15.20秒, 使用了 3 個(gè)片段。檢查outputs目錄你應(yīng)該能看到生成的視頻文件。播放它確認(rèn)它包含了來(lái)自三個(gè)源視頻的片段、背景音樂(lè)以及生成的字幕。6.2 如何驗(yàn)證每個(gè)環(huán)節(jié)如果結(jié)果不符合預(yù)期你需要分步驗(yàn)證檢查Skill是否獨(dú)立工作可以寫(xiě)簡(jiǎn)單的測(cè)試腳本直接調(diào)用Skill函數(shù)傳入測(cè)試參數(shù)看是否能正確完成裁剪、加音樂(lè)、生成字幕等單一任務(wù)。檢查Workflow邏輯在Work函數(shù)中增加打印語(yǔ)句輸出每個(gè)階段的臨時(shí)文件路徑和關(guān)鍵變量如clip_duration,start_time看規(guī)劃邏輯是否正確。檢查T(mén)rae的規(guī)劃Trae框架可能提供更詳細(xì)的執(zhí)行日志。查看它是否正確解析了你的請(qǐng)求并調(diào)用了預(yù)期的Work和Skill。檢查FFmpeg/MoviePy錯(cuò)誤MoviePy底層調(diào)用FFmpeg。如果視頻處理失敗查看控制臺(tái)是否有FFmpeg報(bào)錯(cuò)信息。常見(jiàn)的如編碼器不支持、文件路徑含中文或空格、權(quán)限不足等。7. 常見(jiàn)問(wèn)題排查與優(yōu)化在實(shí)際運(yùn)行中你可能會(huì)遇到以下問(wèn)題7.1 環(huán)境與依賴問(wèn)題問(wèn)題現(xiàn)象可能原因檢查與解決ModuleNotFoundError: No module named traeTrae未正確安裝或不在當(dāng)前Python環(huán)境。確認(rèn)虛擬環(huán)境已激活并運(yùn)行pip list | grep trae檢查。FileNotFoundError: [Errno 2] No such file or directory: ffmpegFFmpeg未安裝或未加入系統(tǒng)PATH。在終端運(yùn)行ffmpeg -version。如果失敗重新安裝FFmpeg并確保其bin目錄在PATH中。OSError: MoviePy error: failed to read the duration of file ...視頻文件損壞、格式不被支持或路徑錯(cuò)誤。使用ffprobe -i your_video.mp4檢查視頻文件本身是否正常。確保使用絕對(duì)路徑或正確的相對(duì)路徑。運(yùn)行Whisper時(shí)卡住或報(bào)網(wǎng)絡(luò)錯(cuò)誤首次運(yùn)行需要下載模型網(wǎng)絡(luò)不暢。嘗試使用較小的模型如tiny或base??梢允謩?dòng)下載模型文件并放到緩存目錄通常~/.cache/whisper/。7.2 邏輯與運(yùn)行時(shí)問(wèn)題問(wèn)題現(xiàn)象可能原因檢查與解決生成的視頻沒(méi)有聲音。源視頻本身無(wú)音軌或剪輯/拼接時(shí)音頻流丟失。在cut_video_clip和concatenate_videoclips中確保使用了保留音頻的參數(shù)。檢查GetVideoInfoOutput.has_audio。字幕位置不對(duì)或顯示不全。字幕位置參數(shù)set_position或字體大小fontsize不適合視頻分辨率。調(diào)整set_position的參數(shù)例如(center, bottom-50)將字幕上移。根據(jù)視頻分辨率調(diào)整fontsize。背景音樂(lè)音量過(guò)大蓋過(guò)人聲。music_volume參數(shù)設(shè)置過(guò)高。在add_background_music技能中降低music_volume如0.1到0.2或?qū)崿F(xiàn)更智能的音量均衡算法。Trae沒(méi)有匹配到我定義的Work。Work的描述(description)不夠清晰或用戶請(qǐng)求與描述匹配度低。優(yōu)化Work的description使其更準(zhǔn)確地概括功能。在main.py中可以先用trae_app.list_works()查看已注冊(cè)的Work。處理長(zhǎng)視頻時(shí)內(nèi)存占用過(guò)高或崩潰。MoviePy默認(rèn)將整個(gè)視頻加載到內(nèi)存。對(duì)于長(zhǎng)視頻或高分辨率視頻考慮使用基于FFmpeg命令行的流式處理或使用VideoFileClip時(shí)指定target_resolution降低分辨率。7.3 性能與資源優(yōu)化建議模型選擇Whisper的base模型在精度和速度間取得平衡。對(duì)實(shí)時(shí)性要求高可選tiny對(duì)精度要求高可選small或medium。臨時(shí)文件處理大量或大文件時(shí)及時(shí)關(guān)閉MoviePy的Clip對(duì)象調(diào)用close()方法并清理臨時(shí)目錄避免內(nèi)存和磁盤(pán)泄漏。異步處理如果同時(shí)處理多個(gè)任務(wù)可以利用Trae和Python的異步機(jī)制但要注意FFmpeg/MoviePy可能存在的全局鎖或資源競(jìng)爭(zhēng)。緩存對(duì)于不變的中間結(jié)果如從固定視頻提取的音頻可以緩存起來(lái)避免重復(fù)處理。8. 擴(kuò)展方向與生產(chǎn)化思考這個(gè)原型展示了核心概念。要將其發(fā)展為實(shí)用工具可以考慮以下方向豐富Skill庫(kù)視頻效果添加調(diào)整亮度、對(duì)比度、飽和度添加濾鏡LUT穩(wěn)定防抖等Skill。音頻處理添加降噪、人聲增強(qiáng)、音量標(biāo)準(zhǔn)化、淡入淡出等Skill。高級(jí)剪輯添加添加轉(zhuǎn)場(chǎng)特效、畫(huà)中畫(huà)、關(guān)鍵幀動(dòng)畫(huà)、速度調(diào)整快放/慢放等Skill。素材管理添加從網(wǎng)絡(luò)下載素材、分析視頻情感/場(chǎng)景/人臉、自動(dòng)打標(biāo)簽等Skill。智能化工作流動(dòng)態(tài)規(guī)劃讓LLM根據(jù)視頻內(nèi)容通過(guò)視覺(jué)分析Skill獲取和用戶指令如“高潮部分多剪點(diǎn)”動(dòng)態(tài)決定每個(gè)片段的截取點(diǎn)和時(shí)長(zhǎng)而非簡(jiǎn)單平均分配。多模態(tài)理解結(jié)合視覺(jué)大模型如CLIP讓Trae能理解“剪出所有有狗狗的畫(huà)面”或“保留藍(lán)天白云的鏡頭”這類指令。條件分支與循環(huán)在Work中實(shí)現(xiàn)更復(fù)雜的邏輯例如“如果視頻太暗則先調(diào)亮再處理”。工程化與部署配置化將視頻編碼參數(shù)、模型路徑、臨時(shí)目錄等全部外置到配置文件。任務(wù)隊(duì)列與狀態(tài)管理對(duì)于長(zhǎng)時(shí)間任務(wù)引入任務(wù)隊(duì)列如Celery、RQ并提供任務(wù)狀態(tài)查詢和結(jié)果回調(diào)。API服務(wù)使用FastAPI等框架將Trae Agent封裝成HTTP API供前端或其他系統(tǒng)調(diào)用。容器化使用Docker封裝整個(gè)環(huán)境確保依賴一致便于部署。用戶體驗(yàn)Web界面構(gòu)建一個(gè)簡(jiǎn)單的前端用戶可以直接上傳素材、輸入指令、查看進(jìn)度和下載結(jié)果。進(jìn)度反饋在Work執(zhí)行過(guò)程中通過(guò)WebSocket或Server-Sent Events向用戶實(shí)時(shí)反饋當(dāng)前步驟和進(jìn)度。結(jié)果預(yù)覽與微調(diào)生成視頻后允許用戶在線預(yù)覽并提供簡(jiǎn)單的調(diào)整指令如“字幕再大點(diǎn)”、“音樂(lè)換一首”。通過(guò)這個(gè)項(xiàng)目你不僅學(xué)會(huì)了如何使用Trae構(gòu)建AI Agent更重要的是掌握了將AI能力與具體領(lǐng)域工具FFmpeg, MoviePy結(jié)合來(lái)解決實(shí)際工作流自動(dòng)化問(wèn)題的思路。從“動(dòng)嘴描述”到“自動(dòng)成片”這中間的橋梁正是由一個(gè)個(gè)精心設(shè)計(jì)的Skill和靈活編排的Work所搭建。