AI

video-use:讓 AI Coding Agent 剪片的極致 Token 節約設計

本內容僅供參考,詳細使用規則與工具安全性與否,建議要進行相關安全性測試與評估

AI Agent 能上網、能寫程式、能查資料庫——但「剪片」這件事一直是個坑。問題不在技術難度,而在成本:一段 20 分鐘的影片有 30,000 幀,若逐幀丟給語言模型分析,光 token 費用就能讓預算報廢。video-use 給出了一個截然不同的解法,用兩層輕量結構把這個成本壓到幾乎忽略不計——而且整套工作流程讓 Agent 自己決策,不需要人一步一步下指令。


1. 專案背景與定位

video-use 由 browser-use 團隊開發。browser-use 本人已是 AI Agent 工具生態的知名項目——它讓語言模型能夠操控瀏覽器,核心創新是把網頁的複雜 HTML DOM 轉成結構化文字,讓 LLM 不必「看截圖」就能理解頁面。

video-use 把同一個哲學搬進了影片世界:不要讓 LLM 看影片幀,讓它讀影片的結構化表示。

專案於 2026 年登上 GitHub 趨勢排行,目前累積超過 12k Stars、1.6k Forks,語言分布為 Python(76%)+ HTML(22.9%),採 MIT 授權。定位清晰:面向使用 Claude Code、OpenCode、Cursor 等 AI Coding Agent 的開發者,希望讓 Agent 能夠端對端處理「丟原始素材進去、聊幾句、輸出剪好的 final.mp4」這個工作流程。


2. 技術架構與核心設計

兩層輕量資訊模型

video-use 的技術核心是一套雙層資訊架構,徹底迴避了逐幀分析的 token 地獄:

Layer 1 — 音訊逐字稿層(主要決策依據)

每個來源影片呼叫一次 ElevenLabs Scribe API,取得:

  • 逐字稿(毫秒級 word-level 時間戳記)
  • 說話者辨識(Speaker Diarization)
  • 音訊事件標記(如 (laughter)(applause)(sigh) 等)

這份資料壓縮後約 12KB,成為 Agent 的主要推理依據。

Layer 2 — 視覺合成層(按需呼叫)

只在需要視覺確認的決策點生成:timeline_view 工具產生包含縮圖連帶、波形圖、字詞標籤的 PNG——不是掃描整段影片,而是「看這個時間點附近長什麼樣」。

數字讓這個設計的差異一目了然

方法 Token 消耗
天真做法:逐幀分析(30,000 幀 × 1,500 tokens) 4,500 萬 tokens
video-use:結構化文字 + 少量 PNG ≈ 12KB 文字

這不是優化,是數量級的差異。

SKILL.md 驅動 Agent 行為

video-use 用一份 SKILL.md 描述 Agent 應如何使用這套工具,和 browser-search 採用同樣的「技能文件」設計模式——不綁定特定框架,任何能讀自定義指令的 Agent 平台都能接入。

SKILL.md 定義了 12 條生產正確性硬性規則(non-negotiable),例如:

  • 字幕必須在 FFmpeg 濾鏡鏈的最後一層套用(避免遮蓋其他 overlay)
  • 每個切點必須加入 30ms 音訊淡出,防止可聽到的「爆音」
  • 剪切點必須對齊字詞邊界,絕不在單詞中間切割
  • 逐字稿針對同一來源快取,不重複呼叫 Scribe

工作流程強制走 詢問 → 確認 → 執行 → 迭代 → 持久化 五步驟。文件明確寫道:「Never touch the cut until the user has confirmed the strategy in plain English.」——這讓 Agent 不會自作主張亂剪。

動畫 Overlay 的平行子 Agent 設計

當需要生成動畫時,video-use 支援四種引擎:HyperFrames、Remotion、Manim 或 PIL,並以平行子 Agent 方式同時跑多個動畫渲染任務,不必等一個做完再做下一個。渲染完成後,主 Agent 在每個切點邊界執行自我評估,確認輸出品質符合預期才交付。

工作階段持久化

Agent 把每個專案的狀態寫入 project.md,下次開啟同一個工作階段時能繼續上次的進度,不必重新轉譯影片或重建上下文。


3. 社群熱度與生態採用

指標 數值
Stars 12k+
Forks 1.6k
Open Issues 11
Pull Requests 36
License MIT
語言 Python 76%, HTML 22.9%

12k Stars 對一個專注在特定垂直場景(AI 剪片)的工具來說是強烈的市場訊號。36 個 PR 代表社群積極貢獻,而非純粹圍觀。

從生態整合來看:

  • 轉錄依賴 ElevenLabs Scribe(市場上精度最高的逐字稿 API 之一)
  • 影片處理底層依賴 FFmpeg(工業級標準,無授權問題)
  • 動畫渲染支援 Remotion(React 驅動影片渲染)和 Manim(程式生成數學動畫,3Blue1Brown 用的那套)
  • 與 Claude Code 深度整合,README 開頭即以 Claude Code 為主要使用情境

4. 局限性與潛在風險

技術邊界:

  • 強依賴 ElevenLabs API:沒有 ElevenLabs API Key,整個轉錄層就失效。ElevenLabs 是付費服務,長影片費用不低;替換成其他轉錄服務需要修改工具鏈。
  • 音訊主導設計的盲點:Layer 1 以音訊為主要決策依據,對於純視覺編輯(例如:b-roll 切換、特效鏡頭對齊、靜音段落的視覺節奏)的判斷能力相對有限。
  • 動畫引擎依賴複雜:同時支援四種動畫引擎(HyperFrames、Remotion、Manim、PIL)意味著環境建置複雜,不同引擎的安裝依賴可能互相衝突。

安全與工程風險:

  • Agent 執行 FFmpeg 命令:FFmpeg 指令的 shell 執行存在注入風險,若用戶輸入的影片路徑或參數未充分清理,可能產生路徑遍歷或命令注入問題。
  • SKILL.md 是活的合約:SKILL.md 的 12 條硬性規則若被 Agent 誤讀或無視(不同 Agent 模型遵從度不同),可能輸出不符合規格的影片。
  • 目前 commits 僅 16 個:專案仍非常早期,API 穩定性與向後相容性尚未驗證。

5. 應用價值與適用場景

最適合的團隊與個人:

  1. 技術型 YouTuber / 教學影片創作者:有大量需要去除贅詞、加字幕的素材,且已在使用 Claude Code 或類似 Agent 工具的工作流程。
  2. Podcast 後製自動化:音訊主導的設計天然適合 Podcast——把 MP3 換成去雜音的影片版本,讓 Agent 自動切掉 "umm"、"uh"、靜默段落。
  3. SaaS 產品的 Demo Video 製作:產品更新迭代頻繁,每次都要重剪 Demo 影片,video-use 的對話式剪輯讓這件事可以自動化。
  4. Agent 工具開發者:video-use 的雙層架構和 SKILL.md 模式本身就是值得研究的設計參考。

與其他 AI 影片工具的差異:

工具 定位 Agent 友好 自架 Token 效率
video-use Coding Agent 剪輯 極高 極高
Runway Gen AI 生成影片 不適用
Descript 基於字幕的人工剪輯 不適用
OpusClip 自動短影片剪輯 不適用

video-use 的定位非常獨特:它不是要取代 Premiere Pro 或 Descript,而是讓 AI Coding Agent 能夠端對端完成影片後製這個任務——這個位置目前幾乎沒有直接競爭者。


Monday 的觀點與架構建議

最值得學習的設計決策:

video-use 最值得借鑑的不是功能清單,而是**「資訊密度最大化」**這個核心思路。它問的問題是:「LLM 處理這個任務,最少需要哪些資訊?」而不是「我能給 LLM 多少資訊?」前者導向 12KB 的逐字稿;後者導向 45M tokens 的帳單。

這個思路可以應用到任何 Agent 工具設計:在餵資料給 LLM 之前,先問「這些資訊的哪個壓縮表示最保留決策相關性?」

生產環境採用建議:

  1. ElevenLabs 費用控制:設定每個專案的 API 呼叫預算上限,並嚴格遵守 SKILL.md 的「同一來源不重複轉錄」規則,避免意外重複計費。
  2. FFmpeg 命令沙箱化:在生產環境中,把 FFmpeg 執行限制在 Docker container 內,且以非 root 使用者執行,降低命令注入的爆炸半徑。
  3. ElevenLabs 降成本替代方案:若預算有限,可嘗試替換 Layer 1 為本地模型(如 whisper.cpp 或 faster-whisper),犧牲說話者辨識精度換取零 API 費用——但需要修改工具介面以符合 SKILL.md 的資料格式規範。
  4. SKILL.md 版本管理:在 CI/CD 中加入 SKILL.md 的 hash 驗證,確保工具規則更新後 Agent 的行為符合預期,而不是靜默採用舊版規則。

對 AI 應用開發方向的意義:

video-use 和 browser-use 代表了同一個「工具哲學」的延伸:把非結構化的環境(網頁、影片)轉成 LLM 能夠高效推理的結構化表示,然後讓 Agent 透過工具調用執行動作。這個模式——感知壓縮 + 動作執行——正在成為「讓 Agent 能做到 X」的標準套路。

當越來越多的領域都有了這樣的「X-use」工具(video-use、browser-use、document-use……),AI Agent 的能力邊界就不再是模型能力的函數,而是工具生態的函數。


參考來源