AI Topica

比較・活用

動画編集AIの学習、クラウド版ChatGPTとローカルPremiereをどう使い分けるか

動画編集にAIを取り入れたいと考えても、クラウド版のチャットAIとローカルの編集ソフトのどちらに任せるべきかは判断が分かれます。素材と完成動画を見せて編集の型を学習させる方法を試した結果から、使い分けの線引きが見えてきました。

何が起きたか

8月下旬には、ChatGPTに米Adobeのプラグインを導入し、クラウド上のツールで画像処理をさせる方法が試されました。静止画はうまく動作した一方、動画は機能的にまだ十分ではなく、クラウド上に映像をアップロードする必要があるなどの制約が残ったといいます。

9月にはデスクトップ版のPremiereが26.5にアップデートし、生成メディアツールが搭載されました。以前から搭載されていた生成AIによるクリップ延長機能が拡張され、タイムライン上の特定部分に生成AI動画をプロンプトで直接指定できるようになっています。

今回はPremiereとGPT-6 Astraの組み合わせが試されました。接続には、GPTが画面操作を通じて他のアプリを操作できる「Computer Use」というプラグインが使われています。編集前の素材と編集後の完成コンテンツをPremiereに読み込ませ、GPT-6 Astraにその差分を分析させて編集テンプレートを作成し、さらに知見を「スキル」として保存しました。別の素材にこのスキルを適用したところ、約7分のトークが約17分の作業を経て約5分のコンテンツにまとめられています。音声をセンターに定位させる処理など、明示的に指示していない部分まで再現されていたといいます。

背景・解説

Computer Useとは、GPTが人間が操作するものと同じ画面上の操作を通じて、他のアプリケーションを動かす機能です。人間ができる操作はおおむね実行できる反面、処理に時間がかかるという弱点があります。これに対して、前回の記事で紹介されたDaVinci ResolveとGPTの接続では、DaVinci側でMCPサーバを立て、そこへGPTがアクセスする方式が採られていました。MCPサーバは画面操作を経由せずアプリの機能を直接駆動できるため、より高速に動作しますが、できることはサーバ側が実装・公開している機能の範囲に限られます。

今回の接続方式と機能を整理すると、次のようになります。

  • Computer Use経由のGPT-6 Astra:画面操作を模倣するため汎用性は高いが、別素材の編集に約17分の処理時間がかかった
  • MCPサーバ経由のDaVinci Resolve連携:画面操作を経由しないため高速だが、使える機能はサーバ側が公開した範囲に限定される
  • Premiere26.5本体の生成メディアツール:タイムライン上でプロンプトを指定し生成AI動画を直接追加できるが、完成動画から編集スタイルを学習してスキルとして保存する機能は持たない

今回のテストでは、素材と完成動画の比較によってテンプレートとスキルをMarkdown形式で出力させ、それを使って別の素材を自動編集させるところまでを、Computer Use経由のGPT-6 Astraで実行しています。

仕事や業務への影響 — AI Topicaの見方

毎週同じ形式の動画を定期的に作っている編集担当者ほど、この組み合わせの効果は大きくなります。例えば、社内広報チームで毎月1本、同じ構成の社内報動画を1人で編集している担当者であれば、完成動画と素材をGPT-6 Astraに読み込ませてスキル化しておくことで、次回以降の粗編集にかかる時間を大幅に圧縮できます。

一方で、編集のたびに構成が大きく変わる案件や、スピードが最優先される現場では、Computer Use経由の接続は向いていません。約7分の素材を編集するのに約17分かかったという結果からも分かる通り、画面操作をなぞる方式は待ち時間が発生します。例えば、1日に10本の短尺動画を仕上げる必要がある広告代理店の編集チームなら、この待ち時間の積み重ねは業務の遅延につながります。この場合は、Premiere26.5本体に搭載された生成メディアツールで、タイムライン上の必要な部分だけに生成AI動画を直接差し込む方法のほうが実務に合っています。

編集スタイルの「学習」が必要な定型業務はクラウド版ChatGPTとComputer Useの組み合わせに任せ、スピードが必要な単発の加工作業はローカルPremiereの生成メディアツールで処理する、という役割分担が実務上は有効です。経理部門や総務部門が社内研修動画を定期的に作る場合も同様で、フォーマットが固定されている業務ほど学習型の活用が効きます。

不確かな点・注意

今回の結果は、モノローグ形式で10分から15分程度の素材を10分以内にまとめるという、比較的シンプルな編集パターンを前提にしています。カット編集が複雑な案件や、複数人が登場する動画でも同様の精度が出るかどうかは、今回のテストだけでは判断できません。

また、音声をセンターに定位させる処理が明示的な指示なしに再現された点について、カメラマイクの音声が完全に除去されたのか、一部混在しているのかは音質からは判別できませんでした。タイトルの内容についても、本編の要約として挿入される仕組みなのか、毎回同じ結果になるのかは今回の1回のテストだけでは確かめられていません。Computer Use経由の処理時間も素材の長さや編集内容によって変わるため、約17分という数字がそのまま他の案件に当てはまるとは限らず、数字の一人歩きには注意が必要です。

出典

  1. 素材と完成動画を見せるだけ “型”を覚えたAIに動画編集をどこまで託せるか GPT-6 Astraで試す(1/2 ページ)

AI Topica 編集部