バイトダンス「Vidi2」は何を自動化するのか?動画編集の未来を探るテクノロジーの真意
Vidi2の中核技術
TikTokを擁するByteDanceが動画編集AI「Vidi2」を発表した。核心は「動画の理解と自動編集」で、コンピュータービジョンと大規模マルチモーダルモデルを組み合わせ、これまでプロのクリエイターが素材を吟味・カット・接合してきた属人性の高い作業を自動化しようとしている。
特徴的なのが高精度な時空間特定(STG)能力だ。動画内の特定オブジェクトがいつ、どこにいるかをテキストクエリ1つで1秒単位の精度で追跡し、タイムスタンプとバウンディングボックスを特定できるとされる。再設計された適応型トークン圧縮技術とGemma-3をバックボーンネットワークに採用することで、1時間以上の長尺コンテンツでも重要な詳細を損なわずに処理できるという。GoogleのGemini 3 ProやOpenAIのGPT-5のような強力なマルチモーダルモデルが並ぶ中、Vidi2は「長尺動画の深い理解」という点で独自の強みを示しているとされる。
応用機能とエコシステム戦略
ByteDanceはVidi2を基盤に、ハイライト抽出、ストーリー認識カット、コンテンツ認識レイアウト再構築、マルチアングル切り替えといった自動編集ツールを開発している。TikTokの「Smart Split」機能は、長い動画コンテンツをAIが分析し、短いクリップに再構成した上で字幕まで自動追加する。「AIアウトライン」機能は、トレンドトピックから動画タイトルや構成案を自動生成し、企画段階からの支援を目指す。
Vidi2はMemories.aiプラットフォームやAPIを通じて展開されており、ByteDanceはコードをGitHubで公開している。技術のオープン化を通じて開発者コミュニティを巻き込み、エコシステムを拡大しようとする狙いがあるとみられ、単に自社プロダクトへの組み込みにとどまらず業界標準を志向している可能性がある。動画生成AIのSeedanceとは異なり、Vidi2はあくまで既存動画の「編集」を自動化する技術という位置づけだ。
投資家・技術者にとっての意味
投資家にとっては、動画コンテンツの需要が拡大する中で、コンテンツ制作コストの削減と生産性向上に直結する技術として評価できる。技術者にとっては、GitHub上で公開されたコードとAPIが、動画関連アプリケーション開発の基盤になり得る。自動キャプション生成と多言語翻訳を組み合わせたグローバル配信、特定イベントに特化した自動ハイライト生成、パーソナライズされた動画コンテンツのリアルタイム生成など、応用の幅は広い。会議録画から重要発言を抜き出す議事録動画の作成や、ECサイトの商品紹介動画をターゲット層別に自動でバリエーション展開するといった業務用途も考えられる。
残る論点
AIが動画内の被写体や象徴的なシーンを正確に捉え時系列に並べることはできても、そのシーンが観客にどのような感情を抱かせるかという繊細なニュアンス、最適なカット割りやBGM選択、テロップのタイミングの判断は、依然として人間の編集者の経験と感性に委ねられる部分が大きい。動画が持つ本来のメッセージや感情が、自動編集によって薄れる可能性がないかという点は、技術の効率化と表裏一体の論点として残る。
まとめ
Vidi2は、動画コンテンツ制作における「理解」と「編集」の自動化を大きく前進させる技術だ。重要なのは、効率化が進む中で、人間のクリエイターが「何を伝えたいか」「どのようなストーリーを紡ぐか」という判断にどれだけ集中できるようになるかであり、AIと人間の役割分担がどう定着していくかが今後の焦点になる。