「ファイルができた」から先は、人がやらない ─ 動画1本で実証した業務自動化の設計図

撮影から編集、アップロード、タイトル・概要欄・サムネイルの生成、公開、SNS宣伝まで。個人のYouTube運用で人の手をほぼ外した実例を具体的に見せたうえで、これが「動画」の話ではなく「ファイルが生成された」というイベントを起点にした業務ワークフローの話であることを示す。会議録画・文字起こし・台帳転記・資料生成といった一般企業の手作業へそのまま置き換えられる、5層のアーキテクチャとして解説する。

動画で見る

「ファイルができた」から先は、人がやらない

今日お見せするのは、私が自分のYouTube運用で実際に動かしている自動化です。 ただ、本題は動画ではありません。動画は、いちばん分かりやすい題材として使うだけです。 話の順番は3つ。まず具体をぜんぶ見せます。次に、それを業務一般の形まで抽象化します。 最後に、自社でこれをやるなら何から始めるか、をお話しします。

かつては、全部が手作業だった

動画を1本出す、という作業を分解すると、驚くほど工程が多い。 録画して、不要なところを切って、書き出して、アップロードして、タイトルを考えて、概要欄を書いて、 サムネイルを作って、再生リストに入れて、公開して、SNSで告知する。 ひとつひとつは数分の作業です。でも数分の作業が10個並ぶと、1本あたり数時間になる。 そして重要なのは、この10工程のうち「私にしかできない仕事」は、実はほとんど無かったということです。

今は、こうなっている

これが現在の流れです。私が手を動かすのは、左端の「撮る」と、右のほうにある「公開ボタンを押す」だけ。 録画ファイルが置かれた瞬間から、編集、書き出し、アップロード、メタデータ生成、宣伝までが繋がっています。 間に人が入らないのではなく、「人が判断すべきところにだけ人が入る」形に置き換えた、というのが正確です。 ここから1工程ずつ、中で何が起きているかを見ていきます。

編集 ─ 無音を切って、型に流し込む

まず編集。OBSの録画フォルダから最新のファイルを見つけて、auto-editorという道具で無音部分を自動的に落とします。 閾値と前後のマージンは設定ファイルで環境ごとに調整できるようにしてあります。 切り終わったら、DaVinci Resolveのスクリプティング APIを叩いて、テンプレートのプロジェクトを作り、 オープニングとエンディングを繋いだタイムラインを組み立てる。人はResolveを開いてすらいません。 ポイントは「毎回同じ形に作る」と決めたことです。型が決まっているから機械に渡せる。

自動化できない場所を、先に見切る

画面キャプチャとカメラの2ファイルを扱う場合は、音声の波形を相関させて自動でぴったり同期させています。 ずれていたら止める。ここは自動化が効く典型です。 一方で、スムーズカットのトランジションやグリーンバックの合成は、Resolveのスクリプト APIからは操作できません。 だからそこは最初から手作業と決めて、自動化の対象から外してあります。 これは負けではなく設計です。「できない部分」を早く確定させるほど、残りを迷わず自動化できる。

分岐点は、機械が中身を読めるようになったこと

ここが全体でいちばん重要な一枚です。 編集済みの動画をWhisperで文字起こしして、その文字起こしをAIに読ませる。 するとシステムは初めて「この動画が何の話なのか」を知ります。 従来の自動化は、ファイルを運ぶ・変換する・コピーするところまでしかできませんでした。 中身を理解して、そこから文章を書き起こす仕事は人間の担当だった。そこが変わった。 文字起こしは人間が書く要約より正確なことすらあります。人は要点を落としますが、機械は全部拾うので。

素材1つから、成果物が何個も出る

内容が読めるようになると、そこから作れるものが一気に増えます。 タイトル、概要欄、サムネイル、関連する再生リストの選定、ショート動画の切り出し、SNS各媒体向けの告知文、ブログの下書き。 全部、同じ1本の理解から派生しています。 ここが自動化の投資対効果が跳ねるところです。理解の層を1回作れば、出口はいくらでも足せる。 新しい配布先が増えても、作り直すのは出口の1つだけで済みます。

人が押すボタンは、残す

全部できるからといって、全部やらせてはいません。 生成が終わると、下書き一式を持って承認の通知が飛んできます。私はそれを見て、公開を承認する。 公開とSNS発信は、必ず人の承認の後ろに置いてあります。取り返しがつかない操作だからです。 それから、収益化の設定のようにそもそもAPIが提供されていないものもある。 これは「まだ自動化していない」ではなく「構造上できない」ので、手作業と割り切って手順書に書いてあります。

ここまでが具体の話

ここまでが、私の環境で実際に動いているものの話です。 ここから、これを皆さんの業務に持ち帰れる形まで抽象度を上げます。 結論から言うと、これは動画編集の話ではありません。

本質は「ファイルが生成された」だけ

いま見ていただいた仕組みの入口は、突き詰めると1つのイベントです。 「新しいファイルがそこに置かれた」。それだけ。 であれば、そのファイルが会議の録画でも、スキャンした書類でも、機器が吐いたログでも、 現場で撮った写真でも、まったく同じ形が使えます。 自動化の設計とは、業務を工程で考えるのをやめて、「何が起きたら動き出すのか」で考え直すことです。

中身はいつも、この5層

題材が変わっても、中身の構造は変わりません。5つの層です。 1つめ、検知。何かが置かれた・終わった、を拾う。 2つめ、取り込みと正規化。手元に持ってきて、いつも同じ形に整える。 3つめ、理解。文字起こしとAIで、中身が何なのかを構造化されたデータにする。 4つめ、生成。そのデータから成果物の下書きを作る。 5つめ、反映と配布。決められた置き場所とテンプレートに、機械が流し込む。 そして全体を貫くのが、承認ゲートと記録です。誰が何を承認して何が出ていったのかが残ること。

会議録画に置き換えてみる

では同じ5層に、よくある業務を当てはめます。オンライン会議です。 会議が終わると録画と文字起こしができる。これが検知と取り込み。 その文字起こしをAIに読ませて、決定事項、宿題、担当者、期日を構造化データとして取り出す。これが理解。 そこから議事録、台帳に入れる行、報告資料の本文コメントを作る。これが生成。 最後に、台帳の該当行へ書き込み、テンプレートの資料に流し込み、関係者へ配る。これが反映と配布。 人がやるのは、出てきたものを確認して承認することだけになります。

手作業は、いつも「境界」に溜まる

ここで、自社の業務のどこを見ればいいかという話をします。 手作業が残っている場所には強い法則があります。システムとシステムの境界です。 文字起こしを人が整形して、表計算の該当行に貼り付ける。それを別の実行環境へコピーして、処理を回す。 出てきた結果を見て、人が文章を書く。その文章と画像を、テンプレートの資料に一枚ずつ貼っていく。 この連鎖は、どの会社にも形を変えて必ずあります。そして貼り付け作業そのものには、付加価値が一切ない。 ここが最初に取るべき場所です。判断ではなく転記だから、機械に渡しても失うものがない。

人に残すもの、機械に渡すもの

線の引き方はシンプルです。 機械に渡すのは、転記、整形、集計、そして「下書きを書く」こと。下書きまでは機械の仕事です。 人に残すのは、判断、責任、例外対応、そして関係者との交渉。 よくある失敗は、人が下書きから書き始めてしまうこと。人の時間は、直すことと決めることに使うべきです。 ゼロから書くのと、出てきたものを直すのとでは、かかる時間がまるで違います。

始め方は、3手だけ

いきなり全社の業務を並べる必要はありません。3手で足ります。 1つめ、いちばん頻度が高い流れを1本だけ選ぶ。毎週必ず発生しているものがいい。 2つめ、成果物の型を先に固定する。型が決まっていないものは自動化できません。逆に、型を決めるだけで手作業は半分減ります。 3つめ、承認ゲートを1つだけ置く。全自動を目指さない。人が最後に見る場所を決めておけば、安心して回せます。 私の場合も、最初から全部繋がっていたわけではなく、無音カットの1工程から始まっています。

相談してください

今日お見せしたものは、特別な基盤も、大きな予算も使っていません。 必要だったのは、業務を「イベントと成果物」で捉え直すことと、どこに人を残すかを決めることだけです。 同じ形は、会議、書類、検査記録、日報、問い合わせ、どこにでも当てはまります。 自社の業務のどこから手を付けられそうか、いま貼り付け作業がどこに溜まっているか。 そういう話でかまいません。こういう仕組みを作りたい、と思ったら声をかけてください。一緒に設計します。

応援お願いします!

共通テンプレート(src/deck-shared.tsx の CtaSlide)。

Ebisuda Presentations のトップへ