CM・動画制作で手書きされた絵コンテのカット番号・秒数・セリフ・テロップを読み取り、撮影と編集の香盤表に起こす
演出家が手書きした絵コンテを読み取り、カットごとの番号・秒数・場所・出演者・セリフ・ナレーション・テロップをそろえます。撮影の段取りに使う香盤表と、編集用の台本表に起こし、秒数の合計の食い違いと読めない箇所を拾います。
- 生成AI
- Azure OpenAI Service/Claude/Gemini
- AIサービス
- Azure AI/Google Document AI
- 対象業界
- 広告
- 対象部門
- マーケティング
- 対象業務
- データ入力・転記/書類作成
- 主な課題
- 入力作業が多い/引き継ぎができていない/確認ミスが多い
- AIで行う処理
- 読み取り(OCR)
- 主な効果
- 入力漏れ削減/対応スピード向上/工数削減
- 導入難易度
- ★★★☆☆
- 実装レベル
- 半自動化
- 費用感
- API連携(中)
- 人間の確認
- 必須
01導入前 / 導入後の業務フロー
- 演出家から絵コンテの紙を受け取り、スキャンして共有フォルダに置く
- 制作進行が絵コンテを見ながら、香盤表のテンプレートにカット番号・場所・出演者・小道具を打ち込む
- 同じ絵コンテを見ながら、台本表にセリフ・ナレーション・テロップを打ち込む
- 秒数を表に打ち込み、合計が尺と合うかを確かめる
- 読めない字や、場所・出演者が書かれていないカットを、演出家に聞く
- 香盤表と台本表をスタッフに配る
- 改訂版が出たら、変わったカットを探して1から打ち直す
- 人演出家から受け取った絵コンテをスキャンし、案件のフォルダに版の番号を付けて保存する
- 自動保存をきっかけに処理が動き、ページ数・寸法・向きを確かめる
- 自動レイアウトモデルが、絵コンテの表のセル、手書きの文字、コマの絵の位置と切り抜き画像を返す
- 自動生成AIが、表のセルをカットごとの項目にそろえる。セリフとテロップは一字も変えずに写す
- 自動秒数を合計して尺と照らし、前の版と比べて変わったカットに印を付ける
- 自動香盤表と台本表の下書きを、テンプレートの形で作る。各カットにコマの絵の切り抜きを添える
- 人制作進行が、絵コンテの画像と下書きを並べて確かめる。テロップは1字ずつ照らす
- 人読めない箇所と、尺の食い違いを演出家に聞く
- 人撮影の順番を組み、香盤表を確定してスタッフに配る
各工程の詳しい説明を読む
- 演出家から絵コンテの紙を受け取り、スキャンして共有フォルダに置く
- 制作進行が絵コンテを見ながら、香盤表のテンプレートにカット番号・場所・出演者・小道具を打ち込む
- 同じ絵コンテを見ながら、台本表にセリフ・ナレーション・テロップを打ち込む
- 秒数を表に打ち込み、合計が尺と合うかを確かめる
- 読めない字や、場所・出演者が書かれていないカットを、演出家に聞く
- 香盤表と台本表をスタッフに配る
- 改訂版が出たら、変わったカットを探して1から打ち直す
(a)同じ絵コンテを2回読む。 香盤表と台本表は、見る人も欄も違うので、別々に打ち込みます。同じカットの同じ字を、2回読んで2回打ち込んでいます。 2回目の打ち込みで、1回目と違う読み方をすることもあります。
(b)テロップの写し間違いが、編集で見つかる。 「税込」と「税抜」、「〜まで」と「〜から」。手書きのテロップの1字違いは、広告の表示の誤りにつながります。 台本表の段階で気づけばよいのですが、編集でテロップを入れたあと、広告主の確認で見つかることがあります。
(c)秒数の合計が合わない。 改訂でカットが足されたのに、ほかのカットの秒数が直っていない。15秒のCMで合計が16秒になっていることに、編集の段階で気づきます。 その時点で、どのカットを縮めるかを演出家と決め直します。
(d)改訂のたびに、どこが変わったかを探す。 改訂版の絵コンテには、変わったところに印が付いていないことが多く、前の版と1コマずつ見比べて、変わったカットを探します。
- 【人】 演出家から受け取った絵コンテをスキャンし、案件のフォルダに版の番号を付けて保存する
- 【自動】 保存をきっかけに処理が動き、ページ数・寸法・向きを確かめる
- 【自動】 レイアウトモデルが、絵コンテの表のセル、手書きの文字、コマの絵の位置と切り抜き画像を返す
- 【自動】 生成AIが、表のセルをカットごとの項目にそろえる。セリフとテロップは一字も変えずに写す
- 【自動】 秒数を合計して尺と照らし、前の版と比べて変わったカットに印を付ける
- 【自動】 香盤表と台本表の下書きを、テンプレートの形で作る。各カットにコマの絵の切り抜きを添える
- 【人】 制作進行が、絵コンテの画像と下書きを並べて確かめる。テロップは1字ずつ照らす
- 【人】 読めない箇所と、尺の食い違いを演出家に聞く
- 【人】 撮影の順番を組み、香盤表を確定してスタッフに配る
7番目が、この設計の分かれ目です。人は全件を見ます。 ただし、見るのは「打ち込む」作業ではなく「打ち込まれたものを確かめる」作業です。テロップだけは、信頼度にかかわらず全件を1字ずつ照らします。
9番目の撮影の順番は、AIに組ませません。 場所と出演者でカットをまとめる並べ替えまでは処理の側で行いますが、日の傾き、出演者の拘束時間、機材の移動の段取りは、制作進行と監督が決めます。
02今回想定するシステム構成
手書きの絵コンテ(A4横、1ページ4〜6コマ) │ 案件のフォルダに版の番号を付けてスキャン ▼【トリガー】保管場所への PDF の保存 Azure Functions ── ページ数・寸法・向きの確認、案件と版の番号の取り出し ▼ Azure AI Document Intelligence(レイアウトモデル) │ 表のセル、手書きの文字、手書きかどうか、コマの絵(figures)と切り抜き画像 ▼ Azure OpenAI ── カットごとの番号・秒数・場所・出演者・セリフ・NA・テロップ・小道具にそろえる ▼ Azure Functions ── 秒数の合計と尺の照合、前の版との差分、場所・出演者での並べ替え ▼ 香盤表と台本表の下書き(コマの絵の切り抜き付き) ▼ 【制作進行が確認し、演出家に確かめて確定】→ スタッフへ配布
| 役割 | 想定する製品 | 代替候補 |
|---|---|---|
| OCR | Azure AI Document Intelligence(レイアウトモデル) | Google Document AI(Form Parser) |
| 生成AI | Azure OpenAI(Microsoft Foundry)(構造化出力でカットごとの項目を返す) | Claude API、Gemini API |
| 連携 | Azure Functions(起動、尺の照合、版の差分、表の作成) | Azure Logic Apps |
| 保管 | Azure Blob Storage(絵コンテの画像、切り抜き、読み取り結果) | 社内のファイルサーバー |
香盤表と台本表のテンプレートは、新しく足すものではありません。 足すのは、絵コンテを読み取ってテンプレートの形の下書きを作る中継の処理です。下書きはファイルで出し、制作進行が確かめてから、いつものテンプレートに貼り込みます。
読み取りには、Azure AI Document Intelligence のレイアウトモデルを使います。 文字・表・選択マーク・文書の構造を取り出すモデルで、表は行数と列数、セルごとの行と列の位置を返します。 絵コンテの「カット番号」「内容」「セリフ・NA」「テロップ」「秒数」の欄は、この表のセルとして読めます。
日本語の手書きに対応していることを確かめてあります。 公式の言語対応の表では、Read と Layout の手書きの対応言語に日本語(ja)が載っています。レイアウトモデルは、行ごとに手書きの書体かどうかを styles として信頼度つきで返すので、用紙に印刷された欄の名前と、演出家が書き込んだ文字を見分けられます。
コマの絵は、図(figures)として扱います。 公式の説明では、レイアウトモデルは文書の中の図(グラフや画像)を figures として検出し、位置(boundingRegions)と、関連する文字の範囲(spans)を返します。解析のときに output=figures を指定すると、検出した図の切り抜き画像が作られ、取り出せます。 香盤表の各カットに、そのコマの絵の切り抜きを添えられます。
縦書きの絵コンテは、この記事の前提から外します。 公式のページで、手書きの縦書きの読み取りの扱いは確かめられませんでした。本記事は、欄の中の文字が横書きの様式を前提にします。 縦書きの欄のある様式は、第8章の最小構成で読めるかを先に確かめてください。
03どうやって実装するのか
処理の起点を決める
スキャンした PDF が案件のフォルダに保存されたことを起点にします。 絵コンテは改訂のたびに出るので、ファイル名に案件の番号と版の番号を入れる決まりにします(例:A2410_v3.pdf)。版の番号があれば、前の版との比較ができます。
演出家から絵コンテを受け取ったら、その場でスキャンします。 撮影の前日に最終版が出ることもあるので、夜間の一括処理にはしません。 受け取って数分で下書きが届けば、演出家がまだ打ち合わせの場にいるうちに、読めない箇所を聞けます。
処理が終わった PDF には「処理済み」の印を付けます。印を付けるのは、下書きの作成に成功したときだけにします。
入力データを集める
| データ | 中身 | 取得元 |
|---|---|---|
| 絵コンテの PDF | 案件の番号、版の番号、ページ数 | 複合機のスキャン |
| 読み取り結果 | 表のセル(行・列の位置)、手書きの文字と信頼度、styles、figures と切り抜き | レイアウトモデル |
| 案件の情報 | 尺(15秒・30秒・60秒など)、広告主、商品名、出演者の一覧、撮影の場所の候補 | 案件の管理表 |
| 前の版の結果 | 前の版のカットごとの項目 | この構成の保存 |
| 欄の名前の一覧 | 用紙の欄の名前と、項目の対応(「S#」「C#」「CUT」はカット番号、など) | 制作部で作る一覧 |
| 用語の一覧 | 商品名・ブランド名・出演者名・撮影の場所の正しい表記 | 案件の管理表 |
質を決めるのは、案件の情報と用語の一覧です。 尺が分からなければ、秒数の合計を照らせません。商品名や出演者名の正しい表記が無ければ、読み取った字が正しいかを確かめる先がありません。 ただし、用語の一覧は「照らす」ために使い、読み取った字を一覧の表記に書き換えることはしません(後述)。
欄の名前の一覧が要るのは、演出家ごとに用紙が少しずつ違うからです。 「秒」と書く人、「TIME」と書く人、「尺」と書く人がいます。欄の名前を項目に結び付ける一覧を持てば、用紙の違いを吸収できます。
データの取得方法を決める
絵コンテは、レイアウトモデルに output=figures を付けて読みます。 取るものは次のとおりです。
| 取るもの | どこから | 何に使うか |
|---|---|---|
| 表のセル | tables の cells(rowIndex、columnIndex、content) | カットごとの欄の値 |
| 手書きかどうか | styles の isHandwritten と spans | 印刷された欄の名前と書き込みの区別 |
| 単語ごとの信頼度 | words の confidence | 読みの怪しい字の印 |
| コマの絵の位置 | figures の boundingRegions | どの行(カット)の絵かの対応 |
| コマの絵の切り抜き | output=figures で作られる画像 | 香盤表に添える |
コマの絵とカットの行は、位置で結び付けます。 図の boundingRegions の縦の位置と、表の行の縦の位置が重なるものを、同じカットとします。これは座標の計算で決め、生成AIに推測させません。
案件の情報は、案件の管理表から案件の番号で引きます。 尺は案件ごとに決まっているので、絵コンテに書かれた尺ではなく、管理表の尺と照らします。 絵コンテの表紙に書かれた尺と管理表の尺が違えば、それ自体を印として出します。
AIへ渡す前に整形する
- ページの確認 … 表紙(タイトル・尺・版の番号)のページと、コマのページを分けます
- 寸法と向きの確認 … 画像は50×50ピクセルから10,000×10,000ピクセルの間であることが必要です。A4横の用紙が縦向きにスキャンされていれば直します
- 文字の大きさの確認 … 抽出できる文字の最小の高さは、1024×768の画像で12ピクセル(150dpiで約8ポイント)です。秒数の欄の小さな数字は、300dpiでスキャンします
- 欄の名前の照合 … 表の1行目(見出しの行)の文字を、欄の名前の一覧と照らし、列ごとに項目を決めます。決まらない列は
unknownにします - コマの絵と行の対応 … 図の位置と行の位置を照らします
- 前の版の取り出し … 同じ案件の1つ前の版の結果を取り出します
4番目を省くと、セリフとテロップが入れ替わります。 演出家によって「セリフ」と「テロップ」の欄の左右が逆の用紙があるからです。列の項目は、見出しの文字で決めます。 何列目かで決めません。
結合されたセルにも気をつけます。 1つのカットを2コマで描き、秒数の欄を2コマぶん縦にまとめて書く演出家がいます。公式の説明では、v4.0 では表の Markdown の表現が HTML の表に変わり、結合されたセルや複数行の見出しを表せるようにしたとされています。縦に結合された秒数のセルは、2つの行のどちらにも数えず、2コマで1カットとして扱います。 結合を見落とすと、秒数を二重に足して尺が合わなくなります。
AIに処理させる
させるのは、表のセルの値を、カットごとの項目にそろえることです。 セリフとテロップを整えること、秒数を足すこと、撮影の順番を決めることはさせません。
| 項目 | させること | 判断できないときの扱い |
|---|---|---|
| カット番号 | 書かれた番号をそのまま写す(「12」「12A」「12'」) | 読めなければ unreadable |
| 秒数 | 書かれた数字をそのまま写す(「3」「2.5」「3〜4」) | 幅のある書き方は原文のまま |
| 内容(ト書き) | 原文のまま写す | ― |
| 場所 | ト書きの中から、場所を表す言葉を抜き出す | 書かれていなければ空 |
| 出演者 | ト書きとセリフの話し手から、出演者を表す言葉を抜き出す | 書かれていなければ空 |
| 小道具・衣装 | ト書きの中から、物を表す言葉を抜き出す | 書かれていなければ空 |
| セリフ・NA | 話し手と、セリフの文を一字も変えずに写す | 読めない字は ■ にして unreadable |
| テロップ | 一字も変えずに写す。改行の位置も写す | 読めない字は ■ にして unreadable |
秒数を「書かれたまま」にするのは、演出家の書き方に意味があるからです。 「3〜4」と書かれていれば、演出家はまだ決めていません。AIが「3.5」に丸めると、決まっていないことが決まったことになります。 幅のある秒数は、合計の照合で「未確定」として扱います。
場所・出演者・小道具は、ト書きから「抜き出す」だけです。 香盤表の並べ替えに使うので、ト書きに書かれていない場所を、絵から推測させません。 絵から場所を読み取るのは、制作進行が切り抜きを見て行います。
| させないこと | 理由 |
|---|---|
| セリフ・テロップの誤字の修正 | 広告主と合意した文言が変わる。誤字かどうかは演出家に聞く |
| 商品名・出演者名を用語の一覧の表記に書き換える | 読み違いが「正しい表記」に化けて見えなくなる |
| 秒数の合計・尺の判定 | 足し算は処理の側で行う |
| 幅のある秒数の丸め | 未確定のものが確定に見える |
| 撮影の順番の決定 | 日の傾き、出演者の拘束、機材の段取りは人が決める |
| 絵から場所や出演者を推測する | 推測が香盤表の事実になる |
2行目が、いちばん気づきにくい失敗です。 手書きの商品名を読み違えたとき、AIに用語の一覧の表記へ直させると、下書きには正しい商品名が並びます。 そのため、テロップに本当に誤字があったのか、読み違えただけなのかが、下書きからは分からなくなります。照らすのは処理の側で行い、一覧と違う字があれば「一覧と違う」と印を付けます。
指示内容を固定する
あなたは映像制作会社の制作進行の補助として、手書きの絵コンテの読み取り結果を
カットごとの項目にそろえる立場です。読み取り結果だけを使ってください。
【書く項目(カットごと)】
- cut_no ......... 書かれたカット番号をそのまま(12A、12' なども原文のまま)
- seconds_raw .... 書かれた秒数をそのまま(3、2.5、3〜4 など)
- action ......... 内容(ト書き)を原文のまま
- location_words . action の中で場所を表す言葉。書かれていなければ空
- cast_words ..... action とセリフの話し手から、出演者を表す言葉
- props_words .... action の中で物・衣装を表す言葉
- lines .......... セリフ・NA。話し手(speaker)と文(text)。text は一字も変えない
- telop .......... テロップの文。一字も変えない。改行は \n で写す
- unreadable ..... 読めなかった項目の名前
【厳守事項】
- セリフとテロップは、読み取った文字を一字も変えずに写してください。
誤字に見えても直さないでください。送り仮名、句読点、記号、全角半角も変えないでください。
- 読めない字は推測で埋めず、■ に置き換えて、その項目を unreadable に入れてください。
- 商品名や出演者名を【用語の一覧】の表記に書き換えないでください。
一覧は参考にとどめ、書かれた字を写してください。
- 秒数を計算したり、丸めたりしないでください。合計も書かないでください。
- ト書きに書かれていない場所・出演者・小道具を、推測で足さないでください。
- 撮影の順番や、カットのまとめ方を提案しないでください。
- 1つのセルに2つのカットの内容が書かれているように見える場合は、
分けずに原文のまま写し、needs_check を true にしてください。
【列と項目の対応】{column_map}
【用語の一覧】{glossary}
【表のセル(ページ、行、列、文字、信頼度、手書きかどうか)】{cells}
「誤字に見えても直さない」を明記しないと、直します。 生成AIは、明らかな誤字を見ると親切に直します。テロップの誤字を直すかどうかは、広告主と演出家が決めることで、直したことが記録に残らないのがいちばん困ります。 直させず、照らした結果を印で出します。
「送り仮名、句読点、記号、全角半角も変えない」まで書くのは、テロップでは表記がそのまま画面に出るからです。 「!」と「!」、「〜」と「~」の違いが、編集の段階で問われます。
出力形式を固定する
次の形のJSONで受け取ります。 Azure OpenAI の構造化出力(response_format に json_schema を strict: true で渡す方式)を使い、形を固定します。
{
"project_no": "",
"version": "",
"cuts": [
{
"page": 1,
"row": 1,
"cut_no": "",
"seconds_raw": "",
"action": "",
"location_words": [""],
"cast_words": [""],
"props_words": [""],
"lines": [ { "speaker": "", "text": "" } ],
"telop": "",
"unreadable": [""],
"needs_check": false
}
]
}
このあとに、ワークフローが照合の結果を足します。
| 足す項目 | 決め方 |
|---|---|
seconds_total | seconds_raw が数字のカットだけを合計する。幅のあるものは別に数える |
length_check | 合計と案件の尺を照らし、match/over/under/undetermined(幅のある秒数がある) |
glossary_diff | セリフ・テロップの中で、用語の一覧に近いが表記が違う語 |
changed_cuts | 前の版と比べて、項目が変わったカット・足されたカット・消えたカット |
figure_file | コマの絵の切り抜き画像のファイル名 |
cut_no_check | カット番号の飛び・重複 |
1つ目の理由は、読み取りと照合を別の層に置けることです。 尺の照合も用語の照合も、AIが写したものを処理の側で読み直して行います。AIが写したものに手を加えないので、照合の結果がどこから来たかが追えます。
2つ目は、changed_cuts で改訂の差分が分かることです。 前の版と1コマずつ見比べていた作業が、変わったカットの一覧を見る作業に変わります。香盤表と台本表は、変わったカットだけを直せば済みます。
システムへ連携する
| つなぎ先 | 方式 | 内容 |
|---|---|---|
| 案件のフォルダ | Azure Functions のトリガー | PDF の保存を検知する |
| Azure AI Document Intelligence | API呼び出し | 表のセル・手書き・図と切り抜き |
| Azure OpenAI | API呼び出し | カットごとの項目へのそろえ |
| 案件の管理表 | 表の読み取り | 尺、商品名、出演者の一覧 |
| 香盤表・台本表 | テンプレートの形のファイル | 下書きの出力 |
香盤表と台本表は、下書きのファイルとして出します。 確定版は、制作進行が確かめてから、いつものテンプレートに貼り込んで配ります。案件の管理表には書き込みません。
人が確認する
人が全件を確かめます。 確かめ方は、絵コンテの画像と下書きを並べた画面で、印の付いたところから見ていく形にします。
length_checkがmatchでないものを先に見る … 尺の食い違いは、演出家にどのカットで調整するかを聞く事項です- テロップを1字ずつ照らす … 信頼度にかかわらず、全カットのテロップを画像と照らします
glossary_diffを確かめる … 一覧と違う表記が、読み違いか、絵コンテの誤字か、意図した表記かを確かめます。絵コンテの誤字なら、直すかどうかを演出家に聞きますunreadableとneeds_checkを確かめる … 紙を見て、読めなければ演出家に聞きますchanged_cutsを確かめる … 改訂版では、変わったカットが本当にそれだけかを確かめます
2番目は省かないでください。 テロップの1字違いは、放送や配信のあとに見つかると、差し替えの費用と広告主への説明が発生します。
香盤表の場所と出演者は、切り抜きの絵と並べて確かめます。 ト書きに「公園」としか書かれていなくても、絵に描かれた遊具やベンチで、撮影の場所の候補が分かることがあります。それを香盤表に足すのは制作進行で、足したことは記録に残します。
目標は、180ページをならして1ページ5分です。 テロップの照合が中心で、印の少ないページは数分で終わります。
例外に対処する
| 起きること | 対応 |
|---|---|
| 表の罫線が無い手描きの用紙 | 表として検出されない。行の位置で手作業で結び付けるか、用紙を変えてもらう |
| 縦書きの欄がある | 本記事の前提外。最小構成で読めるかを先に確かめる |
| 見出しの行が読めず列が決まらない | unknown の列として出し、人が項目を決める |
| 1つのセルに2カット分が書かれている | 分けずに needs_check |
| カット番号の飛び・重複 | cut_no_check で印。欠番の意図か書き間違いかを演出家に聞く |
| コマの絵が検出されない | 切り抜きなしで下書きを作り、香盤表には絵コンテのページの画像を添える |
| 文字が小さすぎる | 1024×768の画像で12ピクセルが下限。300dpiでスキャンし直す |
| 読み取りサービスが応答しない | PDF を残し、「処理済み」の印は成功したときだけ |
1行目が、最初にいちばん出ます。 演出家が白い紙に自分で枠を描いた絵コンテは、表として読めないことがあります。制作部の用紙を配り、そこに描いてもらうほうが、読み取りの工夫より効きます。
記録を残す
- 絵コンテの PDF と、版の番号・受け取った日時
- 読み取りサービスが返した JSON と、コマの絵の切り抜き
- Azure OpenAI に渡した入力と返ってきた JSON
- 照合の結果(
length_check、glossary_diff、changed_cuts、cut_no_check) - 制作進行が下書きを直した記録 … どのカットの、どの項目を、どう直したか
- 演出家に確かめた内容と、その答え
直した記録は、指示と用語の一覧を見直す材料になります。 同じ商品名の読み違いが続けば、その案件の用紙の書き方を演出家に相談する材料にもなります。
04実装レベルの3段階
半自動化で、1ページ15分が5分程度になります。この段階が本記事の想定です。 打ち込みが無くなり、テロップの照合と印の付いた箇所の確認が残ります。本格構成では、改訂のたびの作り直しが、変わったカットの確認に変わります。
05工数削減シミュレーション
導入後 180件 × 5分 ÷ 60 = 15 時間/月
自社条件で導入効果を整理したい方へ
このユースケースを自社に当てはめた場合の前提値と削減見込みを、業務ヒアリングをもとに整理します。
06向いている企業・向いていない企業
- テレビCM・Web動画・企業の紹介映像などを毎月複数本制作し、演出家が紙に手書きした絵コンテを、制作進行やアシスタントプロデューサーが香盤表(撮影の段取りの表)と編集用の台本表に打ち直している制作会社・広告会社の制作部門。絵コンテの改訂のたびに打ち直しが発生し、セリフやテロップの写し間違い、秒数の合計の食い違いが撮影の直前や編集の段階で見つかっている場合。絵コンテの用紙の様式がおおむね決まっている場合。
- 絵コンテを最初から作画のソフトや表計算で作っており、文字がデータで残っている場合。絵コンテが月に数本で、打ち直しが負担になっていない場合。広告主との契約で、制作中の素材を外部のクラウドサービスで処理することが認められていない場合。なお、撮影の順番、テロップの表現が適切か、尺の調整をどのカットで行うかの判断は、この構成では行いません。
07最小構成で試す方法
- 先月の案件から、絵コンテを10本(約30ページ)選ぶ(うち数本は、改訂版が出たものと、演出家の違うものを入れる)
- 広告主の名前と商品名を伏せた画像で、Document Intelligence Studio のレイアウトモデルで読み取る
- 表のセルが行と列で分かれるか、コマの絵が図として検出されるかを見る
- 読み取った結果を、検証用の環境の Azure OpenAI に渡し、「カットごとに番号・秒数・ト書き・セリフ・テロップを写してください。一字も変えないでください」と指示する
- 出てきた結果を、当時の台本表と突き合わせる
10本は必ずやってください。 つなぎ込みを作る前に、「用紙が表として読めるのか」「テロップが一字も変わらずに残るのか」を確かめます。 制作中の素材を外部のサービスで処理してよいかは、広告主との契約を先に確かめます。
| 出てきた内容 | 判断 |
|---|---|
| 表のセルが分かれ、テロップが当時の台本表と一致した | つなぎ込みに進む |
| テロップの誤字を直した | 指示の書き方で直る。構成は有効 |
| 手描きの枠で表として読めない | 用紙を配るのが先。 AIの問題ではない |
08実装時につまずきやすいポイント
| 問題 | 対策 |
|---|---|
| テロップの誤字を直す | 指示で禁じ、照らした結果を印で出す |
| 商品名を用語の一覧の表記に直す | 書き換えさせない。違いは glossary_diff で示す |
| 幅のある秒数を丸める | 原文のまま写し、合計は undetermined にする |
| セリフとテロップの列が入れ替わる | 列の項目は見出しの文字で決める。何列目かで決めない |
| 手描きの枠が表として読めない | 制作部の用紙を配る |
| コマの絵と行がずれる | 座標で結び付け、ずれたものは人が直す |
| 縦に結合された秒数のセルを二重に足す | 結合を見て、2コマで1カットとして数える |
| 改訂版で変わったカットを見落とす | 前の版と比べて changed_cuts を出す |
| 縦書きの欄が読めない | 本記事の前提外。最小構成で確かめる |
| 撮影の順番をAIに組ませる | 組ませない。日の傾きや拘束時間は人が決める |
| テロップの照合を信頼度で省く | 全件を1字ずつ照らす |
上の3行が、この構成の失敗のほとんどです。 どれも、AIが「正しく整えた」結果、元の絵コンテに何が書かれていたかが見えなくなることから起きます。
最後の行も同じくらい効いてきます。 信頼度の高い読み取りでも、1字違いは起きます。テロップだけは全件を照らす決まりを、最初から運用に入れておきます。
09セキュリティ・AIガバナンス上の注意点
この構成で扱うデータ: 未発表の商品名・価格・キャンペーンの内容、広告主の名前、出演者の名前、撮影の場所、そして放送・配信前の広告の表現そのものです。
- 未発表の情報として扱う … 絵コンテには、発表前の商品や価格が書かれています。閲覧できる人を案件の担当に限り、保管場所の権限を案件ごとに分けます
- 外部のサービスで処理してよいかを契約で確かめる … 広告主との契約や秘密保持の取り決めで、制作中の素材を外部のクラウドサービスで処理してよいかを、導入の前に確かめます
- セリフとテロップを変えない … 広告主と合意した文言を、AIが整えないようにします。直すかどうかは、広告主と演出家が決めます
- 出演者の情報の扱い … 香盤表には出演者の名前と拘束の時間が載ります。配布先を撮影のスタッフと出演者の事務所に限ります
- 撮影の順番と尺の調整をAIに寄せない … 段取りと演出の判断は、制作進行と監督が行います
誤りが起きた場合のリスクは、テロップの1字違いが放送・配信まで残ることと、改訂で変わったカットが香盤表に反映されないことの2つです。 前者はAIが整えることと照合を省くことで起き、後者は版の比較をしないことで起きます。どちらも、AIに手を加えさせない設計と、テロップの全件の照合で守ります。
10まず何から始めるか
1週目:絵コンテの用紙をそろえる
制作部の用紙を作り、「カット番号」「画」「内容」「セリフ・NA」「テロップ」「秒数」の欄の並びを決めます。 演出家に、この用紙に描いてもらうよう相談します。欄の名前の一覧も、このときに作ります。
2週目:10本で試す
先月の絵コンテから10本を選び、伏せた画像で読み取りとカットごとの項目のそろえ方を試します。テロップが一字も変わっていないか、秒数を丸めていないかを最優先で見ます。
3週目:案件の管理表に尺と用語の列を足す
案件ごとの尺と、商品名・出演者名・撮影の場所の正しい表記を、案件の管理表に持たせます。広告主との契約で、外部のサービスで処理してよいかもこの週に確かめます。
4週目:スキャンから下書きまでをつなぐ
案件のフォルダへの保存を起点に、読み取り、そろえ、尺の照合、香盤表と台本表の下書きまでを作ります。この時点では、従来の打ち込みと並べて回します。
2か月目: 制作進行が下書きを確かめる運用にし、打ち込みをやめます。3か月目以降: 前の版との差分と用語の照合を足し、1ページ15分が何分になったかを実測します。改訂版が出た日のうちに、変わったカットだけを直した香盤表を配れるようになった時点で、この構成は完成です。
11関連ユースケース
12この仕組みを理解するための記事
13技術仕様の確認日・参考情報
| 確認した内容 | 情報源 | 確認日 |
|---|---|---|
レイアウトモデルが文字・表・選択マーク・文書の構造を取り出すこと。表が行数・列数とセルごとの行と列の位置を返すこと。行ごとに手書きの書体かどうかを styles で信頼度つきで返すこと。文書の中の図を figures として検出し、boundingRegions、spans、elements を返すこと。解析のときに output=figures を指定すると、検出した図の切り抜き画像が作られ取り出せること。v4.0(2024-11-30)で表の Markdown の表現が、結合されたセルや複数行の見出しを表せる HTML の表に変わったこと。画像が 50×50 から 10,000×10,000 ピクセル、文字の最小の高さが 1024×768 の画像で 12 ピクセル(150dpi で約8ポイント)であること | Microsoft Learn: Document layout analysis | 2026-10-08 |
Read と Layout の手書きの対応言語に日本語(ja)が含まれること(v4.0) | Microsoft Learn: Language and locale support for Read and Layout | 2026-10-08 |
構造化出力が渡した JSON Schema に従わせる機能で、Chat Completions では response_format に json_schema を strict: true で指定すること。すべての項目を必須にし、additionalProperties を false にすること | Microsoft Learn: How to use structured outputs with Azure OpenAI in Microsoft Foundry Models | 2026-10-08 |
テロップの表現が適切か、撮影の順番、尺の調整、制作中の素材を外部のサービスで処理してよいかの判断は、広告主・演出家・制作会社の取り決めに沿って行ってください。 本記事は各製品の公式ページで確認できた範囲だけを扱っています。
実装ステータス:構成例。 公開仕様に基づいて設計した構成であり、当社で実際に構築・検証したものではありません。工数の数値はモデル条件による試算です。
自社の業務に使えるAI活用候補を整理します
このユースケース(UC-1092)についてのご相談はこちらから。
