Media > AI活用ユースケース > 総務 > 大学の講義の録音から字幕と文字の記録を作り、聴覚に障害のある学生への情報保障として、専門用語の誤認識を教員の用語集で直して配る

大学の講義の録音から字幕と文字の記録を作り、聴覚に障害のある学生への情報保障として、専門用語の誤認識を教員の用語集で直して配る

実装ステータス:構成例 技術的に実現可能な構成として設計したもの。自社未検証

講義の録画の音声を Azure AI Speech で文字にし、教員が出した用語集をもとに専門用語の誤認識の候補を洗い出して直します。直した文字起こしから字幕と文字の記録を作り、聴覚に障害のある学生へ配ります。

サマリー
生成AI
Azure OpenAI Service/Claude
AIサービス
Azure AI
対象業界
その他/教育
対象部門
総務
対象業務
内容確認・チェック/記録・議事録作成
主な課題
人手が足りない/書類作成に時間がかかる/確認ミスが多い
AIで行う処理
抽出
主な効果
品質標準化/対応スピード向上/工数削減
導入難易度
★★★☆☆
実装レベル
本格構成
費用感
API連携(中)
人間の確認
条件付き
現在工数
200h/月
AI導入後
50h/月
想定削減
75%
年間削減
1,800h
モデル条件による試算値です。実在企業の実績ではありません。

01導入前 / 導入後の業務フロー

導入前(Before)
  1. 講義が終わると、録画の仕組みが録画と自動字幕を作る
  2. 担当者が録画を開き、自動字幕を見ながら90分を聞く
  3. 聞き違えられた語を直す。分からない語は印を付ける
  4. 印を付けた語を、教科書やインターネットで調べるか、教員にメールで問い合わせる
  5. 直した字幕を録画に戻し、文字の記録として文書にまとめる
  6. 学習管理システムの、その学生だけが見られる場所に載せる
  7. 学生から誤りの指摘があれば直す
導入後(After)
  1. 人学期の初めに、教員が担当の科目の用語集(語と読み)を出す
  2. 自動講義の録画が保存されたら、対象の科目かを支援の一覧で確かめ、音声を取り出す
  3. 自動科目の用語集からフレーズリストを作り、Azure AI Speech の高速文字起こしで文字にする
  4. 自動生成AIが、文字起こしの中から用語集の語の聞き違いと思われる箇所を候補として取り出す
  5. 自動候補を、読みが一致するかどうかと信頼度で並べ、確認の一覧にする
  6. 人担当者が候補の一覧を見て、該当の数秒を聞いて採否を決める
  7. 自動採用した候補だけを文字起こしに反映し、字幕(WebVTT)と文字の記録を作る
  8. 人用語集に無い分からない語は、まとめて教員に問い合わせる
  9. 自動学習管理システムの、その学生だけが見られる場所に載せる
  10. 人学生からの指摘と、教員への問い合わせの答えを用語集に足す
各工程の詳しい説明を読む
  1. 講義が終わると、録画の仕組みが録画と自動字幕を作る
  2. 担当者が録画を開き、自動字幕を見ながら90分を聞く
  3. 聞き違えられた語を直す。分からない語は印を付ける
  4. 印を付けた語を、教科書やインターネットで調べるか、教員にメールで問い合わせる
  5. 直した字幕を録画に戻し、文字の記録として文書にまとめる
  6. 学習管理システムの、その学生だけが見られる場所に載せる
  7. 学生から誤りの指摘があれば直す

(a)1コマを直すのに、講義と同じかそれ以上の時間がかかる。 2番目と3番目は、90分の講義を止めながら聞く作業です。用語の多い科目は、1コマに60分では終わりません。 学期の中盤には、未処理のコマが積み上がります。

(b)専門用語の正しい字が分からない。 4番目の問い合わせは、教員の返事が遅ければ数日止まります。分からないまま配ると、学生は誤った用語で試験の勉強をすることになります。

(c)直した箇所が残らない。 3番目で直した語は、直した後の字幕にしか残りません。同じ科目の次の回で同じ語がまた聞き違えられても、前の回で直したことが活かされません。

(d)担当者によって直す範囲が違う。 言いよどみを消す人、言い回しを整える人、聞き違いだけを直す人がいます。同じ学生に届く記録でも、科目によって読みやすさと中身の正確さが違ってしまいます。

4つに共通するのは、専門用語を知っている教員と、直す作業をしている担当者が離れていることです。 教員の知識が用語集として先に手元にあれば、聞き違いの多くは、聞き直す前に見つけられます。

  1. 【人】 学期の初めに、教員が担当の科目の用語集(語と読み)を出す
  2. 【自動】 講義の録画が保存されたら、対象の科目かを支援の一覧で確かめ、音声を取り出す
  3. 【自動】 科目の用語集からフレーズリストを作り、Azure AI Speech の高速文字起こしで文字にする
  4. 【自動】 生成AIが、文字起こしの中から用語集の語の聞き違いと思われる箇所を候補として取り出す
  5. 【自動】 候補を、読みが一致するかどうかと信頼度で並べ、確認の一覧にする
  6. 【人】 担当者が候補の一覧を見て、該当の数秒を聞いて採否を決める
  7. 【自動】 採用した候補だけを文字起こしに反映し、字幕(WebVTT)と文字の記録を作る
  8. 【人】 用語集に無い分からない語は、まとめて教員に問い合わせる
  9. 【自動】 学習管理システムの、その学生だけが見られる場所に載せる
  10. 【人】 学生からの指摘と、教員への問い合わせの答えを用語集に足す

6番目が、この設計の分かれ目です。人が聞くのは90分の全部ではありません。 候補の一覧に載った箇所の数秒だけを聞きます。全部を聞き直す設計にすると、200.0時間はほとんど減りません。

10番目で用語集が育つのが、第3章の(c)への答えです。 直した語が用語集に入れば、次の回からはフレーズリストとして認識の段階で効きます。

02今回想定するシステム構成

構成図
講義の録画の仕組み(録画の保存)
   │  録画+科目コード+回+日時
   ▼【トリガー】録画の保存
Azure Functions(中継の処理)
   ├──▶ 支援の対象の科目かを確かめ、音声を取り出す
   ├──▶ 科目の用語集からフレーズリストを作る
   ▼
Azure AI Speech(高速文字起こし+フレーズリスト+話者の分離)
   │   文と単語ごとの時刻・信頼度・話者
   ▼
Azure OpenAI(Microsoft Foundry) ── 構造化出力
   │   用語集の語の聞き違いと思われる箇所の候補
   ▼
確認の一覧 ──【担当者が数秒を聞いて採否を決める】
   ▼
Azure Functions ── 採用した候補を反映し、WebVTT と文字の記録を作る
   └──▶ 学習管理システム(その学生だけが見られる場所)
役割想定する製品代替候補
処理Azure AI Speech(高速文字起こし、フレーズリスト、話者の分離)Google Cloud Speech-to-Text、Amazon Transcribe
生成AIAzure OpenAI(Microsoft Foundry)(構造化出力で聞き違いの候補を取り出す)Claude API
連携Azure Functions(録画の検知、フレーズリストの作成、候補の反映、字幕の作成)Azure Logic Apps
配信既存の学習管理システム―

録画の仕組みと学習管理システムは、新しく足すものではありません。 足すのは中継の処理、音声認識と生成AI、確認の一覧です。最初の準備は、教員に用語集を出してもらう仕組みを作ることです。 語と読みを2列で書く様式を1つ決め、シラバスの提出と同じ時期に集めます。

文字起こしには、Azure AI Speech の高速文字起こしを使います。 Microsoft Learn では Azure Speech in Foundry Tools とも表記されている音声サービスの機能で、音声ファイルを渡すと同期で結果を返します。対象は5時間未満・500MB未満の音声で、90分の講義は収まります。 日本語(ja-JP)に対応しており、文ごとと単語ごとの時刻が返るので、字幕の時刻にそのまま使えます。

代替候補に Gemini API を挙げていないのは、学生の年齢の幅を考えてのことです。 入学したばかりの学生には18歳未満の人もいます。利用規約で年齢に関わる条件を定めているサービスもあるため、採用の前に各サービスの規約を確かめてください。

03どうやって実装するのか

Step1

処理の起点を決める

講義の録画が保存されたことを起点にします。 録画の仕組みから録画の保存を知らせる方法は製品ごとに違うため、知らせが取れない場合は、録画の保存先のフォルダを中継の処理が見張る形にします。

動かすのは、支援の対象の科目の録画だけです。 支援の申請から作った対象の科目と回の一覧を引き、載っていない録画は処理しません。 すべての講義を文字にする理由はなく、録音を必要以上に扱わないためです。

講義の当日中に、候補の一覧が担当者に届くようにします。 高速文字起こしは同期で返るので、録画が保存されれば処理はすぐに終わります。担当者が翌朝までに候補を確かめれば、週2回の科目でも次の回の前に記録を配れます。

Step2

入力データを集める

データ中身取得元
講義の音声90分前後。録画から取り出したモノラルの音声講義の録画の仕組み
録画の付帯情報科目コード、回、日時、教員講義の録画の仕組み
科目の用語集語、読み、補足(略語の展開など)教員が出した用語集の表
支援の一覧対象の学生、科目、回、配る形(字幕/記録/両方)支援の申請の記録
前の回の確定した修正採用した候補の元の語と直した語この構成の修正の記録

質を決めるのは、用語集の読みの列です。 「頸椎」と書いてあっても、読みが無ければ「けいつい」と聞き違えられた語と結びつけられません。語だけでなく読みを必ず書いてもらいます。 読みが複数ある語は、すべて書いてもらいます。

前の回の確定した修正は、用語集に入っていない語を拾う手がかりになります。 同じ科目で前に直した語は、次の回でも同じように聞き違えられることが多いからです。

Step3

データの取得方法を決める

文字起こしは、高速文字起こしのAPIに音声とその定義を送ります。

指定するもの値理由
locales["ja-JP"]講義の言語が日本語と決まっているとき
phraseList科目の用語集の語と、前の回で直した語専門用語の聞き違いを、認識の段階で減らす
diarization{"enabled": true, "maxSpeakers": 4}教員の話と、受講者の質問を分ける
返ってくる値phrases の文ごとの時刻・confidence・speaker、words の単語ごとの時刻字幕の時刻、候補の並べ替え、発言者の区別
POST https://{リソース名}.cognitiveservices.azure.com/speechtotext/transcriptions:transcribe?api-version=2025-10-15
audio      = 科目コードと回を名前にした音声ファイル
definition = {
  "locales": ["ja-JP"],
  "diarization": { "enabled": true, "maxSpeakers": 4 },
  "phraseList": { "phrases": ["<用語集の語1>", "<用語集の語2>", "...",
                              "<前の回で直した語>"] }
}

フレーズリストは、認識の直前に渡す語句の一覧で、モデルの学習は要りません。 2,000語句を超えないようにし、長いほど品質と待ち時間に影響するとされています。全科目の用語を渡さず、その科目の用語集だけを渡します。 1科目の用語集が2,000語を超えることはまれですが、超える場合はその回のシラバスの範囲に絞ります。

英語で講義する科目や、英語の術語が多い科目では、locales の指定を見直します。 公式の案内では、複数のロケールを指定すると言語の識別が行われ、指定しなければ多言語のモデルで識別しながら文字にするとされています。科目ごとに、試しの1コマでどちらがよいかを確かめます。

Step4

AIへ渡す前に整形する

  1. 音声を取り出す … 録画からモノラルの音声を取り出します。話者の分離はモノラルの音声で使うものとされています
  2. 長さを確かめる … 5時間未満・500MB未満に収まっているかを確かめます。収まらないものは分けます
  3. 教員の話者を決める … 発言の時間がいちばん長い話者を教員とし、ほかを受講者とします
  4. 受講者の発言に印を付ける … 受講者の発言は字幕では「[受講者]」とし、氏名を書きません
  5. 聞き取れなかった文に印を付ける … confidence がしきい値を下回る文を low_confidence にします

3番目は、講義の録音の形を前提にした規則です。 講義はほとんどの時間を教員が話すので、発言の時間で決めれば足ります。 複数の教員が話す科目は、支援の一覧に教員の数を持たせておきます。

受講者の質問が聞き取れないことは、珍しくありません。 教室のマイクが教員の近くにあるためです。聞き取れない質問を推測で書かず、「[受講者の発言・聞き取れず]」と入れます。 教員が質問を繰り返して答えた場合は、教員の発言として残ります。

Step5

AIに処理させる

させるのは、文字起こしの中から、用語集の語の聞き違いと思われる箇所を候補として取り出すことだけです。 文字起こしを書き直させるのではなく、直す候補の一覧を返させます。

取り出すものやり方判断できないときの扱い
聞き違いの候補用語集の語と読みが同じか近い、別の語になっている箇所読みが一致しなければ reading_match を false
直す先の語用語集にある語だけ用語集に無い語を直す先にしない
根拠の文候補の文番号と、その文の文字―
用語集に無い分からない語文脈から専門用語らしいが用語集に無く、low_confidence の語教員への問い合わせの一覧へ

直す先を用語集の語に限るのが要です。 生成AIは、文脈からもっともらしい専門用語を思いつけます。思いついた語が正しいかどうかを、担当者は確かめられません。 用語集に無い語は、直さずに教員への問い合わせに回します。

させないこと理由
文字起こしの書き直し、要約、言い換え学生に届く講義の中身が変わる
用語集に無い語への置き換え正しさを担当者が確かめられない
言いよどみ・繰り返しの削除消すかどうかは支援の方針で決める。AIに任せない
教員の説明の誤りの訂正講義の中身は教員のもの。気づいた点は教員に伝える
受講者の発言の推測聞き取れないものは聞き取れないと書く
指示語の補い「この式」が何を指すかを推測で書き足さない

最後の行は、講義ならではの難しさです。 教員が板書やスライドを指して「これが」「ここで」と話すと、文字だけでは何を指すのかが分かりません。AIが「この式(運動方程式)」と補えば読みやすくなりますが、補った中身が誤っていても学生には分かりません。 スライドの資料を別に配る運用で補います。

Step6

指示内容を固定する

あなたは大学の障害学生支援の担当の補助です。講義の文字起こしの中から、
科目の用語集にある語が聞き違えられたと思われる箇所を、候補として挙げてください。
文字起こしを書き直さないでください。候補の一覧だけを返してください。

【科目】{course_name}
【用語集(語・読み・補足)】{glossary}

【候補の挙げ方】
- 用語集の語と読みが同じか近いのに、別の語・字になっている箇所を挙げてください。
- 直す先 proposed は、用語集にある語だけにしてください。
- 読みが用語集の読みと一致する場合は reading_match を true にしてください。

【厳守事項】
- 文字起こしの言い回しを整えたり、要約したりしないでください。
- 用語集に無い語を直す先にしないでください。専門用語らしいが用語集に無く、
  low_confidence の文にある語は、unknown_terms に元の文字のまま挙げてください。
- 言いよどみや繰り返しを消す候補を挙げないでください。
- 教員の説明の内容が正しいかを判断しないでください。
- 「これ」「ここ」などの指示語に、指している内容を補わないでください。
- 受講者の発言の中身を推測しないでください。
- 各候補に、文番号 sentence_id、元の文字 original、直す先 proposed を付けてください。

【文字起こし(文番号・話者・信頼度の印つき)】{sentences}

「書き直さないでください。候補の一覧だけを返してください」を最初に書くのは、全文を渡すと全文を返そうとするからです。 全文を返させると、どこを変えたかを差分で探すことになり、意図しない言い換えが紛れ込みます。 候補の一覧なら、変わるのは採用した箇所だけです。

unknown_terms を別にしているのは、教員への問い合わせをまとめるためです。 1コマに数語ずつ出る分からない語を、科目ごとに週1回まとめて教員に送ります。返事が来たら用語集に足し、次の回から候補に出るようになります。

Step7

出力形式を固定する

次の形のJSONで受け取ります。 Azure OpenAI の構造化出力で、このスキーマに従わせます。

{
  "course_code": "",
  "candidates": [
    { "sentence_id": 0, "original": "", "proposed": "",
      "reading_match": true, "low_confidence": false }
  ],
  "unknown_terms": [{ "sentence_id": 0, "text": "" }]
}

構造化出力では、すべての項目を必須にし、オブジェクトには additionalProperties: false が必要です。 スキーマのオブジェクトのプロパティは合わせて100個まで、入れ子は5段までとされています。この形は浅く、制限に近づきません。

中継の処理は、候補を確認の一覧に並べます。

条件並び担当者の扱い
reading_match が true、low_confidence先頭数秒を聞いて採否を決める
reading_match が true、信頼度は高い2番目文脈を読んで採否を決める。迷えば聞く
reading_match が false最後必ず聞く
proposed が用語集に無い表示しない中継の処理が捨てる

最後の行は、指示を破った出力への備えです。 用語集に無い語が proposed に入っていたら、中継の処理が候補ごと捨て、その件数を記録します。 件数が増えたら、指示を見直します。

採用した候補を反映した後、字幕と文字の記録を作ります。 字幕は WebVTT の形式で、ファイルの先頭に WEBVTT を置き、各字幕に「開始の時刻 --> 終了の時刻」を付けます。時刻は単語ごとの offsetMilliseconds から作り、1つの字幕を2行・数秒に収まるように句読点で区切ります。 文字の記録は、5分ごとの時刻の見出しを付けた文書にします。

WEBVTT

00:12:04.320 --> 00:12:08.900
ここで頸椎の第一番、環椎について見ていきます。

00:12:08.900 --> 00:12:13.450
[受講者]環椎と軸椎の違いは何ですか。

区切りの規則は中継の処理に置きます。 句読点で区切り、1つの字幕が長くなりすぎるときは単語の境目で分けます。単語ごとの時刻があるので、文の途中で区切っても時刻がずれません。 区切り方を生成AIに任せると、区切るついでに言い回しを整えてしまうためです。

字幕と記録は、同じ確定した文字起こしから作ります。 字幕を直したのに記録が古いまま、ということが起きないよう、直すのは確定の前の文字起こしの1か所だけにします。

Step8

システムへ連携する

つなぎ先方式内容
講義の録画の仕組み保存の知らせ、または保存先のフォルダの監視録画と付帯情報
支援の申請の記録読み取り対象の学生・科目・回・配る形
用語集の表読み取りと、確定後の追記語と読み。採用した修正と教員の答えを足す
Azure AI SpeechAPI呼び出し文と単語ごとの時刻・信頼度・話者
Azure OpenAIAPI呼び出し(構造化出力)聞き違いの候補と分からない語
学習管理システム確定後に載せる字幕のファイルと文字の記録。その学生だけが見られる場所

学習管理システムには、確定したものしか載せません。 候補を確かめる前の文字起こしは、担当者の画面にしか出しません。誤った用語のまま学生に届くことを避けるためです。

用語集への追記は、担当者が確定した後に行います。 採用した修正と教員の答えを足し、誰がいつ足したかを残します。 教員が用語集を見直すとき、支援の側で足した語が分かるようにします。

Step9

人が確認する

確かめるのは、障害学生支援の担当者です。 候補の一覧を、次の順に見ます。

  1. reading_match が false の候補を聞く … 読みが一致しないのに候補になったものは、AIの推測が混ざっている可能性があります
  2. low_confidence の候補を聞く … 数秒を聞いて、用語集の語かどうかを決めます
  3. 残りの候補を文脈で読む … 信頼度が高く読みも一致するものは、文脈を読めば決まることが多いです
  4. 分からない語を教員への問い合わせに入れる … 科目ごとにまとめ、週1回送ります

確認の画面には、候補ごとに再生の範囲を付けます。 文の offsetMilliseconds から前後数秒を含む範囲を作り、押せばその箇所だけを聞けます。

90分を通して聞き直さないでください。 通して聞く運用にすると、第10章の15分には収まりません。最初の1か月だけ、各科目の1コマを通して聞き、候補に出なかった聞き違いがどれだけあるかを数えます。 その数が、用語集の足りなさの目安になります。

Step10

例外に対処する

起きること対応
用語集が出ていない科目前の回で直した語だけでフレーズリストを作る。教員に用語集を依頼する
録音が5時間・500MBの上限を超える分けて処理し、時刻をつなげる
教室の雑音で low_confidence が多いマイクの位置を見直す。その回は担当者が通して聞く
受講者の質問が聞き取れない「[受講者の発言・聞き取れず]」とする
英語や外国語の部分が多いlocales の指定を科目ごとに見直す
高速文字起こしが429を返す公式の案内に沿って間隔を空けて再送する
用語集に無い語が proposed に入る中継の処理が候補ごと捨て、件数を記録する
学生から誤りの指摘がある直して載せ直し、用語集に足す

上から3行目は、学期の初めに確かめておくものです。 教室によってマイクの位置と雑音が違います。最初の週に教室ごとの low_confidence の割合を見ておけば、通して聞く必要のある教室が先に分かります。

Step11

記録を残す

  • 録画の付帯情報と、処理した日時
  • 文字起こしの全文と、文と単語ごとの時刻・信頼度・話者
  • 生成AIが出した候補と、担当者の採否
  • 中継の処理が捨てた候補の件数
  • 教員への問い合わせと、その答え
  • 学生に載せた字幕と文字の記録、載せた日時、指摘と直した内容

載せた後に直した場合は、直す前の版も残します。 学生がすでに前の版で勉強していることがあるため、どこを直したかを学生に知らせる材料にします。

3つ目の採否の記録が、用語集を育てる元になります。 採用した修正は用語集に足し、不採用が続く候補は、AIへの指示の見直しの材料にします。

講義の音声と文字起こしは、配った後の保存の期間を決めておきます。 学生の支援の記録として必要な期間と、講義の録音として学内で決めている期間の短いほうに合わせます。

04実装レベルの3段階

最小構成:録音を手で文字にし、用語集と一緒にAIの画面に貼って候補を挙げさせる / 1コマごとの候補の洗い出し
半自動化:上記+録画の保存からフレーズリストつきの文字起こしと候補の一覧までを自動で動かす / 文字起こしと候補の一覧
本格構成:上記+再生の範囲つきの確認の画面、採用した候補の反映、WebVTT と記録の作成、学習管理システムへの掲載、用語集への追記 / 候補の確認から配るところまで

最小構成では、コマ数がさばけません。 1コマずつ貼るので、月200コマには使えません。確かめるための段階です。 半自動化で、1件60分が30分程度になります。 候補の一覧は出ますが、再生の範囲が付いていないので録画の中を探して聞くことになり、字幕への反映と掲載も手作業で残ります。本格構成で15分になり、この段階が本記事の想定です。 差が大きいのは、該当の箇所を探す時間と、字幕と記録を整える作業が、1コマごとの手作業だからです。 段階を飛ばさないでください。 半自動化の一覧を1か月見ると、用語集の読みが空いている科目と、雑音の多い教室が分かります。そこを直してから本格構成に進むほうが、確認の一覧に並ぶ候補が少なくなります。

05工数削減シミュレーション

前提値(モデル条件)
対象人数
6 名
月間件数
200 件
1件あたり現在時間
60 分
1件あたり導入後時間
15 分
現在  200件 × 60分 ÷ 60 = 200 時間/月
導入後 200件 × 15分 ÷ 60 = 50 時間/月
月間削減時間
150h
削減率
75%
年間削減時間
1,800h
年間金額換算(時間単価2,400円)
432万円
モデル条件による試算であり、実際の効果は業務内容・運用方法によって異なります。

自社条件で導入効果を整理したい方へ

このユースケースを自社に当てはめた場合の前提値と削減見込みを、業務ヒアリングをもとに整理します。

AI活用について相談する

06向いている企業・向いていない企業

向いている
  1. 講義を録画して学習管理システムに載せており、聴覚に障害のある学生から講義の文字の記録や字幕の提供を求められている大学・短大・専門学校。障害学生支援の担当が、録画の自動字幕を1コマずつ聞き直して専門用語を直している場合。学部ごとに専門用語が多く、支援の担当や学生のスタッフでは用語が分からない場合。教員に科目の用語集を出してもらう運用を作れる場合。
向いていない
  1. 講義を録画しておらず、授業中の文字通訳(パソコンテイクなど)だけで支援している場合。支援を受ける学生が少なく、対象の講義が月に数コマにとどまる場合。講義の録音をクラウドで処理することを学内の規程で認めていない場合。なお、授業中にその場で行う情報保障の代わりにはならず、どの支援を提供するかの判断も、この構成では行いません。

07最小構成で試す方法

  1. 用語の多い科目を2つ選び、教員に用語集(語と読み)を出してもらう
  2. その科目の録画を2コマずつ、計4コマ用意する(担当者が直した字幕があるものを選ぶ)
  3. 録画の音声を Speech Studio などで文字にし、用語集と一緒に手元のAIサービスに貼り付ける
  4. 「この文字起こしの中で、用語集の語が聞き違えられたと思われる箇所を挙げてください。直す先は用語集の語だけにし、文字起こしを書き直さないでください」と指示する
  5. 挙がった候補を、担当者が直した字幕と突き合わせる

4コマは必ずやってください。 中継の処理を組む前に、「書き直さずに候補だけを返すか」と「用語集に無い語に直さないか」を確かめます。

出てきた内容判断
担当者が直した語の多くが候補に挙がったフレーズリストと確認の一覧の構築に進む
文字起こしを書き直して返した指示の書き方と出力の形で直る。構成は有効
候補が少なく、聞き違いが残った用語集の読みの列が先。 AIの問題ではない

3行目は、用語集の読みが空いていると出ます。 読みが無いと、聞き違えられた語と用語集の語を結びつけられません。読みを足して同じ4コマで試し直すと、違いがすぐに分かります。

08実装時につまずきやすいポイント

問題対策
文字起こしが読みやすく書き直される候補の一覧だけを返させ、全文を返させない
用語集に無いもっともらしい語に直される直す先を用語集の語に限り、外れたものは中継の処理で捨てる
用語集の語が候補に挙がらない用語集に読みを必ず書いてもらう
言いよどみが勝手に消える消すかどうかは支援の方針で決め、AIにさせない
指示語に中身が補われる補わないと明記し、スライドの資料を別に配る
受講者の発言が推測で埋まる聞き取れないものは「聞き取れず」と書く
教室の雑音で認識が落ちる学期の初めに教室ごとに確かめ、マイクの位置を見直す
字幕が長すぎて読めない1つの字幕を2行・数秒に区切る
記録が他の学生にも見えてしまうその学生だけが見られる場所に載せる
授業中の支援が後回しになるこの構成は講義の後の支援。授業中の支援は別に手配する

上の2行が、この構成の失敗のほとんどです。 どちらも、AIの「直す力」が強すぎることから来ます。情報保障で届けるのは、教員が話したとおりの講義です。 読みやすさのために中身を変えないよう、出力の形で縛ります。

最後の行は、導入の後に起きやすい失敗です。 講義の後の記録が速く届くようになると、授業中の文字通訳の手配が減らされることがあります。 その場で話を追えることと、後で読み返せることは、別の支援です。

09セキュリティ・AIガバナンス上の注意点

この構成で扱うデータ: 講義の音声と文字起こし、受講者の発言、支援を受ける学生の氏名と障害に関わる支援の内容です。障害に関わる情報は、特に慎重な扱いが要ります。

  1. 支援を受ける学生の情報を、生成AIに渡さない … AIに渡すのは、講義の文字起こしと用語集だけです。誰のための記録かは中継の処理が持ちます
  2. 受講者の発言を氏名で記録しない … 字幕でも記録でも「[受講者]」とします
  3. 講義の録音をクラウドで処理することを、学内の規程で確かめる … 教員と受講者への周知の仕方も決めます
  4. 記録を、その学生だけが見られる場所に載せる … 講義の文字の記録は、教員の講義そのものです。配る範囲を支援の対象に限ります
  5. 講義の中身を変えない … 要約、言い換え、教員の説明の訂正をさせません
  6. 利用するAIサービスの規約を確かめる … 18歳未満の学生が含まれうるため、年齢に関わる利用条件を確かめてから採用します

障害者差別解消法は令和3年に改正され、改正法は令和6年4月1日に施行されました。 内閣府は、この改正で事業者にも合理的配慮の提供が義務化されたと案内しています。どの学生にどの支援を提供するかは、大学が学生と話し合って決めることです。 この構成は、決まった支援の一部を速く確かに届けるための道具で、その判断は行いません。

誤りが起きた場合のリスクは、誤った用語のまま学生に届くことと、講義に無い言葉が記録に入ることの2つです。 前者は候補が出ない聞き違いで起き、後者はAIの書き直しや用語集に無い語への置き換えで起きます。前者は用語集の読みとフレーズリストで、後者は候補の一覧という出力の形と用語集への限定で、設計で防ぎます。

10まず何から始めるか

1週目:用語集の様式を決め、2科目に頼む

語と読みと補足の3列の用語集の様式を決め、用語の多い2科目の教員に頼みます。あわせて、言いよどみを消すかどうかの支援の方針を、支援を受ける学生と話して決めます。

2週目:4コマで試す

2科目の録画を2コマずつ文字にし、手元のAIサービスで聞き違いの候補を挙げさせます。書き直さずに候補だけを返すか、用語集に無い語に直さないかを最優先で見ます。

3週目:教室の音を確かめる

支援の対象の科目がある教室で、1コマずつ low_confidence の割合を見ます。割合の高い教室は、マイクの位置を施設の担当と相談します。

4週目:録画の保存から候補の一覧までをつなぐ

録画の保存の知らせか保存先の監視から、フレーズリストつきの文字起こし、候補の一覧までをつなぎます。この時点では学習管理システムに載せず、担当者が候補と通しで聞いた結果を見比べます。

2か月目: 再生の範囲つきの確認の画面と、WebVTT と記録の作成を足し、科目ごとの候補の数と採用の割合を毎週数えます。3か月目以降: 支援の対象のすべての科目に広げ、1件60分が何分になったかを実測します。用語集が育って候補の多くが採用され、次の講義の前に記録が届くようになった時点で、この構成は完成です。


11関連ユースケース

12この仕組みを理解するための記事

13技術仕様の確認日・参考情報

技術仕様確認日:2026-10-08/最終更新:2026-10-08
確認した内容情報源確認日
高速文字起こしが同期のAPIで、音声が5時間未満・500MB未満であること。locales(複数の指定で言語の識別、指定しなければ多言語のモデル)、diarization、phraseList(API バージョン 2025-10-15)を指定できること。話者の分離はモノラルの音声で使うこと。結果の phrases に文ごとの時刻・confidence・speaker、words に単語ごとの時刻が付くこと。429への対処が案内されていることMicrosoft Learn: Use the fast transcription API2026-10-08
フレーズリストが認識の直前に渡す語句の一覧で、モデルの学習が要らないこと。高速文字起こしで使えること。2,000語句を超えないようにし、長いほど品質と待ち時間に影響することMicrosoft Learn: Improve recognition accuracy with phrase list2026-10-08
日本語(ja-JP)が音声認識の高速文字起こしに対応していることMicrosoft Learn: Language and voice support for the Speech service2026-10-08
構造化出力でモデルが指定したJSONスキーマに従うこと。すべての項目を必須にすること。additionalProperties: false が必要なこと。オブジェクトのプロパティが合わせて100個まで、入れ子が5段までであることMicrosoft Learn: Azure OpenAI で構造化出力を使用する方法2026-10-08
WebVTT のファイルが WEBVTT の文字列で始まること。各字幕の時刻が開始の時刻、-->、終了の時刻で書かれ、時刻が時(0でなければ必須)・分・秒・千分の一秒で表されること。text/vtt で UTF-8 であること(2026年5月20日付の勧告候補の草案)W3C: WebVTT: The Web Video Text Tracks Format2026-10-08
障害者差別解消法が令和3年に改正され(令和3年法律第56号)、改正法が令和6年4月1日に施行されたこと。事業者にも合理的配慮の提供が義務化されたと案内されていること内閣府: 障害を理由とする差別の解消の推進2026-10-08

どの学生にどの支援を提供するか、講義の録音と記録をどう扱うかは、大学の方針と学内の規程に従ってください。 本記事は公開仕様と公的な案内で確認できた範囲だけを扱っています。

実装ステータス:構成例。 公開仕様に基づいて設計した構成であり、当社で実際に構築・検証したものではありません。工数の数値はモデル条件による試算です。

自社の業務に使えるAI活用候補を整理します

このユースケース(UC-0977)についてのご相談はこちらから。

AI活用について相談する
目次