分析機器・試験機が出力する印刷レポートやPDFを読み取り、試料番号・測定条件・測定値を試験記録の台帳に転記して、規格外の値を担当へ知らせる
分析機器や試験機が出す感熱紙の印字や測定ソフトのPDFを読み取り、試料番号・測定条件・測定値を試験記録の台帳に転記します。規格値と比べて外れた値があれば、その場で担当者に知らせます。
- AIサービス
- AWS Textract/Azure AI/Google Document AI
- 連携・自動化
- Google Apps Script/Make/n8n/Power Automate/Python
- 対象業界
- その他/医療/建設/製造
- 対象部門
- 品質管理/研究開発
- 対象業務
- データ入力・転記/内容確認・チェック
- 主な課題
- 人手が足りない/入力作業が多い/確認ミスが多い
- AIで行う処理
- 読み取り(OCR)
- 主な効果
- 入力漏れ削減/対応スピード向上/工数削減
- 導入難易度
- ★★★☆☆
- 実装レベル
- 本格構成
- 費用感
- API連携(中)
- 人間の確認
- 条件付き
01導入前 / 導入後の業務フロー
- 測定が終わったら、印字を切り取って試験記録の用紙に貼る。PDFは印刷して貼る
- 印字の値を、用紙の所定の欄に手書きで写す
- もう一人が印字と手書きを読み合わせ、確認の印を押す
- 用紙の値を、試験記録の台帳に入力する
- 規格の値を規格のマスタで確かめ、外れていれば上長に報告する
- 用紙をファイルに綴じる
- 人測定が終わったら、印字を試料番号のラベルと並べて撮影台で撮る。PDFは共有フォルダに保存する
- 自動画像やPDFが保存されたことをきっかけに、機種を判定し、その機種のカスタムテンプレートモデルで読み取る
- 自動試料番号・測定条件・測定値・単位・測定日時と、項目ごとの信頼度が返る
- 自動試料番号のラベルの値と、印字の試料番号(ある機種のみ)を突き合わせる
- 自動規格のマスタを引き、測定値を下限・上限と比べる
- 自動台帳の下書きの行を作り、規格外の値があれば Teams で担当者と上長に知らせる
- 人担当者が、信頼度の低い項目と規格外の値と試料番号の不一致を確かめ、台帳に確定する
各工程の詳しい説明を読む
- 測定が終わったら、印字を切り取って試験記録の用紙に貼る。PDFは印刷して貼る
- 印字の値を、用紙の所定の欄に手書きで写す
- もう一人が印字と手書きを読み合わせ、確認の印を押す
- 用紙の値を、試験記録の台帳に入力する
- 規格の値を規格のマスタで確かめ、外れていれば上長に報告する
- 用紙をファイルに綴じる
(a)同じ値を3回扱っている。 印字から用紙へ、用紙から台帳へ写し、間に読み合わせが入ります。値そのものは機器が正しく出しているのに、写すたびに誤りが入る機会が増えます。
(b)写し間違いは読み合わせでも残る。 「0.83」と「0.38」、「6.8」と「8.6」のような入れ違いは、読み合わせる二人が同じ用紙を見ていると、二人とも見落とします。 用紙ではなく印字のほうを読む、という決まりがあっても、忙しい日は守られません。
(c)規格外に気づくのが遅い。 5番目の規格との比較は、試験の直後に行うことになっていますが、実際には台帳への入力の後、まとめて行われることが多いのです。 外れた値に気づいたときには、そのロットの次の工程が始まっていることがあります。
(d)試料番号の取り違え。 機器の印字に試料番号を入れられる機種と、入れられない機種があります。入れられない機種では、印字を貼る用紙で試料が決まります。 貼る用紙を間違えると、値は正しくても別の試料の記録になります。
- 【人】 測定が終わったら、印字を試料番号のラベルと並べて撮影台で撮る。PDFは共有フォルダに保存する
- 【自動】 画像やPDFが保存されたことをきっかけに、機種を判定し、その機種のカスタムテンプレートモデルで読み取る
- 【自動】 試料番号・測定条件・測定値・単位・測定日時と、項目ごとの信頼度が返る
- 【自動】 試料番号のラベルの値と、印字の試料番号(ある機種のみ)を突き合わせる
- 【自動】 規格のマスタを引き、測定値を下限・上限と比べる
- 【自動】 台帳の下書きの行を作り、規格外の値があれば Teams で担当者と上長に知らせる
- 【人】 担当者が、信頼度の低い項目と規格外の値と試料番号の不一致を確かめ、台帳に確定する
読み合わせの相手が、読み取りの信頼度に替わります。 信頼度が高く、規格内で、試料番号の突き合わせが合っている行は、担当者が一覧で確かめて確定します。人が印字を開いて見るのは、どれかに引っかかった行だけです。
5番目を測定の直後に行えることが、この構成のもう一つの効果です。 月末のまとめを待たずに、撮影した数分後に規格外が知らされます。 次の工程に進む前に止められます。
1番目の「試料番号のラベルと並べて撮る」が、第3章の(d)への対策です。 試料番号を印字できない機種でも、ラベルと印字が同じ画像に写っていれば、試料が画像の側で決まります。
02今回想定するシステム構成
分析機器・試験機 ├─ 感熱紙の印字 ── 試料番号のラベルと並べて撮影台で撮影 └─ 測定ソフトのPDF ── 共有フォルダへ保存 ▼【トリガー】画像・PDFの保存 Power Automate ▼ Azure AI Document Intelligence │ 機種ごとのカスタムテンプレートモデルを1つの窓口にまとめて呼ぶ │ 試料番号・測定条件・測定値・単位・日時と信頼度 ▼ Python ── 試料番号の突き合わせ/規格のマスタとの比較 ▼ 台帳の下書きの行 ├──▶ Teams:規格外・不一致・低信頼の通知 ▼ 【担当者が確かめて台帳に確定】
| 役割 | 想定する製品 | 代替候補 |
|---|---|---|
| OCR | Azure AI Document Intelligence(カスタムテンプレートモデル。PDFのレポートはレイアウトモデル) | Google Document AI(Form Parser)。AWS Textract は英語の印字に限る |
| 集計 | Python(試料番号の突き合わせ、規格値との比較) | Google Apps Script |
| 連携 | Power Automate(保存の検知、読み取りの呼び出し、Teams への通知) | Make、n8n |
| 台帳 | 試験記録の台帳(共有のスプレッドシート) | 試験データの管理システム |
生成AIは使いません。 様式が決まっている印字から決まった項目を取り出すのに、文章を理解させる工程は要りません。 位置で読むモデルと、規則で比べるスクリプトで足ります。生成AIを挟まないことで、測定値が言い換えられたり補われたりする経路がそもそもありません。
読み取りの中心は、カスタムテンプレートモデルです。 ラベルを付けたキーと値の組、選択マーク、テーブルなどを抽出する学習しやすいモデルで、定義された見た目の様式を持つ、構造化の度合いが高い書類から項目を取り出すのに向くとされています。機器の印字は、まさにこの型です。
機種ごとにモデルを作り、まとめて1つの窓口にします。 テンプレートモデルは様式が変わると精度が下がるとされていて、様式の異なるものはそれぞれ5枚以上の見本でモデルを作り、composed model として1つの窓口にまとめる方法が示されています。6機種なら6つのモデルを作り、1つにまとめて呼びます。
日本語の印字も対象です。 カスタムテンプレートモデルの対応言語には、印刷の文字で日本語が含まれ、手書きでも日本語が対象とされています。
03どうやって実装するのか
処理の起点を決める
撮影した画像、または測定ソフトのPDFが共有フォルダに保存されたことを起点にします。 試験室の撮影台に固定したスマートフォンかスキャナから、機器ごとのフォルダへ保存します。機器ごとにフォルダを分けておくと、どの機種のモデルで読むかがフォルダで決まります。
撮るのは、測定が終わったその場です。 1日分をまとめて撮ることはしません。規格外の通知を測定の直後に出すことが、この構成の目的の半分だからです。 撮影のたびに1枚ずつ処理します。
処理が終わったファイルは処理済みのフォルダに移し、失敗したものは元のフォルダに残します。 機器ごとのフォルダに残っている数が、そのまま未処理の数です。
測定ソフトのPDFは、ソフトの側の保存先を機器ごとのフォルダに向けます。 多くの測定ソフトは、測定の終わりにレポートを決まった場所へ保存する設定を持っています。人がPDFを開いて保存し直す手順を残すと、そこで止まります。 設定できないソフトだけ、担当者が保存する手順にします。
入力データを集める
| データ | 中身 | 取得元 |
|---|---|---|
| 印字の画像 | 機器の印字と、試料番号のラベル(バーコード付き) | 撮影台の画像 |
| 測定ソフトのPDF | 試料番号、測定条件、測定値の表、グラフ | 機器ごとのフォルダ |
| 機器の一覧 | 機器の番号、機種、使うモデルの名前、測定値の単位、出す桁数 | 試験室で用意する一覧 |
| 規格のマスタ | 製品・試験項目ごとの下限・上限・単位、判定に使う桁数 | 品質管理部のマスタ |
| 試験の予定 | 試料番号ごとの製品、ロット、行う試験項目 | 試験の依頼の一覧 |
質を決めるのは、機器の一覧の「出す桁数」です。 天びんが小数点以下4桁を出す設定なのに、読み取りで3桁しか返ってこなければ、1桁を読み落としたか、印字がかすれているかのどちらかです。 桁数を知っていれば、読み取りの誤りを機械で見つけられます。
機器の一覧は、たとえば次の形にします。
| 機器の番号 | 機種 | モデルの名前 | 測定値の単位 | 出す桁数 | 試料番号の印字 |
|---|---|---|---|---|---|
| BAL-01 | 電子天びん | balance-typeA-v2 | g | 小数点以下4桁 | なし |
| BAL-02 | 電子天びん | balance-typeB-v1 | g | 小数点以下2桁 | あり |
| PH-01 | pH計 | ph-typeA-v1 | pH | 小数点以下2桁 | なし |
| TEN-01 | 引張試験機 | tensile-report-v1 | MPa | 小数点以下1桁 | あり |
同じ電子天びんでも、型が違えば別のモデルです。 印字の並びも桁数も違うからです。モデルの名前に版を付けておくと、作り直したときに、どの記録をどの版で読んだかが一覧から分かります。
試験の予定は、試料番号の取り違えを見つけるために使います。 予定に無い試料番号の測定値が来たら、ラベルの貼り間違いか、予定外の試験です。 どちらにしても人が見る行です。
データの取得方法を決める
| 取るもの | どこから | 何に使うか |
|---|---|---|
| 項目の値と信頼度 | カスタムテンプレートモデルの読み取り結果 | 台帳の列に当たる値 |
| テーブルとセル | PDFのレポートはレイアウトモデルの tables | 複数の試験片の測定値 |
| 単語ごとの信頼度 | 読み取り結果の単語の配列 | 項目の信頼度が高くても、桁の1文字だけ低いものを拾う |
| 試料番号のラベル | ラベルのバーコード、または印字された番号 | 試料の特定 |
| 規格値 | 規格のマスタを製品・試験項目で引く | 規格内・規格外の比較 |
項目の信頼度と、単語の信頼度を両方見ます。 項目の信頼度は値の位置の確からしさを反映し、文字起こしの確からしさは単語の側に出るとされています。位置が正しくても、「8」と「3」の読み分けが怪しいことがあり、それは単語の信頼度にしか現れません。
呼び出すモデルは、フォルダから決まる機器の番号で選びます。 6つのモデルを composed model としてまとめておくのは、撮影台のフォルダを機器ごとに分けられない試験室や、機器の番号が分からない画像のための窓口です。まとめた窓口に投げたときは、文書の種類の信頼度が低いものを人に回します。 文書の種類の信頼度は、読んだ書類が学習の見本にどれだけ似ているかを示すとされていて、低ければ、どの機種の様式にも当てはまりきっていない印です。機器の番号が分かる運用にできるなら、フォルダで選ぶほうを優先します。
引張試験機のPDFは、表の行ごとに取り出します。 1つの試料で試験片を5本測ると、5行の測定値と平均・標準偏差の行が出ます。平均の行も台帳に写しますが、規格との比較に使う値がどれかは、規格のマスタで決めておきます。
AIへ渡す前に整形する
- 機種の判定 … 保存されたフォルダから機器の番号を決め、機器の一覧で使うモデルを決めます
- 画像の確認 … 50×50ピクセルから10,000×10,000ピクセルの範囲か、文字の高さが下限を下回っていないかを確かめます。感熱紙の細い文字は、撮影の距離で下限に近づきます
- 傾きと影の確認 … 撮影台で撮っても、印字が丸まって影が出ることがあります。明るさの極端なものは撮り直しに回します
- PDFのページの絞り込み … 測定ソフトのPDFにグラフのページが続く場合は、測定値の表のページだけを読みます
- 重複の確認 … 同じ機器・同じ測定日時の印字が二度撮られていないかを確かめます
2番目と3番目を軽く見ないでください。 文字の最小の高さは、1024×768ピクセルの画像で12ピクセルとされています。感熱紙の小さな文字を引いて撮ると、この下限を下回ります。 撮影台の高さを決めて固定するのが、読み取りの精度にいちばん効きます。
撮り直しに回すときは、担当者が試験台の前にいるうちに知らせます。 撮影台の横に置いた端末に「撮り直し」と出るだけでよく、後から気づくと、印字が別の試料の用紙に紛れていることがあります。
AIに処理させる
させるのは、機種ごとに決めた項目を、決めた位置から読み取って信頼度とともに返すことだけです。
| 機種 | 読み取る項目 |
|---|---|
| 電子天びん | 機器番号、日時、試料番号(印字できる機種のみ)、質量、単位、風袋 |
| pH計 | 機器番号、日時、pH、温度、校正の日時 |
| 硬度計 | 機器番号、日時、硬度の種類、測定値(複数点)、平均 |
| 粘度計 | 機器番号、日時、ローターの番号、回転数、温度、粘度、単位 |
| 引張試験機(PDF) | 試料番号、試験速度、試験片の寸法、試験片ごとの最大荷重・引張強さ・伸び、平均 |
| 色差計 | 機器番号、日時、L\*・a\*・b\*、色差、基準の番号 |
測定条件を必ず項目に含めます。 pH の値は温度とともに、粘度はローターと回転数とともに意味を持ちます。値だけを写して条件を落とすと、後から別の条件の値と比べてしまいます。
| させないこと | 理由 |
|---|---|
| 測定値の数値への変換と丸め | 台帳には印字の文字列をそのまま写す。桁数は分解能 |
| かすれた文字の推測 | 信頼度が低ければ人が印字を見る |
| 平均や標準偏差の計算 | 機器が出した値を写す。計算し直すと機器の値と食い違う |
| 規格内・規格外の判定 | 規格のマスタと Python の規則で行う |
| 試料番号の補完 | 番号が読めなければ人が決める |
1行目が、この構成でいちばん守りたいところです。 「12.30 g」を「12.3」として台帳に入れると、後から見た人は、その天びんが小数点以下1桁しか測れなかったと読みます。 文字列で持ち、比較のときだけ数値に直します。
指示内容を固定する
この構成は生成AIを使わないため、指示文の代わりにカスタムテンプレートモデルを作るときの決めごとを示します。モデルに与える「指示」は、ラベルの付け方そのものです。
【モデルを作る単位】
- 機種ごとに1つ。同じ機種でも印字の設定(項目の並び)が違う機器は別のモデル
- 1つのモデルに、デジタルのPDFと撮影した画像の両方を5枚以上ずつ含める
【ラベルを付ける項目の名前】
- 英字のパスカルケースで、全機種で同じ意味の項目は同じ名前にする
例:InstrumentId, MeasuredAt, SampleId, Value, Unit, Temperature
- 複数の測定点がある機種は、表形式の項目(Measurements)にする
【ラベルの付け方】
- 値の文字列だけを囲む。単位が値と同じ行に続くときは、単位を別の項目にする
- 項目名の印字("WT" "pH" など)はラベルに含めない
- 空欄になりうる項目(風袋など)も、空欄の見本を含めてラベルを付ける
【見本の選び方】
- 値の桁数が違うもの、マイナスの値、エラーの印字を含める
- 感熱紙の薄くなったもの、少し傾いたものを含める
- 試料番号のラベルと並べた画像を含める
「空欄の見本も含める」は、空欄の信頼度のためです。 学習の見本に空欄がどれくらいあるかが、値が無いという予測の信頼度に使われるとされています。風袋を使わない測定が多いなら、空欄の見本を入れておかないと、空欄が出るたびに低信頼になります。
「エラーの印字を含める」も同じ考え方です。 機器は測定に失敗すると「ERR」「OVER」などを印字します。見本に無ければ、そこに数字があるものとして読もうとします。
出力形式を固定する
読み取り結果を、Python で台帳の行の形にそろえます。
{
"file": "",
"instrument_id": "",
"model_id": "",
"sample_id": { "from_label": "", "from_printout": "", "match": "matched | mismatch | label_only" },
"measured_at": "",
"conditions": [ { "name": "Temperature", "value": "25.0", "unit": "℃", "confidence": 0 } ],
"values": [ { "name": "Value", "raw": "12.30", "unit": "g", "confidence": 0,
"min_word_confidence": 0, "digits_ok": true } ],
"spec": { "lower": "", "upper": "", "result": "in | out | no_spec" },
"review_reasons": []
}
1つ目の理由は、raw に印字の文字列を持てることです。 数値に直した値を別に持たず、比較のたびに raw から直します。 台帳には raw を写します。
2つ目は、review_reasons で人が見る理由が一覧になることです。 理由は次の規則で付けます。
| 理由 | 付ける条件 |
|---|---|
| 低信頼 | 項目の信頼度、または単語の最小の信頼度が基準値を下回る |
| 桁数 | raw の小数点以下の桁数が、機器の一覧の桁数と違う |
| 試料番号の不一致 | ラベルと印字の試料番号が違う、または試験の予定に無い |
| 規格外 | 規格のマスタの下限・上限を外れる |
| 規格未登録 | その製品・試験項目の規格がマスタに無い |
| エラーの印字 | 値の位置に数字以外の文字列がある |
3つ目は、モデルの名前と信頼度を残せることです。 後から誤りが見つかったとき、どのモデルのどの版で読んだのかが分かれば、見本を足して作り直す対象が決まります。
システムへ連携する
| つなぎ先 | 方式 | 内容 |
|---|---|---|
| 機器ごとのフォルダ | Power Automate のファイル作成のトリガー | 保存を検知して読み取りを呼ぶ |
| Azure AI Document Intelligence | API呼び出し | まとめたモデルで読み取る |
| 規格のマスタ・試験の予定 | Python の読み取り | 比較と突き合わせ |
| 台帳 | Python の書き込み(下書きのシート) | 下書きの行を作る |
| Teams | Power Automate の投稿 | 規格外・不一致の通知 |
台帳の確定済みのシートには書き込みません。 書くのは下書きのシートまでで、担当者が確かめて確定の印を付けた行だけが、確定のシートに移ります。 試験記録は後から出荷や工程の判断の根拠になる記録で、確認前の値が混ざらないようにします。
人が確認する
担当者は、毎日の終わりに下書きの一覧を見ます。 review_reasons が空の行は、一覧で確かめて確定します。理由の付いた行だけ、印字の画像を開きます。
- 規格外を先に見る … 通知を受けた時点で、印字の画像と規格値を並べて確かめます。読み取りの誤りでないことを確かめてから、上長に報告します
- 試料番号の不一致を見る … ラベルの貼り間違いか、予定外の試験かを決めます
- 低信頼と桁数の行を見る … 印字の画像を見て、正しい文字列に直します
- 確定する … 直した行には、直した理由を残します
1番目の「読み取りの誤りでないことを確かめる」を省かないでください。 規格外の通知が、「0.83」を「0.38」と読んだだけということは起こりえます。誤った規格外の報告で工程を止めるのも、見逃すのと同じくらい困ります。
下書きの一覧の画面は、左に印字の画像、右に読み取った文字列を並べます。 理由の付いた項目の文字列に色を付け、画像のその位置を枠で示します。読み合わせで二人がしていたことを、一人で画面の左右を見比べる形に置き換えます。
信頼度の基準値は、最初の1か月で決めます。 信頼度は予測が正しい確率の推定で、精度が重要な場面では、自動で受け入れるか人の確認に回すかの判断に使えるとされています。最初は高めに置き、人が直した行と信頼度を並べて記録してから下げます。
例外に対処する
| 起きること | 対応 |
|---|---|
| 機器の一覧に無いフォルダに保存された | 読み取らずに担当者へ。一覧に足す |
| 機器の印字の設定が変わった | 文書の種類の信頼度が下がる。その機器のモデルを作り直す |
| 感熱紙が薄くて読めない | 低信頼で人へ。以後は測定直後に撮る決まりを徹底する |
| エラーの印字だった | 「エラーの印字」で人へ。測定のやり直しを判断する |
| 規格がマスタに無い | 「規格未登録」として、比較せずに人へ |
| ラベルが写っていない | 試料番号を決められないので人へ。撮り直す |
| 1枚に複数の試料の印字が写っている | 試料番号ごとに分けられないので人へ。1枚に1試料の決まりにする |
| 同じ試料を測り直した | 測定日時の新しいほうを候補にし、どちらを採るかは担当者が決める |
| 読み取りが応答しない | 元のフォルダに残す。処理済みへ移すのは成功時だけ |
2行目は、機器の点検や更新の後に起きます。 印字の項目の並びが変わると、テンプレートモデルの精度は下がります。文書の種類の信頼度が低いのは、学習した様式と違う書類が来た印とされているので、機器ごとにこの値の推移を見ておきます。
記録を残す
- 元の画像・PDFと、撮影した日時・機器の番号
- 読み取り結果のJSONと、使ったモデルの名前と版
- 規格の比較に使った規格値と、そのときの規格のマスタの版
- 人が直した行の、直す前と直した後の文字列と理由
- 規格外の通知を出した日時と相手、上長に報告した日時
- 確定した日時と、確定した担当者
1つ目の画像を、印字の原紙の代わりにするかどうかは、品質の手順書で決めてください。 感熱紙は薄くなるので、画像の保管は意味があります。ただし記録の原本をどれにするかは、この構成ではなく自社の手順で決めることです。
4つ目の直した記録は、モデルを作り直す材料です。 同じ機器で同じ文字の読み違いが続くなら、その見本を足してモデルを作り直します。
機器ごとに、理由の付いた行の割合を月ごとに集計します。 割合が上がった機器は、印字のヘッドが汚れている、感熱紙を替えた、撮影台の照明が変わった、といった読み取り以外の変化が起きていることが多いのです。読み取りの記録が、機器の手入れの合図にもなります。
04実装レベルの3段階
最小構成では、件数がさばけません。 Studio で1枚ずつ読むので、確かめるための段階です。 半自動化で、1件4分が2分程度になります。 手書きの転記と台帳への入力は無くなりますが、読み合わせの代わりの確認と、規格との比較が人に残ります。本格構成で1分になり、この段階が本記事の想定です。 本格構成でも、読み合わせを一度にやめないでください。 最初の1か月は、理由の付かなかった行から毎日数行を選び、印字と突き合わせます。理由が付かないのに誤っていた行が1件も無いことを確かめてから、読み合わせをやめます。 その記録が、品質の手順書を書き換えるときの根拠になります。 段階を飛ばさないでください。 半自動化を1機種で1か月回すと、撮影の条件と信頼度の基準値が決まります。そこを決めてから機種を増やすほうが、モデルを作り直す回数が減ります。
05工数削減シミュレーション
導入後 600件 × 1分 ÷ 60 = 10 時間/月
自社条件で導入効果を整理したい方へ
このユースケースを自社に当てはめた場合の前提値と削減見込みを、業務ヒアリングをもとに整理します。
06向いている企業・向いていない企業
- データの出力口が無い、または社内のシステムにつながっていない分析機器・試験機を複数台使い、印字やPDFの値を試験記録へ手で写している製造業の品質管理・研究開発部門。機器の印字の様式が機種ごとに決まっていて、毎月数百枚の印字が出る場合。手書きの転記を二人で読み合わせていて、その時間が負担になっている場合。規格外の値に気づくのが、記録をまとめた後になっている場合。
- 機器がLIMSや試験データのシステムに直接つながり、測定値が自動で取り込まれている場合(読み取りの工程そのものが要りません)。印字が月に数十枚で、担当者が転記してもすぐ終わる規模。外部の試験機関から届く報告書が中心の場合(UC-0212 の構成が合います)。なお、規格外の値を受けた出荷や工程の判断を自動で行う設計にはしていません。
07最小構成で試す方法
- 印字の枚数が多い機種を1つ選ぶ(天びんかpH計が試しやすい)
- その機種の過去の印字から、デジタルのPDFか画像を10枚、撮影した画像を10枚用意する(薄いもの、傾いたものを含める)
- Document Intelligence Studio でカスタムテンプレートモデルを作り、項目にラベルを付けて学習させる
- 別の印字30枚を読み取らせ、当時の手書きの転記と並べる
- 信頼度と、手書きと食い違った項目を表にする
確かめたいのは、桁を落とさずに読めるかと、信頼度で誤りを拾えるかの2つです。
| 出てきた内容 | 判断 |
|---|---|
| 30枚とも桁数どおりに読め、信頼度も高い | ほかの機種のモデルづくりと連携に進む |
| 誤読はあるが、誤読した項目の信頼度が低い | 構成は有効。 基準値で人に回せる |
| 誤読した項目の信頼度が高い | 見本を増やす。撮影の条件を先に見直す |
| 手書きの転記のほうが誤っていた | 第3章の(b)が実際に起きている |
4行目が出たら、その件数を記録しておいてください。 手書きの転記がどれくらい誤っていたかは、読み合わせをやめる判断の材料になります。
3行目がいちばん困る結果です。 信頼度が高いのに誤っている項目は、人の確認に回りません。撮影の距離と明るさを揃えてから、見本を足して作り直してください。
08実装時につまずきやすいポイント
| 問題 | 対策 |
|---|---|
| 小数点以下の0が落ちる | 文字列のまま持ち、比較のときだけ数値に直す |
| 「8」と「3」などの読み違いが高い信頼度で出る | 単語の信頼度も見る。機器の一覧の桁数と照らす |
| 試料番号を取り違える | ラベルと印字を同じ画像に写す。試験の予定と突き合わせる |
| 感熱紙の細い文字が読めない | 撮影台の高さを固定し、文字の高さの下限を下回らないようにする |
| 機器の設定が変わって精度が落ちる | 文書の種類の信頼度の推移を見て、モデルを作り直す |
| 空欄の項目がいつも低信頼になる | 空欄の見本を含めて学習させる |
| エラーの印字を数値として読もうとする | エラーの見本を含める。数字以外は「エラーの印字」で人へ |
| 機種ごとのモデルを1つにまとめて作ってしまう | 様式ごとに分け、まとめるのは呼び出しの窓口だけ |
| 規格外の通知が誤読だった | 通知を受けたら、報告の前に印字の画像を見る |
| 確定の前の値が記録として使われる | 下書きと確定のシートを分ける |
上の2行が、この構成の失敗のほとんどです。 どちらも、見た目は正しい数字が台帳に入るという形で起きます。人が見つけるのは難しく、桁数と信頼度という機械で確かめられる手がかりを、必ず両方使います。
真ん中の「機種ごとのモデルを1つにまとめて作ってしまう」も、最初に起きやすい失敗です。 6機種の見本を1つのモデルに入れて学習させると、様式の違う印字の項目の位置が混ざり、どの機種でも精度が中途半端になります。 見本は機種ごとのフォルダに分け、別々に学習させてから窓口だけをまとめます。
下から2行目は、運用が回り始めてから効いてきます。 規格外の通知をそのまま上長に転送する習慣がつくと、誤読による規格外で工程を止めることになります。
09セキュリティ・AIガバナンス上の注意点
この構成で扱うデータ: 製品・ロット・試料の番号、測定条件と測定値、規格値です。個人情報はほとんど含みませんが、規格値と測定値の推移は、製品の品質と開発の状況を表す社外秘の情報です。
- 読み取りの範囲を印字とラベルに限る … 撮影台に写り込む範囲を決め、試験室の掲示物や他の書類が写らないようにします
- 規格のマスタを外に出さない … 規格との比較は Python の側で行い、規格値そのものを読み取りのサービスに渡しません
- 判定と処置を人に残す … この構成が出すのは規格外の通知までです。再試験、ロットの保留、出荷の可否は、品質管理部の手順で人が決めます
- 記録の原本と修正の扱いを手順書で決める … 画像と台帳のどちらを原本とするか、直した行の記録をどう残すかを、品質の手順書に書いてから運用を始めます
- モデルの版を管理する … モデルを作り直したら名前と版を変え、どの記録をどの版で読んだかを残します
誤りが起きた場合のリスクは、誤った測定値が記録に残ることと、規格外を見逃すこと、誤った規格外で工程を止めることの3つです。 どれも読み取りの誤りから始まるので、桁数と信頼度で人に回す行を決め、規格外は報告の前に画像で確かめるところまでを手順にしておきます。
10まず何から始めるか
1週目:撮影台を作り、撮影の条件を決める
印字とラベルを置く位置、カメラの高さ、明るさを決めて固定します。ここが決まらないうちにモデルを作ると、作り直しになります。
2週目:1機種でモデルを作る
天びんかpH計を選び、PDFか画像を10枚、撮影した画像を10枚集めて、Studio でカスタムテンプレートモデルを作ります。薄くなった印字とエラーの印字を必ず含めます。
3週目:30枚で試す
別の印字30枚を読み取らせ、当時の手書きの転記と並べます。桁数どおりに読めているか、誤読した項目の信頼度が低いかを見ます。
4週目:機器の一覧と規格のマスタを整える
機器ごとの桁数と単位、使うモデルの名前を一覧にします。規格のマスタに、比較に使う値(平均か個々の値か)の列を足します。
2か月目: 1機種で保存から下書きのシートまでをつなぎ、信頼度の基準値を決めます。3か月目以降: 機種を増やしてモデルをまとめ、規格の比較と Teams の通知を足します。1件4分が何分になったかを実測します。読み合わせをやめても写し間違いが出なくなり、規格外が撮影の直後に知らされるようになった時点で、この構成は完成です。
11関連ユースケース
12この仕組みを理解するための記事
13技術仕様の確認日・参考情報
| 確認した内容 | 情報源 | 確認日 |
|---|---|---|
カスタムテンプレートモデルがラベル付きのキーと値の組・選択マーク・テーブル・署名・領域を抽出し、定義された見た目の様式を持つ構造化された書類に向くこと。様式が変わると精度が下がり、様式ごとに5枚以上の見本でモデルを作って composed model にまとめる方法が示されていること。デジタルのPDFと画像の違いには、それぞれ5枚以上を同じ学習データに含めることが勧められていること。PDFとTIFFで最大2,000ページ、有料(S0)で500MB。画像が50×50から10,000×10,000ピクセル。文字の最小の高さが1024×768の画像で12ピクセル。テンプレートモデルの学習データが最大500ページ・50MBであること。buildMode を template にして学習させること | Microsoft Learn: Custom template document model | 2026-10-06 |
カスタムテンプレートモデルの対応言語に、印刷の文字で日本語(ja)が含まれ、手書きでも日本語が対象であること | Microsoft Learn: Language support for custom models | 2026-10-06 |
| 信頼度が予測が正しい確率の推定で、自動で受け入れるか人の確認に回すかの判断に使えること。項目の信頼度が値の位置の確からしさを反映し、文字起こしの確からしさは単語の信頼度に出ること。文書の種類の信頼度が低いのは学習データと様式が違う印であること。空欄の値の信頼度が学習データでの空欄の多さに基づくこと。学習の精度の目標が80%以上で、医療などの機微な場面では100%に近い値が勧められること | Microsoft Learn: Interpret and improve model accuracy and confidence scores | 2026-10-06 |
レイアウトモデルがテキスト・テーブル・選択マークを抽出し、テーブルの各セルに行と列のインデックスが含まれること。単語ごとに confidence が返ること。pages でページを指定できること | Microsoft Learn: ドキュメント レイアウト分析 | 2026-10-06 |
試験記録の原本の扱いと、規格外の処置の手順は、自社の品質の手順書に従ってください。 本記事は公開されている仕様で確認できた範囲だけを扱っています。
実装ステータス:構成例。 公開仕様に基づいて設計した構成であり、当社で実際に構築・検証したものではありません。工数の数値はモデル条件による試算です。
自社の業務に使えるAI活用候補を整理します
このユースケース(UC-0545)についてのご相談はこちらから。
