PROMPT DESIGN

VLM外観検査のプロンプト設計|良品の過検出と判定ぶれを抑える実装手順

結論は、プロンプトを文章術ではなく「検査仕様」として管理することです。多品種少量ラインの品質保証・生産技術責任者に向け、撮像固定→良品変動→欠陥境界→JSON契約→要確認→評価→版管理・回帰試験の順で、PoCで固定するものと測るものを整理します。

2026-09-24 / 最終更新 2026-09-24 / 監修:嶋野(元キーエンス画像処理事業部 開発エンジニア)/ 読了時間:約11分
01
固定するもの:対象品種、撮像条件、良品として許容する変動、欠陥名と境界、JSON出力、要確認条件、モデルとプロンプトの版。これらを一組の検査仕様にします。
02
測るもの:欠陥別の見逃し、良品の過検出、要確認率、JSON契約違反、品種・ロット・撮像条件別の差。Accuracyだけで合否を決めません。
03
判断フロー:画像で観察可能か→ルール化できるか→OK/NGを決められるか→不確実なら要確認→固定評価セットで測定→変更ごとに回帰試験。外観画像で保証できない項目は別計測へ分けます。
― 目次
  1. プロンプトを検査仕様として扱う
  2. 7段階の実装手順
  3. JSON出力契約の設計
  4. 方式と責任分界
  5. 評価指標と回帰試験
  6. FACTとNsight VIEW
  7. 外観画像で保証できないもの
  8. FAQ
― 01 / 結論

プロンプトは「うまい質問」ではなく、変更管理される検査仕様

VLM外観検査で判定がぶれる典型原因は、モデルへの指示が曖昧なことだけではありません。「赤と青はどちらも良品」「成形ゲート跡は許容」「欠けは端部から連続して材料が失われた状態」といった現場の暗黙知が、入力条件と判定規則に落ちていないことです。プロンプトだけを直しても、撮像、参照画像、後処理、モデル版が同時に変われば原因を追えません。

そこで、プロンプトを単独の文章ではなく、入力仕様・欠陥辞書・境界例・出力スキーマ・評価セットを束ねた「検査仕様」として扱います。変更は一度に一要素を原則とし、変更理由、承認者、評価結果を残します。方式選定そのものはVLMとCNNの方式選定、PoC全体はAI検査PoCの進め方、一般的な不調原因はAI検査で精度が出ない原因に譲り、本稿は判定契約の設計に絞ります。

判断フロー
対象と撮像を固定 → 良品変動を列挙 → 欠陥と境界例を定義 → JSON契約で回答を制約 → 判断不能は要確認へ → 層別指標で評価 → 版を固定して回帰試験
― 02 / 実装手順

PoCで迷わない、7段階のプロンプト設計

1. 検査対象と撮像条件を固定する

品番、面、向き、検査領域、カメラ、レンズ、照明、露光、ワーク距離、画像解像度、前処理を記録します。入力画像には一つの検査対象だけを含め、対象外領域はマスクするか、無視する領域として明記します。ぼけ、白飛び、黒つぶれ、遮蔽、位置外れは欠陥ではなく「撮像不成立」の理由コードにします。

2. 良品変動を先に定義する

VLMにとって「基準画像と違う」は「欠陥」と同義ではありません。許容する色、光沢、模様、ロット差、仕入先差、成形跡、印刷位置、表面の微小な揺らぎを列挙し、良品例に変動タグを付けます。「無視せよ」だけでなく、「赤と青の毛色はいずれも許容し、毛の欠落とは区別する」のように、観察対象との違いを書きます。

3. 欠陥分類と境界例を定義する

欠陥名、観察可能な特徴、検査領域、許容限界、混同しやすい良品特徴を一対で記述します。数値閾値を画像から安定して読めないなら、プロンプトに0.5mmと書くだけでは測定になりません。スケール校正や画像処理による寸法計測へ分離します。合意が割れる境界例には、品質部門が正解ラベルと理由を付けます。

4. プロンプトと出力JSON契約を固定する

役割、対象、観察順序、許容変動、欠陥定義、禁止事項、判定優先順位、JSONスキーマを固定します。自由作文を減らし、列挙値と理由コードを使います。モデルに見えない事実を推測させず、「画像だけでは判断できない」と返せるようにします。

5. 「要確認」を正式な分岐にする

OK/NGへの強制は、曖昧な画像に確信した回答を作らせます。撮像不成立、対象外品種、境界値付近、欠陥候補の競合、基準画像不足は要確認へ回し、人が見る画像、理由、優先度を残します。要確認率が高すぎれば自動化範囲か撮像を見直します。

6. 評価セットと指標を先に凍結する

良品、不良、境界例、撮像不良、対象外を含め、品種・ロット・設備・時間帯で層別できる評価セットを作ります。見逃し率、過検出率、要確認率、欠陥別再現率、JSON契約遵守率を測ります。同じ個体や連写画像が開発用と評価用にまたがらないよう分割します。

7. 版管理し、変更ごとに回帰試験する

モデルID、システム指示、ユーザープロンプト、参照画像、前処理、JSON Schema、温度などの生成設定、後処理、閾値を一つのリリースとして識別します。新しい欠陥説明を足したことで既存良品がNGにならないか、固定回帰セット全体で確認します。合否は品質部門が承認し、開発者だけで本番反映しません。

― 03 / 出力契約

説明文ではなく、機械が検証できるJSONを返す

出力は文章の巧さではなく、後工程が検証できることを優先します。たとえば次の項目を必須にし、未定義の欠陥名を生成できない列挙型にします。

{
  "inspection_status": "OK | NG | REVIEW",
  "defect_code": "NONE | SCRATCH | CHIP | CONTAMINATION | UNKNOWN",
  "observed_fact": "画像で直接確認できた事実のみ",
  "region": "TOP | BOTTOM | LEFT | RIGHT | CENTER | NOT_APPLICABLE",
  "review_reason": "NONE | IMAGE_QUALITY | BORDERLINE | OUT_OF_SCOPE | CONFLICT | REFERENCE_MISSING",
  "evidence": [{"region":"LEFT","description":"線状の暗部"}],
  "schema_version": "inspection-output-1.0"
}

判定順序も契約します。まず入力妥当性、次に対象品種、次に許容良品変動、最後に欠陥の有無を確認します。NGは定義済み欠陥に一致した場合だけ、OKは全検査領域を確認でき、いずれの欠陥条件にも当たらない場合だけ、その他はREVIEWです。「確信度80%」のような自己申告値は校正済み確率とは限らないため、それだけで自動排出を決めません。

― 04 / 責任分界

VLMに全部を任せず、方式ごとの責任を決める

方式主に任せる役割向く条件任せない判断
VLM単独自然言語で定義した外観分類、理由コード、要確認振り分け多品種少量、意味的な欠陥分類、低〜中速の検証微小欠陥の保証、厳密寸法、高速全数処理を無検証で担わせない
異常検知/CNN安定した画像条件での定型分類・位置検出・異常スコア対象が安定、反復量が多い、学習・評価データを整備できる未定義異常の意味説明や規格判断を単独で担わせない
ルール色、面積、個数、位置、寸法など決定的な演算閾値を測定可能で、撮像が安定曖昧な意味判断や大きな良品変動を無理に吸収しない
ハイブリッドルール/CNNで高速選別し、VLMで難例分類・説明タクトと柔軟性を両立したい各段の誤りが連鎖するため、全体指標なしで採用しない
人の確認境界例、対象外、撮像不良、品質判断、変更承認誤判定コストが高い、基準が未成熟要確認を無制限に人へ流し、負荷を測らない運用にしない

実務上の責任分界は「VLMが候補と観察事実を構造化し、決定的な数値はルールで測り、境界と例外は人が承認する」が出発点です。最終構成はタクト、見逃しリスク、データ量で決めます。

― 05 / 評価と変更管理

Accuracy一つでは、良品をNGにする問題を見落とす

指標見る失敗層別
欠陥別見逃し率NGをOKにする欠陥種、サイズ帯、位置、品種
良品過検出率OKをNGにする色、ロット、仕入先、設備、時間帯
要確認率人への負荷と自動化範囲要確認理由、品種、撮像条件
契約違反率JSON不正、未定義コード、必須値欠落モデル版、プロンプト版
再現性同一入力で判定が変わる反復回数、生成設定

最小の変更台帳

平均値が改善しても、特定品種の見逃しが悪化すれば採用できない場合があります。PoC開始前に、欠陥別の許容上限、要確認の処理能力、契約違反ゼロなどの判断基準を品質部門と合意します。

― 06 / 根拠と見解

FACT:一次資料が示すこと

FACT:NVIDIAのVLM解説は、VLMを画像・動画・テキストを扱うモデルと説明する一方、多くのVLMで小物体や細部の検出、正確な位置特定が難しく、特定製品ラインの製造欠陥を十分に学んでいない可能性を限界として挙げています。したがって、自然言語で指示できることと、自社の微小欠陥を識別できることは別に検証する必要があります。

FACT:AWSのAmazon Nova Pro製造実験では、MVTec ADの歯ブラシ42枚(欠陥30枚、良品12枚)という限定条件で、初期プロンプトのSpecificityは33%、製品特化プロンプトでは83%でした。Accuracyも81%から93%へ変化しました。これはAWSブログ上の単一カテゴリ・小規模ベンチマーク実験であり、他製品や実ラインの一般性能を示す値ではありません。色差を欠陥と誤認した事実は、良品変動の明文化と良品過検出の測定が必要なことを示します。

FACT:WinCLIP論文(CVPR 2023)は、MVTec ADで追加学習なしの異常分類AUROC 91.8%、異常セグメンテーションAUROC 85.1%を報告しています。これはMVTec ADというベンチマーク条件のAUROCであり、実ラインのAccuracy、見逃し率、歩留まり、再現性を保証するものではありません。

Nsight VIEW:実務へどう落とすか

Nsight VIEW:上記から、プロンプト改善を「精度を上げる魔法の文言探し」にせず、許容変動と判定境界を品質仕様から移植する作業として扱うべきだと考えます。また、ベンチマーク値は方式の可能性を知る材料であり、自社品種・撮像・欠陥分布を固定した受入試験の代替にはなりません。

Nsight VIEW:多品種少量では、一つの巨大プロンプトに全品種を詰め込むより、共通契約と品種別の差分仕様を分けるほうが変更影響を追いやすくなります。共通部には出力、撮像不成立、要確認を置き、品種別部には良品変動と欠陥境界を置きます。

― 07 / 適用限界

外観画像だけでは保証できない品質を切り分ける

VLMが返せるのは、入力画像に現れ、撮像条件のもとで識別できる観察結果です。製品全体の品質規格適合、機能性能、内部欠陥、画像分解能を超える寸法公差、シール強度、材料組成、耐久性は、外観画像だけでは保証できません。対象に応じて、寸法測定、電気検査、X線・超音波などの非破壊検査、リーク・強度試験、材料試験を別に設計します。

また、VLMの説明は監査証跡そのものではありません。元画像、撮像条件、モデルとプロンプトの版、構造化された観察事実、人の承認履歴を結びつけて保存して初めて、後から判定を追跡できます。適用範囲と非対象を検査仕様の先頭に明記してください。

― FAQ

よくある質問

VLM外観検査のプロンプトは、長く詳しく書くほど精度が上がりますか?

一律には上がりません。重要なのは長さではなく、検査対象、許容する良品変動、欠陥の定義、境界例、判定不能条件、出力形式に矛盾がないことです。指示を追加したら固定評価セットで見逃しと過検出の両方を再測定します。

OKとNGの二値だけでは不十分ですか?

画像が不鮮明、対象外品種、境界値付近、複数欠陥が競合する場合まで二値に強制すると、根拠のない確信を生みやすくなります。要確認を正式な判定として設け、理由コードと人への引き継ぎ条件を決めるほうが安全です。

良品画像は何枚あれば足りますか?

一律の必要枚数はありません。ロット、仕入先、色、光沢、成形跡、位置ずれ、季節や設備差など、許容する変動軸を網羅できているかで判断します。枚数だけでなく、どの変動を代表しているかを台帳で管理することが重要です。

VLMの説明文をそのまま品質記録に使えますか?

そのまま使う前提にはできません。説明は画像内容と一致しない可能性があるため、選択式の欠陥コード、観察事実、根拠領域、確信度ではなく要確認理由を構造化し、画像とルールで検証できる記録にします。

プロンプトを変更したとき、何を再試験すべきですか?

変更対象の欠陥だけでなく、良品変動、類似欠陥、撮像不良、対象外品種、過去に誤判定した難例を含む固定回帰セットを再試験します。モデル、プロンプト、参照画像、前処理、JSONスキーマ、閾値の版を一組で記録します。

外観画像だけで品質規格への適合を保証できますか?

保証できません。画像に現れ、撮像で識別できる外観項目だけが対象です。機能性能、内部欠陥、寸法公差、シール強度、材料特性などは、対象に応じて寸法測定、非破壊検査、強度試験などの別計測が必要です。

― REVIEWED BY
嶋野(元キーエンス画像処理事業部 開発エンジニア)
キーエンス画像処理事業部での実務経験をもとに、産業用カメラ・照明・光学系・検査装置の開発に従事し、現在はNsightの技術コンテンツ監修を担当。プロフィール詳細 →

プロンプトを検査仕様として、現物で検証しませんか

良品変動、欠陥境界、要確認、評価セットを整理し、撮像から回帰試験まで一貫したPoC設計をご相談いただけます。

VLM外観検査のプロンプト設計を相談する