モデルカードの作り方:文書分類AIの用途・評価・限界を一枚にまとめる

モデルカードは、モデルの目的、評価した条件、使う際の限界を読み手に伝える文書です。高い性能値だけを並べる紹介文とは役割が違います。今回は架空の「問い合わせ文を配送・請求・その他に分類するAI」を例に、何が分かっていて何が未確認かを記録します。

読む人が判断したいことから書く

導入担当者は自分の業務に使えるか、運用担当者は誤りが起きたとき誰が対応するか、評価担当者は数値を再確認できるかを知りたいはずです。原著のModel Cards for Model Reportingも、用途や条件ごとの性能、限界などを開示する枠組みを提案しています。[出典1] 以下の記入項目は、その趣旨を教材に合わせた編集例です。公式の認証書式ではありません。

架空のモデルカードを記入する

項目教材での記入例
識別子document-router-demo / モデル版は未採番
目的問い合わせ文書の仮分類を付け、人の振り分けを補助する
想定入力日本語の問い合わせ本文。住所や決済情報は教材に含めない
出力配送・請求・その他の予測クラスと確率
想定する利用人が確認する作業の順序付け
想定しない利用予測だけによる返金可否や契約上の判断
学習データ未準備。出所・期間・許諾・重複除外の記録が必要
評価データ未準備。独立した評価用データを用意する
評価指標クラス別の誤り、全体の分類指標、確率評価を候補にする
性能値未測定。数値を仮で埋めない
条件別の確認短文・長文・複数の用件・表記ゆれを分けて評価する
既知の限界教材段階のため実業務の適合性は未確認
人の確認分類結果を人が確認し、訂正を別に記録する
連絡先担当者を実際に決めてから記入する。架空の氏名を置かない

「未準備」「未測定」を書くと未完成に見えますが、未確認の数値を埋めるよりも判断材料として正確です。カードを先に作れば、評価で何を集める必要があるかも分かります。

性能表には、数値と一緒に母数を置く

文書全体で高い正解率でも、請求クラスの件数が少なければ、そのクラスの誤りが隠れる場合があります。次の表を評価後に埋めます。モデルを選ぶために使ったデータと、最後の確認用データも分けて説明してください。

対象件数指標・定義値期間
全体未測定採用した指標を明記未測定未決定
配送未測定クラス別の誤り未測定未決定
請求未測定クラス別の誤り未測定未決定
複数用件未測定どのラベルを正解とするかも明記未測定未決定

更新時は「何を変えたか」を残す

モデル版だけでなく、前処理、ラベル基準、評価期間の版を記録します。配送費の質問を配送から請求へ分類するよう業務規則を変えたなら、以前の数値と同じ意味で比較できるかを確認します。古い評価値を新しいモデルの実績として掲載しないでください。

提出前の確認

個別適用や説明の拡張時に確認する事項:この教材のカードは実サービスの性能証明ではありません。実際の情報で欄を埋め、確認した範囲だけを公開するための出発点として使ってください。

出典

Mitchell et al., Model Cards for Model Reporting。