無料で情報を見る

AIモデルのリスク評価と監査|精度・公平性・説明可能性の確かめ方

営業企画部が導入した与信スコアリングのAIモデルは、導入時の検証で高い正解率を示し、審査の時間を大幅に短縮しました。1年後、内部監査部門がその運用を確認すると、モデルは導入時のまま一度も再評価されていませんでした。検証に使ったデータは景気のよい時期のもので、その後に取引を始めた業種の顧客はほとんど含まれていません。担当者に「最近の精度は?」と尋ねても、測る仕組み自体がありませんでした。

これはAIを業務に組み込んだ多くの会社で起こりうる場面です(本記事の事例はすべて架空のモデルケースです)。AIモデルは、作った時点では正しく動いていても、世の中やデータの変化によって少しずつ性能が落ちていきます。しかも、表計算ソフトの計算式と違って、なぜその答えを出したのかを人がすぐに確かめられるとは限りません。

内部監査がAIモデルを見るとき、統計やプログラミングの専門知識は必ずしも前提になりません。問うべきことは、「このモデルは何のために使われ、どのデータで検証され、誰が使用を承認し、いまも意図どおり動いていると誰がどう確かめているか」です。この記事では、その問いを監査の手続と調書に落とし込む方法を解説します。

この記事の要点

  • AIモデルの監査は、まず「どのモデルが、どの業務判断に使われているか」の一覧(モデル・インベントリー)を確かめることから始めます
  • 精度は「導入時に高かったか」ではなく、「いまも許容範囲にあるかを継続的に測っているか」を見ます
  • 公平性と説明可能性は、用途によって求められる水準が変わります。基準を事前に決めて承認しているかが監査の焦点です
  • NIST AI RMF、金融庁「モデル・リスク管理に関する原則」、AI事業者ガイドライン(第1.2版)は、評価基準を設定する拠り所として使えます
  • 内部監査はモデルの正しさを自ら保証する立場ではなく、管理態勢全体の有効性を評価する立場です

AIモデルのリスクとは何か:なぜ従来のIT監査だけでは足りないのか

モデル・リスクという考え方

モデル・リスクとは、モデルの誤りや不適切な使い方によって、誤った意思決定や損失が生じるリスクを指します。金融機関では以前から、信用リスクの計測や価格算定に使う統計モデルについて、この考え方で管理が行われてきました。金融庁は2021年11月に「モデル・リスク管理に関する原則」を公表し、ガバナンス、モデルの特定とインベントリー管理・リスク格付、開発、承認、継続モニタリング、独立検証、ベンダー・モデルの活用、内部監査という8つの原則を示しています。

この原則の対象は主に大手金融機関ですが、考え方は業種を問わず応用できます。特に原則8で、内部監査部門が第3線としてモデル・リスク管理態勢の全体的な有効性を評価すべきとされている点は、内部監査の役割を考えるうえで参考になります。

AIモデルが従来のシステムと違う3つの点

従来のシステムは、人が書いたルールどおりに動きます。仕様書とプログラムを突き合わせれば、正しさを確かめられます。これに対し、機械学習によるAIモデルは、過去のデータから規則を「学習」して作られます。この違いから、監査上の論点が3つ生まれます。

第一に、正しさがデータに依存します。学習データに偏りや誤りがあれば、モデルはそれを忠実に再現します。第二に、性能が時間とともに変化します。入力データの傾向が変わる「データドリフト」や、入力と結果の関係そのものが変わる「コンセプトドリフト」によって、導入時の精度が保たれなくなります。第三に、判断の根拠が見えにくくなります。特に深層学習や生成AIでは、個々の出力の理由を人が説明するのは簡単ではありません。

生成AIで加わる論点

生成AI(大規模言語モデル等)を業務に使う場合は、事実と異なる内容をもっともらしく出力する「ハルシネーション」、入力した機密情報の取扱い、出力に含まれる著作物や個人情報の問題が加わります。また、多くの場合、モデル自体は外部の事業者が提供するため、自社で学習データや内部構造を確かめることはできません。

生成AI利用上の落とし穴は内部監査のAI活用の落とし穴で、AI利用ポリシー全体の監査はAIガバナンスの監査で詳しく扱っています。本記事では、個々のモデルのリスク評価に焦点を当てます。

評価の拠り所となるフレームワーク

主要な枠組みの比較

AIモデルの監査では、評価基準(クライテリア)を何に置くかが最初の論点になります。社内規程が整っていない段階では、公的な枠組みを参照して基準を組み立てるのが実務的です。

枠組み 発行者・時期 特徴 監査での使いどころ
AI Risk Management Framework(AI RMF 1.0) 米国NIST、2023年1月 GOVERN・MAP・MEASURE・MANAGEの4機能と、信頼できるAIの7特性 評価項目の網羅性の確認
モデル・リスク管理に関する原則 金融庁、2021年11月 モデルのライフサイクルと3線の役割を8原則で整理 インベントリー、承認、検証、監査の手続設計
AI事業者ガイドライン(第1.2版) 総務省・経済産業省、2026年3月 AI開発者・提供者・利用者の立場別の指針 自社の立場に応じた取組の確認
ISO/IEC 42001:2023 ISO/IEC AIマネジメントシステムの要求事項 認証取得企業での既存記録の活用

日本では2025年6月に「人工知能関連技術の研究開発及び活用の推進に関する法律」(AI推進法)が公布され、同年9月に全面施行されました。この法律は事業者に罰則つきの義務を課すものではありませんが、国の施策への協力などを求めています。海外で事業を行う企業は、EUのAI規則(Regulation (EU) 2024/1689)のように段階的に適用が進む規制もあるため、最新の適用時期は公式情報で確認してください。

信頼できるAIの7つの特性

NIST AI RMFは、信頼できるAIの特性として、妥当性と信頼性(valid and reliable)、安全性(safe)、セキュリティとレジリエンス(secure and resilient)、説明責任と透明性(accountable and transparent)、説明可能性と解釈可能性(explainable and interpretable)、プライバシーの強化(privacy-enhanced)、有害なバイアスが管理された公平性(fair with harmful bias managed)の7つを挙げています。

ここで大切なのは、これらの特性がトレードオフの関係になりうるという点です。精度を最大にしようとすると説明が難しいモデルになり、公平性の制約を加えると全体の精度が下がることがあります。どの特性をどこまで優先するかは、技術ではなく用途と価値判断の問題です。だからこそ、その判断が組織として承認されているかが監査の対象になります。

学習データから開発、承認、運用、モニタリングへと流れるAIモデルのライフサイクルと3つのラインの監督を示す図
AIモデルのリスクは開発時だけでなく、承認・運用・モニタリングの各段階で生じます。各段階に第1線・第2線・第3線の誰が関与するかを明確にすることが、管理態勢の土台になります。

モデル・インベントリーとリスク格付を確かめる

まず「どこでAIが使われているか」を知る

監査の出発点は、社内で使われているAIモデルの一覧です。金融庁の原則でも、管理すべきモデルを特定し、インベントリーに記録したうえでリスク格付を付与することが求められています。実務上の難しさは、AIが「システム」としてIT部門に登録されるとは限らない点にあります。業務部門がSaaSのAI機能を有効にしたり、表計算ソフト上で予測モデルを作ったりすると、一覧の外でAIが業務判断に使われることになります。

網羅性を確かめるには、IT部門の台帳だけでなく、SaaSの契約一覧、購買記録、業務部門へのアンケートなど、独立した情報源と突き合わせます。この発想は、脆弱性管理で資産台帳の網羅性を確かめる手続と同じです(脆弱性管理の監査も参考にしてください)。

インベントリーの記入例

以下はモデル・インベントリーの記入例です(架空のモデルケース)。この項目がそろっていれば、リスク格付と監査対象の選定に使えます。

項目 記入例
モデルID・名称 M-012 取引先与信スコアリング
用途(業務判断) 新規取引先の与信限度額の初期設定に使用。最終判断は審査担当者
モデルの種類 勾配ブースティングによる分類モデル(自社開発)
入力データ 財務データ、取引履歴、外部信用情報
出力の使われ方 スコアに応じて審査区分を自動振り分け
所有者(第1線) 営業管理部長
独立検証者(第2線) リスク管理部
リスク格付 高(取引判断に直結、個人事業主の情報を含む)
直近の検証日・次回予定 2025年10月・2026年10月

リスク格付の考え方

すべてのモデルを同じ深さで管理・監査するのは現実的ではありません。リスク格付は、限られた資源をどこに集中させるかを決める仕組みです。格付の軸としては、業務判断への影響の大きさ、人の関与の度合い(最終判断が人か自動か)、個人や顧客への影響、モデルの複雑さ、使用している取引量が一般的です。

監査では、格付基準が文書化され、実際の格付がその基準どおりに付けられているかを確かめます。高リスクのモデルが「低」に格付されていると、独立検証や承認の手続が省略され、管理の網から漏れてしまいます。

精度・公平性・説明可能性をどう評価するか

精度:導入時ではなく「いま」を見る

精度の監査で最も重要なのは、導入時の検証結果ではなく、運用中のモニタリングです。確認すべき点は、性能指標(正解率、適合率、再現率など)が用途に応じて選ばれているか、許容範囲(しきい値)が事前に決まっているか、しきい値を下回ったときの対応(再学習、利用停止、人による判断への切替え)が定められているか、の3つです。

指標の選び方にも注意が必要です。たとえば不正検知では、不正の件数自体が少ないため、「すべて正常」と答えるだけのモデルでも正解率は高く出ます。この場合は、不正をどれだけ見逃さないか(再現率)を見なければ意味がありません。用途に合った指標が選ばれているかは、専門家でなくても質問で確かめられます。

公平性:何をもって「公平」とするかを決めているか

公平性の評価は、性別や年齢などの属性によって、モデルの結果に不当な差が生じていないかを確かめることです。ただし、「公平」の定義は一つではありません。属性ごとの承認率をそろえる考え方と、属性ごとの誤判定率をそろえる考え方では、両立しない場合があることが知られています。

したがって監査の焦点は、「どの定義を採用し、どの属性について、どの程度の差までを許容するか」が用途に照らして検討され、承認されているかです。個人を対象とする判断(採用、与信、保険料など)に使うモデルでは、この検討の記録が特に重要になります。個人情報の取扱いについては、個人情報保護法との関係もあわせて確認します。

説明可能性:誰に、何を説明できればよいか

説明可能性とは、モデルがなぜその出力をしたのかを、人が理解できる形で示せることです。ここでも求められる水準は用途で変わります。社内の需要予測であれば、どの要因が予測に効いているかを大まかに把握できれば足りるかもしれません。一方、顧客に不利な判断を伝える場面では、個々の判断の主な理由を説明できる必要があります。

監査では、説明を求められる相手(利用者、顧客、監督当局など)と必要な水準が整理され、それに見合う手段(重要な変数の一覧、個別判断の理由を示す仕組み、人による最終確認など)が用意されているかを確かめます。

精度のメーターと、公平性・説明可能性・セキュリティを表す複数のアイコンを天秤にかけた図
高い精度だけでは信頼できるAIとは言えません。公平性や説明可能性など複数の特性のバランスを、用途に応じて組織が判断し承認しているかが監査の焦点になります。

外部提供モデルの場合:確かめられないことをどう補うか

外部の事業者が提供するモデルやAI機能では、学習データや内部構造を自社で確かめることはできません。その場合の監査の焦点は、確かめられない部分を自社がどう補っているかに移ります。具体的には、提供者が公開している性能や制約に関する情報を入手・検討しているか、自社の業務データで導入前に試験を行ったか、提供者がモデルを更新したときに通知を受け、影響を確認する手順があるか、といった点です。

特に見落とされやすいのが、提供者側のモデル更新です。同じサービス名のまま内部のモデルが入れ替わり、出力の傾向が変わることがあります。契約条件や利用規約で変更通知の扱いを確認し、重要な用途では定期的に同じ評価用データで出力を確かめる運用があるかを質問します。

評価観点のチェックリスト

  • 用途に合った性能指標と許容範囲が、導入前に文書化され承認されている
  • 学習データの出所、期間、前処理の内容が記録されている
  • 検証用データが学習データと分けられ、運用環境に近い条件で評価されている
  • 運用中の性能を定期的に測定し、しきい値割れの際の対応手順がある
  • 公平性の定義と対象属性、許容差が検討され、その結果が記録されている
  • 説明の相手と水準が整理され、個別判断を人が確認・修正できる仕組みがある
  • モデルの変更(再学習、パラメータ変更)が承認を経て行われ、履歴が残っている
  • 外部提供のモデルについて、提供者の情報開示と契約上の取り決めを確認している

監査手続の設計と調書の記入例

3つのラインの役割を確かめる

AIモデルの管理では、開発・利用部門(第1線)がモデルを作り運用し、リスク管理部門など(第2線)が独立した立場で検証し、内部監査(第3線)が態勢全体の有効性を評価するという分担が基本です。内部監査が自らモデルを再検証すると、第2線の役割を代替することになり、独立性や工数の面で無理が生じます。役割分担の考え方は3ラインモデルとはも参考にしてください。

ただし、第2線が未整備の会社では、内部監査が助言(アドバイザリー)として管理の枠組み作りに関与することもあります。その場合は、後の保証業務で自らの助言を評価することにならないよう、関与の範囲を記録しておくことが大切です。

監査手続の記入例

以下は、高リスクに格付されたモデルを対象とした監査手続と調書の記入例です(架空のモデルケース)。

# 監査手続 入手資料 結果の記入例
1 インベントリーの網羅性確認 モデル一覧、SaaS契約一覧 SaaS契約1件(採用書類の選考支援機能)が一覧に未登録
2 導入承認の確認 承認申請書、検証報告書 承認済み。ただし公平性の検討記録なし
3 独立検証の確認 第2線の検証報告書 検証範囲は精度のみ。データの代表性の検討が不足
4 運用モニタリングの確認 月次性能レポート 2026年4月以降、再現率が許容値を下回るが対応記録なし
5 変更管理の確認 再学習の履歴、承認記録 再学習2回のうち1回が事後承認
6 人による確認の実効性 審査記録のサンプル25件 モデル結果の変更は0件。確認が形式化している可能性

手続6は見落とされがちです。「最終判断は人が行う」と定めていても、実際にはモデルの結果をそのまま承認しているだけであれば、人による確認はリスクの軽減策として機能していません。人がモデルの結果を修正した件数や理由を確かめることで、その実効性を評価できます。

指摘事項のまとめ方

AIモデルの監査で見つかった問題は、個々のモデルの技術的な欠陥としてではなく、管理の仕組みの問題として報告すると経営層に伝わりやすくなります。たとえば手続4の結果は、「モデルの再現率が低下している」ではなく、「しきい値割れ時の対応責任者と手順が定められていないため、性能低下が放置されている」と原因まで掘り下げて記載します。発見事項の書き方は内部監査報告書の書き方で解説しています。

よくある失敗と対策

失敗1:技術的な精度検証に踏み込みすぎる

内部監査部門がモデルのコードやパラメータの妥当性を自ら検証しようとして、工数が膨らみ結論が出ないケースがあります。内部監査の役割は、第1線・第2線の管理が有効に機能しているかの評価です。技術的な検証が必要な場合は、外部専門家の活用を検討します。

失敗2:インベントリーの外を見ていない

IT部門が管理するモデルだけを監査対象とし、業務部門が使うSaaSのAI機能や表計算上のモデルを見落とすことがあります。網羅性の確認を最初の手続として位置づけ、購買や契約の記録と突き合わせることで防げます。

失敗3:導入時の検証で安心する

導入時の検証報告書が立派だと、それだけで有効と判断しがちです。AIモデルの性能は時間とともに変化するため、運用中のモニタリングの記録を必ず確認します。モニタリングの仕組みがない場合、それ自体が重要な発見事項になります。

失敗4:公平性を「問題なし」と一言で済ませる

公平性の検討記録がないまま、担当者の「差別的な使い方はしていない」という説明で終えるケースがあります。公平性は意図ではなく結果で評価するものです。どの属性で、どの指標を、どの許容差で確かめたかの記録を求めます。

よくある質問

データサイエンスの知識がなくてもAIモデルを監査できますか?

できる部分は多くあります。インベントリーの網羅性、承認の有無、モニタリングの実施、しきい値割れの対応、変更管理は、記録と質問で確かめられます。性能指標の選び方の妥当性など専門的な判断が必要な点は、第2線の検証結果を利用したり、外部専門家の協力を得たりする方法があります。

外部のAIサービスを使っているだけでも監査の対象になりますか?

対象になります。モデルの内部は確かめられなくても、どの業務判断に使っているか、出力をどう確認しているか、入力する情報の範囲、提供者との契約条件、提供者のモデル変更への対応は、自社の管理の問題です。金融庁の原則でも、ベンダー・モデルへの統制が独立した原則として示されています。

どのくらいの頻度で監査すべきですか?

リスク格付に応じて決めるのが一般的です。高リスクのモデルは毎年、それ以外は数年に一度といった形で、年間監査計画に組み込みます。モデルの大幅な変更や新規導入のタイミングで、個別にテーマ監査を行うことも有効です。

生成AIの「精度」はどう評価すればよいですか?

生成AIは出力が文章であるため、正解率のような単一の指標で測りにくい特徴があります。用途ごとに評価用の質問と期待する回答の例を用意し、定期的に出力を確かめる方法や、出力を人がレビューした結果を記録する方法があります。監査では、こうした評価の仕組みが用途のリスクに見合っているかを確かめます。

ISO/IEC 42001の認証を取得していれば内部監査は不要ですか?

不要にはなりません。認証は、AIマネジメントシステムが規格の要求事項に適合していることを審査機関が確認したものです。個々のモデルが自社の用途に照らして適切に管理されているか、経営が定めたリスク許容度に沿っているかは、別途確かめる必要があります。認証審査で作成された記録や内部監査の結果は、監査の資料として有効に活用できます。

まとめ

AIモデルの監査で問うべきことは、突き詰めれば「何のために、どのデータで、誰が承認して使い、いまも意図どおり動いていると誰がどう確かめているか」の4点です。精度・公平性・説明可能性は、どれか一つを最大にすればよいものではなく、用途に応じたバランスを組織として判断し、承認し、見直し続けているかが問われます。

次の一歩として、社内でAIが業務判断に使われている場面を洗い出し、モデル・インベントリーの原案を作ってみてください。生成AIを監査業務そのものに活かす方法は生成AIで内部監査はどう変わる?で紹介しています。

AIガバナンスやモデル・リスク管理の監査についてのご相談は、お問い合わせからお寄せください。

参考資料

内部監査の情報サイトから、実務の基盤へ。

信頼できるナレッジと実務ツールで、内部監査の価値をさらに高めます。