結論: 同じ入力から同じ結果を出す必要がある計算は、検証可能なルールやコードで処理します。生成AIは文章候補の作成に限定し、法的・専門的な判断は有資格者が行います。
本記事の以前の版には、「自社の36協定期限確認で残り61日と誤答した」「修正後は再発していない」「破産申立て・就業規則変更届を自社ツールで実装した」とする記述がありました。対応する実装・試験記録を確認できなかったため、これらは撤回します。
まず三つに分ける
| 種類 | 例 | 処理候補 |
|---|---|---|
| 決定的な計算・照合 | 日付差、入力必須項目、許可された値との一致 | ルール・コード |
| 文案作成 | 説明文、メール下書き、要約候補 | 生成AI + 人のレビュー |
| 専門判断 | 要件該当性、例外、依頼者への助言、最終提出 | 有資格者 |
日付や件数でも、起算点、休日、特例、行政解釈等に判断が必要な場合があります。「数式で表せる部分」と「前提を決める部分」を分けます。
生成AIを使わない候補
- 入力済みの開始日と終了日の単純な日数差
- 許可された選択肢との一致
- 定義済み書類リストとの照合
- 合計、件数、重複の検査
- 固定形式の識別子の構文検査
これらも、仕様とテストが正しい場合に限って期待どおり動きます。コードなら必ず正しいという意味ではありません。
生成AIを使う場合の検査
文章候補を生成する場合は、少なくとも次を確認します。
- 参照してよい資料だけを使っているか
- 固有名詞、日付、金額、条文番号を原典で確認したか
- 他案件の情報が混ざっていないか
- 禁止情報を入力・出力していないか
- 出力を採用・修正・不採用にした人を記録したか
定型検査を通過しても内容の正しさは保証されません。想定外の誤りを人が確認できるよう、AI出力は候補として扱います。
架空データで比較する
同じ業務について、次の三構成を比較します。
- ルール・コードだけ
- 生成AIだけ
- ルール・コードで計算し、生成AIは説明文だけ
正答率、再現性、レビュー時間、外部送信する情報、費用、障害時の追跡可能性を測ります。どの構成が優れるかは業務ごとに判断します。
チェックリスト
- 計算・生成・判断を分けた
- 計算の前提と例外を専門家が確認した
- コードの境界値と異常系を試験した
- AIへ渡す情報を必要最小限にした
- AI出力の確認項目と最終判断者を決めた
- 実装済み・検証済みと書く場合は記録を保存した
本記事は一般的なシステム設計の情報であり、個別法令の要件該当性や特定機能の安全性を保証するものではありません。