お問い合わせ
2026 / 09 / 02 更新 2026 / 09 / 04 ベストプラクティス

業務の成果を評価する仕組みに、AI利用を組み込むときの考え方

Lead

AIを使ったこと自体を評価項目に入れると、手段の目的化・出力の質の軽視・守秘義務手順の後退が構造的に起きます。評価対象を業務の成果に置き、業務ルールを先に整える設計の考え方を整理します。特定事務所の実測結果を報告する記事ではありません。

架空の設計例として、職員20名ほどの税理士事務所を想定します。ChatGPTを導入したものの、使う人と使わない人で差が広がり、所長が人事評価に「AI活用度」を5段階で入れようと考えている、という状況です。投資したツールが使われない状態が続くと、制度で動かしたくなるのは自然な発想です。

一方で、「AIを使ったかどうか」をそのまま評価軸に据えると、測っているものと業務の成果が一致しなくなります。本稿では、評価制度の中でAIの扱いをどう考えるかを、士業事務所の文脈で整理します。念頭に置くのは、人事制度に専門部署を置かない規模の事務所です。本記事は、複数の事務所で同じ結果を確認した事例報告ではなく、評価制度を設計するときの考え方を整理するものです。

「AIを使った回数」を評価軸にしたときに起きうること

評価項目にAI利用そのものを据えると、次の3つの問題が構造的に起きうります。

一つ目は、評価のために使うようになることです。手で書いたほうが早い業務や、経験者が頭の中で組み立てたほうが正確な業務にも、評価上のアリバイとしてプロンプトを投げる動機が生まれます。「使った報告」と業務での効き目がずれれば、評価データそのものが意思決定に使えなくなります。

二つ目は、出力の質を見る工程が後回しになることです。「使ったかどうか」を測る評価では、出力の中身までは見えません。判例引用が架空のものだった、通達番号が実在しなかった、といった場面でも、評価上は「ちゃんと使っている人」になります。士業の業務では、ここが署名・記名押印の責任に直結します (関連: 顧問先に出す書面の前に、もう一度確認しておくこと)。

三つ目は、守秘義務との関係が見えにくくなることです。顧客情報・案件情報を外部の生成AIサービスに入力する場面は、業法・契約・職業倫理がからむ場所です。個人情報保護委員会は2023年6月2日付「生成AIサービスの利用に関する注意喚起等」で、個人情報取扱事業者が個人情報を含むプロンプトを入力する場合は利用目的の達成に必要な範囲内であることを確認すること、提供事業者が個人データを機械学習に利用しないこと等を確認することを求めています (確認日: 2026-09-04。URLは記事末「参考」)。「AIを使った回数」が評価で先に立つと、入力してよい情報の範囲を確認する手順を飛ばす動機が生まれます。

評価の対象を「成果」に置く

評価の対象はAIではなく、業務の成果に置きます。AIを使ったかどうかは問わず、業務の出来栄えを見る形です。

成果を見る指標の設計例を、業務カテゴリごとに挙げます (数値はあくまで例で、事務所の規模・案件種別に合わせて決める領域です)。

カテゴリ指標の例測り方の例
時間1案件あたりの作業時間タイムシートの前後比較
品質差戻し率・チェック指摘件数内部レビューログ
顧客満足NPS・案件完了時アンケート四半期集計
ナレッジ蓄積共有ドキュメント・テンプレート更新件数社内ナレッジベースのログ

時間だけを強調しない設計にします。時間が短くなっても差戻しが増えれば、顧問先側の負担が増えます。時間と品質を同時に見る形にしておくと、「早くなったがミスが増えた」状態に気づけます。

業務改善の提案・ナレッジ共有・新しいやり方の検証は、行動を見る指標として置けます。AIを含めた工夫全般を扱えるので、AIを使わずに別のやり方で同じ成果を出した方も、同じ土俵で評価できます。

評価のタイミングを場面ごとに分ける

人事評価が年1回だけだと、AIのような変化の早い領域では見直しのサイクルが追いつきません。振り返りと評価を分ける設計例を示します。

週次や月次は、チーム内での振り返りの場です。何を試したか、どこが効いたか・効かなかったかを話す場で、人事評価とは切り離すことを明示します。失敗を共有しやすくするために、所長や役職者の方が自身の試行錯誤から話し始める形も取れます。

四半期は、成果指標 (時間・品質) の集計と振り返りに使います。改善が見えた領域は、他のチームへの横展開を検討します。

半期や年次は、人事評価の場です。成果指標の達成度を、AIを使ったかどうかにかかわらず判定します。

業務ルールを評価制度より先に置く

評価制度を回す前に、業務ルールの側を先に整えます。

顧客情報・案件情報を、どのAIサービスに、どの範囲で入力していいか。事務所として契約している法人プランの範囲内か、個人アカウントの利用は許可するか。出力結果を顧問先に出す前に、どの工程で確認するか。こういった内容を、業務マニュアルやAI利用ガイドラインの形で先に置いておくと、評価制度は「ルールの範囲内で出した成果」を見るだけで済みます。

評価制度の側では、業務ルールから外れた利用は、成果が出ていても評価の対象から外す、と決めておく形が取れます。インシデントの報告フローを別に用意し、報告した方を不利に扱わない方針を明示します。

評価制度は就業規則・労働契約と結びつくため、変更時は社労士の方や顧問弁護士の方のレビューを受ける領域です。

順序を決める

「AIを使った回数」を評価軸に据えると、手段の目的化・出力の質の軽視・守秘義務手順の後退という3つの問題が生まれます。評価の対象を業務の成果に置き、AIを使ったかどうかは問わない形にすれば、AIを使わずに同じ成果を出した方も同じ土俵で扱えます。

評価制度を動かす前に、業務ルールと、失敗を共有できる場を先に整えます。AIのモデルやサービスの条件は変わり続けるので、半年から1年の単位で評価軸を見直す前提でサイクルを設計します。

関連記事

参考

Author · 著者

士業AI