生成 AI を使った仕事を評価する【人事評価4シート】  

生成 AI を使った仕事を評価する【人事評価4シート】  

知識共有と予防の貢献を見える形にする4つの評価シート

チームを支える部下の貢献を、見落としていませんか。

ミスを未然に防いだ。

ノウハウを共有し、周囲の手間を減らした。

生成AIの出力を確かめ、現場で使える手順に仕上げた。
こうした働きを、日常業務の一部だから、AIで作ったものだからと、評価からこぼしていないでしょうか。

会社に必要な仕事こそ、きちんと評価したい。そのために、知識創造・知識共有・組織の安全に関する研究をもとに、見えにくい貢献を具体的な事実で確かめる4つの評価シートを紹介します。

この記事で参照する主な研究

  • 北村(2014):日常の仕事を支えるSafety-IIの考え方
  • 後藤・高橋・瀬上(2009):内部競争と知識共有の評価制度
  • 野中(1993):知識創造を支える人事と組織のあり方
  • 守島(2002):知的創造における評価とリスク分散
  • Bock et al.(2005):知識共有の意図と報酬・組織風土
  • Brynjolfsson et al.(2025):生成AIの支援と職場の生産性
  • Holmström & Milgrom(1991):複数の仕事と成果指標の偏り

Reader Reports

この記事を読んだ読者レポート

この記事で読者レポートを投稿

AIで仕事がしやすくなっても貢献の評価は自動では変わらない 

image 15

Brynjolfsson、Li、Raymond(2025)は、顧客対応の現場に生成AIの支援を導入した際の変化を分析しました。1時間当たりの問題解決件数は平均15%増え、経験や技能の少ない担当者ほど大きな改善が見られました。

この研究は単一企業の顧客対応業務を扱っています。あらゆる専門業務を誰でもできるようになったとまでは言えませんが、AIが経験の差を補う可能性を示しています。

たとえば、入社したばかりの社員が、過去の問い合わせをAIで整理し、説明が不足している箇所を見つけたとします。詳しい担当者に確認しながら案内を直し、部署全体で使えるようにした。このような仕事は、若手でも担える改善の一例として考えられます。

そこで人事評価の対象を資料の完成だけにすると、本人の貢献を捉えきれません。

確認した情報は正しかったのか。

例外に気づいて修正したのか。

実際に使う人と調整したのか。

こうした判断と働きかけまで見たいところです。

野中(1993)は、知識を生み出す力を高めるうえで、個人への人事・教育施策と組織設計を合わせて論じています。ミドルの役割も、情報整理だけでなく、現場と経営の考えをつなぎ、周囲を巻き込んで実現する働きとして捉えています。

AIが情報整理を助けるようになっても、知識を仕事に生かすための協力や役割分担は残ります。誰が資料を作れるかという変化と、その貢献を会社がどう受け止めるかは、合わせて考える必要があるのです。

なお、今回の研究だけで、現在の企業全般がAIを使った貢献を評価できていないと断定することはできません。以下では、自社の評価から抜け落ちている仕事がないかを考える手がかりとして整理します。

なぜ役に立つ仕事が評価から抜け落ちるのか

image 16

① 数えやすい仕事に努力が集まりやすい

HolmströmとMilgrom(1991)は、複数の仕事を担う人に対して、一部の測定可能な成果を強く報酬と結びつけると、ほかの仕事への努力が薄れる問題を理論的に分析しています。

身近な例で考えてみましょう。問い合わせへの回答件数を重く評価する職場で、担当者が案内文の改善に時間を使うと、その間は回答件数が減ります。改善がうまくいき、問い合わせ自体が減れば、今度は処理した件数では貢献を説明しにくくなります。

このような制度なら、原因を減らす仕事より、目の前の案件を処理する仕事が選ばれても不思議ではありません。

評価を見直す際には、本人が何件処理したかに加えて、同じ問題を繰り返さずに済むようにした仕事も、最初から期待する役割に含めたいところです。

② 知識を共有すると自分が不利になることがある

後藤・高橋・瀬上(2009)は、営業組織を想定したシミュレーションで、評価制度と知識共有の関係を分析しました。制度の有効性は、組織の状態や環境、指標の重みによって変わります。

ここから考えたいのは、同僚を助ける仕事と、個人の評価が矛盾していないかという点です。営業の説明方法を教えた結果、同僚が成果を上げても、教えた本人には何も残らない。個人順位だけで評価されるなら、共有に消極的になる理由が生まれます。

ただし、共有件数にポイントを付ければ十分とも限りません。Bockら(2005)の韓国27組織・管理職154人の質問票調査では、組織風土などと知識共有の意図との関連が示され、外的報酬への期待は共有への態度と負の関連を示しました。報酬の因果効果を実験した研究ではない点には注意が必要です。

本記事では、共有した量に加え、相手がどの場面で使えたかを確認する方法を提案します。成果を出した人と、その成果を支えた人の両方に、説明できる貢献を残すためです。

③ 挑戦した人だけが結果の不確実性を背負ってしまう

守島(2002)は、知的創造では努力と成果の関係が明確でないため、多面的で丁寧な評価が必要だと論じています。また、評価・処遇上のリスクが大きすぎると、創造への動機が損なわれる問題も指摘しています。

たとえば、AIで引き継ぎ資料を作る方法を試したところ、過去の記録に重要な例外が残っていないとわかった場合。完成しなかったという結果だけでは、試した人の仕事を判断できません。

確認不足のまま進めたのか。

それとも、記録の弱点を突き止め、今後残すべき情報まで整理したのか。

同じ未完成でも、次の仕事に残す価値は違います。

だからこそ、着手前に、何を確かめる試みなのか、どこまでを本人の役割とするのかを共有しておきます。その合意があれば、結果だけでなく、検証と判断の質を面談で確認できます。

④ 問題が起きなかった理由は結果だけではわからない

北村(2014)が紹介するSafety-IIは、日常の仕事を変化の中でもうまく機能させることに目を向けます。重視されるのは、対処、監視、予見、学習の4つの能力です。

たとえば、担当者が急に休んでも請求処理が止まらなかった場合。たまたま処理が少なかったのか、代行者が対応できる手順を整えていたのかで、状況は違います。何も起きなかったという結果だけでは、その違いを見分けられません。

そこで、予防の仕事では、どんな弱点を見つけ、どの備えを整え、それが動くことをどう確かめたかを残します。事故がなかったことに、根拠のない損失回避額を付ける必要はありません。

Safety-IIは個人の人事評価を直接検証した研究ではありませんが、予防の貢献を考える視点として応用できます。なお、日常の点検を確実に行う仕事と、新たな弱点を見つけて仕組みを変える仕事は、区別して記録すると説明しやすくなります。

実務ではどう評価するか 4段階と4枚のシート

では、ここまでの研究を、実際の評価にどう生かせるでしょうか。

知識共有の研究からは、資料を作った件数だけでなく、誰の仕事にどう役立ったかを確かめる視点が得られます。予防に関する研究からは、トラブルが起きなかったという結果に加え、異変に気づき、対応できる備えを見る視点が得られます。また、成果が不確実な仕事では、期待する役割を事前に合わせ、結果と本人の判断・行動を分けて振り返ることが考えられます。

こうした視点を評価に取り入れるには、面談の場で振り返るだけでなく、仕事を始める前から、何を期待し、どんな貢献を確かめるかを共有しておくことが大切です。

そこで本記事では、進め方を次の4段階に整理し、それぞれに使えるシートを作成しました。

  1. 会社が期待する貢献を、本人と先に合わせる。
  2. 本人が何を判断し、誰と進めたかを残す。
  3. 他者への効果や予防の備えを、証拠とともに確かめる。
  4. 結果と本人の貢献を分けて、評価と次の支援につなげる。

以下のシートは、研究を参考にした本記事独自の実務提案であり、効果が検証された評価尺度ではありません。

既存の評価を補うものとして、まずは一つの仕事を取り上げて使ってみてください
なお、具体例は説明のために作成したものです。

シートはこちら: 実務で使える4つの評価シート

シート1 期待する貢献の合意シート

最初に決めるのは、どのような働きかけを、その人の仕事として期待するかです。

項目記入内容
対象の仕事今回取り組む業務や改善
期待する変化誰の仕事をどのような状態にしたいか
本人に期待する役割整理、検証、共有、運用などの担当範囲
会社が用意する支援作業時間、情報、協力者、必要な権限
達成前でも確認する貢献検証で得た知見、弱点の発見、適切な中止判断など
確認時期と判断材料いつ、どの記録や状態をもとに話すか

特に大事なのは、本人に期待する役割と会社が用意する支援を、並べて書くことです。

たとえば、引き継ぎを改善してほしいと言いながら、通常業務を減らさず、経験者への確認時間も取らないままでは、本人の工夫だけで進めることになります。資料を整えるまでが役割なのか、代行者が実際に使えるところまでなのかも曖昧です。

本人は案内を整理する。経験者は例外を確認する。上司は試用する時間を確保する。ここまで分けると、面談で本人に何を求めるべきかが明確になります。

守島(2002)の評価上のリスクに関する議論を実務に移すなら、達成前でも確認する貢献の欄も欠かせません。結果が出なかったときに初めて、挑戦をどう評価するかを相談する状態を避けるためです。

シート2 本人の判断と協力の記録シート

次に、出来上がった成果物からは見えない、本人の働きかけを残します。AIを使った仕事にも、使っていない仕事にも使えます。

項目記入内容
実施したこと作った資料、変更した手順、行った検証
AIなどに任せた作業利用した支援とその範囲。使っていなければ記入不要
本人が確かめたこと出典、数字、例外条件、現場での使いやすさ
本人が変えた判断修正・採用・不採用の内容と理由
協力した人と役割情報提供、確認、試用、展開を担った人
記録の所在修正履歴、確認結果、成果物への参照先

ここで注目したいのは、本人が変えた判断です。

AIで案内文を作った、だけでは本人の仕事が伝わりません。AIの下書きに古い手順が含まれていたため、現行のルールと照合して修正した、と書けば、確認と判断が見えます。例外への対応が難しいと判断し、その部分は担当者への相談に戻したことも記録できます。

この欄は、AIを使った人に余計な説明責任を負わせるためのものではありません。成果物の見栄えや作成時間だけではわからない、品質を支える仕事を確認するための欄です。

また、協力した人の役割を残すことで、最終的に資料を提出した人だけに貢献が集まることを避けやすくなります。

シート3 活用と予防の確認シート

資料を作った後は、誰かが使えるようになったか、備えが機能するかを確認します。仕事に合う行だけを使ってください。

対象確認する問い証拠の例
知識共有誰がどの場面で使い、何ができるようになったか利用した資料、利用者の具体的な確認
予防の見通しどんな弱点や今後の変化に備えたか想定した条件、業務の弱点の記録
予防の監視問題の兆候に気づけるか検知条件、確認や点検の結果
予防の対応担当者不在や異常時に対応できるか代行や対応の試行結果
学習と改善確認でわかった弱点をどう直したか修正前後の記録

各項目には、未確認、利用・動作を確認済み、効果を確認済みのどこまで進んでいるかを添えます。さらに、残る課題と次回確認日を記入します。

この状態の区別が、シートの要点です。

マニュアルを共有フォルダに置いた段階では、利用は未確認。別の担当者が使って処理できたなら、利用・動作を確認済み。その後、十分な件数を見て手戻りの減少まで確かめたなら、効果を確認済みとします。変化を比較するときは、案件数や難しさなど、条件の違いも確認します。

まだ効果を確認できない仕事を、役に立っていないと決めつけずに済みます。一方で、置いただけの資料を、部署全体に効果が出た仕事として扱うことも防げます。

知識共有では使った相手の変化を、予防では備えの動作を確認する。この違いを残すことで、性質の違う仕事を無理に同じ件数で比べずに済みます。

シート4 評価と次の支援を決めるシート

最後に、ここまでの記録を面談での判断につなげます。

項目記入内容
事前に合意した期待シート1で決めた役割と確認事項
確認できた結果効果が出たことと、まだ確認できないこと
本人の貢献問題への気づき、確認、修正、共有、判断など
結果を左右した条件情報不足、協力者の不在、利用機会、担当案件の違い
評価とその理由期待に照らした判断と、根拠となる記録
次の支援と確認日必要な時間や協力、継続して観察すること
本人の補足事実の訂正、見落とされた貢献、認識の違い

大事なのは、確認できた結果と本人の貢献を分けて書くことです。

たとえば、引き継ぎ案の実務投入は見送ったものの、本人が記録にない例外を発見し、追加すべき情報を整理した場合、導入という目標は未達でも、事前に合意した検証を行い、次の判断に使える知見を残した貢献は検討できます。

反対に、導入できたとしても、確認を省き、誤った案内をそのまま展開していれば、完成した事実だけで高く評価するのは適切ではありません。

失敗したから一律に低評価、完成したから一律に高評価とするのではなく、期待した役割をどう果たしたかを確かめる。その判断を言葉で残すためのシートです。

シートはこちら: 実務で使える4つの評価シート

評価の事務作業と効果を見極める時間を分ける

ここまで読むと、丁寧に評価するほど時間がかかるのでは、と感じるかもしれません。確かに、毎回4枚の報告書を書き直すようでは負担が増えます。

そこで、シート1は着手時に合意し、シート2と3は既存の履歴を参照して必要な部分だけ更新します。面談では、それらをもとにシート4を使います。作業のたびに長い文章を残す必要はありません。

もう一つ分けたいのが、記録を整理する手間と、効果が現れるまでの時間です。前者はAIなどで短縮できても、後者まで必ず短くなるわけではありません。

公開したばかりの手順が役に立つかは、誰かが使って初めてわかることもあります。公開時点では内容の確認を評価し、利用後に効果を追加確認する。こうした運用なら、早く面談を終えることと、早すぎる結論を出さないことを両立させやすくなります。

シートを増やすだけで終わらせないための運用

4枚のシートは、記入の量や説明の上手さを競うためのものではありません。使い始めるときは、次の点を上司と本人で確認しておきます。

  • 職種や役割に応じて、何を期待するかを先に決める。
  • 共有件数やチェック項目数を、そのまま点数にしない。
  • 共同成果は、情報提供、検証、展開などの役割を分けて認める。
  • 同じ売上や削減効果を、組織の実績として重複集計しない。
  • AIや情報へのアクセス、協力を得られる機会の差も考慮する。
  • 評価者同士で具体例を見比べ、判断のずれを確認する。

まずは一つの部署で現行評価を補う形で試し、説明しやすくなった貢献と、記入の負担を確認する方法があります。処遇への反映方法は事前に明示し、後から基準を追加して過去の仕事を評価し直す運用は避けます。

次の面談で周囲の仕事を進めやすくした貢献を聞く

次の評価面談では、達成した目標に加えて、その人の工夫によって誰の仕事がどう進めやすくなったかを聞いてみてください。

そこに、別の担当者が使った手順や、問題の兆候を捉える仕組み、適切な判断につながった検証結果が出てくるかもしれません。

それを一度だけ褒めて終えるのではなく、次の期間にも期待する役割なのか、必要な時間や協力を用意するのかまで話し合う。そうすることで、見えにくい貢献を、会社として続けてほしい仕事として位置づけられます。

AIでできることが増えた今こそ、会社が必要とする貢献と、実際に評価している仕事が合っているかを確かめる機会です。

参考文献

– 北村正晴(2014)レジリエンスエンジニアリングが目指す安全Safety-IIとその実現法. 電子情報通信学会 基礎・境界ソサイエティ Fundamentals Review, 8巻2号, 84–95.

– 後藤裕介・高橋真吾・瀬上義人(2009)内部競争を考慮した知識共有のための評価制度分析. 経営情報学会誌, 18巻1号, 15–49.

– 野中郁次郎(1993)日本企業の知識生産性. 組織科学, 26巻4号, 56–63.

– 守島基博(2002)知的創造と人材マネジメント. 組織科学, 36巻1号, 41–50.

– Bock, G.-W., Zmud, R. W., Kim, Y.-G., and Lee, J.-N.(2005)Behavioral Intention Formation in Knowledge Sharing: Examining the Roles of Extrinsic Motivators, Social-Psychological Forces, and Organizational Climate. MIS Quarterly, 29巻1号, 87–111.

– Brynjolfsson, E., Li, D., and Raymond, L.(2025)Generative AI at Work. The Quarterly Journal of Economics, 140巻2号, 889–942.

– Holmström, B., and Milgrom, P.(1991)Multitask Principal–Agent Analyses: Incentive Contracts, Asset Ownership, and Job Design. Journal of Law, Economics, & Organization, 7巻特別号, 24–52.

コメントを残す