EvoQuest

AIの基礎・活用

AIの「精度95%」は何を表している?

「精度95%」という数字だけでは、そのAIが自社の仕事に役立つかは分かりません。何を正解として数えたか、どのデータで試したか、何と比べたかで、同じ数字の意味が大きく変わるからです。数字を聞いたら、測り方を4つ確かめます。

この記事でわかること

  • 「精度」は一つの決まった数字ではありません。分類するAIなら正解率・見逃しの少なさ・誤報の少なさ、数を予測するAIなら誤差の大きさなど、測り方がいくつもあります。
  • 不良品が1,000個に10個しかない検品では、「全部良品」と答えるだけで正解率は99%になります。見つけたいものがまれな仕事では、正解率より「見つけたい物のうち何個見つけたか」を聞きます。
  • 学習に使ったデータで測った数字は、実際より良く出ます。学習に使っていない、できれば学習より後の期間のデータで試した数字かを確かめます。
  • 前週の同じ曜日の数をそのまま使う、のような簡単な方法と比べてどれだけ良いかも聞きます。最後は、外れたときに業務でどれだけ困るかで判断します。

「精度」は、測り方を決めて初めて数字になる

AIの性能を表す数字は、AIの種類と測り方で変わります。不良品かどうか、問い合わせの種類はどれか、のように答えを分類するAIなのか、明日の来客数や注文数のように数を予測するAIなのかで、使う物差しが違います。

分類するAIでよく使われるのは、全体のうち正しく答えた割合を示す正解率です。ほかに、見つけたいものをどれだけ取りこぼさなかったか、「見つけた」と言ったものがどれだけ本当に当たっていたか、という見方もあります。機械学習の道具として広く使われるscikit-learnの公式資料でも、これらは別々の指標として説明されています。

数を予測するAIでは、予測と実績の差を平均した「誤差」で表すことが多く、個数で示す方法と、実績に対する割合で示す方法があります。提案書の「精度95%」がどれを指しているかは、書いた人に聞かないと分かりません。

正解率が高いのに、役に立たない場合がある

次の数字は説明のための計算例です。検品で1,000個のうち不良品が10個ある場合、AIが何も見ずに「全部良品」と答えても、正解は990個で正解率は99%になります。それでいて、不良品は1個も見つけていません。

scikit-learnの資料は、データのいちばん多い答えを常に返すだけの比較用の仕組みを用意し、本物のAIと並べて確かめる方法を紹介しています。資料の例でも、片方の答えが多いデータでは、何も学ばない仕組みが6割近い正解率を出しています。答えの片寄りがあると、正解率は見た目だけ高くなります。

不良品、解約しそうなお客さん、不正な請求など、見つけたいものがまれな仕事では、正解率の数字だけで判断しないでください。

見逃しと誤報は、分けて聞く

見つけたいものがまれなときは、二つの割合を分けて聞きます。一つは、見つけたいもののうち何個を見つけたか(再現率)。もう一つは、AIが「見つけた」と言ったもののうち、本当に当たっていたのは何個か(適合率)です。

先の検品の計算例で、AIが20個を「不良品」と判定し、そのうち8個が本当の不良品だったとします。不良品10個のうち8個を見つけたので、見つけた割合は80%です。一方、判定した20個のうち当たりは8個なので、当たった割合は40%で、残りの12個は良品を人が確かめ直すことになります。

二つの割合は、片方を上げるともう片方が下がりやすい関係にあります。見逃しと誤報のどちらがより困るかは仕事によって違うので、先に決めておきます。考え方は「いつもと違う」に気づくAIとは?でも紹介しています。

見逃しが困る仕事

不良品がお客さんに届く、設備の故障に気づくのが遅れる、など。誤報が多少増えても、人が確かめる手間で済むなら、見逃しを減らす側に寄せます。

誤報が困る仕事

確かめる人手が足りない、知らせが多すぎて誰も見なくなる、など。1日に何件まで確かめられるかを決め、その件数に収まる基準を選びます。

予測の誤差は、割合と個数の両方で見る

数を予測するAIでは、予測と実績の差を実績で割った割合の平均(平均絶対誤差率)がよく使われます。割合なので、売れる数が違う商品どうしでも比べやすいのが利点です。

ただし、売れる数が少ない日や商品では割合が大きく振れます。計算例として、実績2個の日に4個と予測すると、差は2個でも誤差は100%です。実績が0個の日は割り算ができないため、計算の仕方によっては極端に大きな値になります。scikit-learnの資料も、実績が0のときに式が成り立たなくなるのを避ける処理を入れています。

そのため、割合だけでなく「1日あたり平均何個ずれたか」も聞きます。1日50個前後売れる商品で誤差10%なら、ずれはおよそ5個です。その5個が廃棄になったときと品切れになったときに、それぞれいくら困るかに置き換えると、業務で使えるかを判断しやすくなります。予測を幅で持つ考え方は発注は多めにするか少なめにするかで説明しています。

数字を見せられたら、聞いておきたい4つのこと

AIの提案や製品の説明で性能の数字が出てきたら、次の4つを聞いてみてください。専門の知識がなくても聞ける質問です。答えがはっきりしない場合は、数字をそのまま比べないほうが安全です。

何を正解として数えたか

正解率なのか、見逃しの少なさなのか、予測の誤差なのか。分類なら見逃しと誤報の両方、予測なら割合と個数の両方を出してもらいます。

学習に使っていないデータで測ったか

scikit-learnの資料は、学習に使ったデータでそのまま試すことを方法上の誤りとし、見たことのある答えを繰り返すだけで満点が取れてしまうと説明しています。日付のあるデータなら、学習に使った期間より後の期間で試した数字かも聞きます。

予測する時点で手に入らない情報を使っていないか

翌日の来客数の予測に、翌日になって分かる実際の天気や、当日になって確定する予約数を使えば、試験の数字は良く出ても実際には使えません。scikit-learnの資料はこれをデータ漏えい(リーケージ)と呼び、性能を楽観的に見積もる原因として挙げています。

簡単な方法と比べてどれだけ良いか

「前週の同じ曜日と同じ数」「過去4週の平均」「いつも一番多い答え」のような方法でも、ある程度の数字は出ます。AIの数字は、それらと同じデータで比べてどれだけ良いかで見ます。

最後は、自社の記録で試して決める

他社の事例や製品の説明にある数字は、その会社のデータで測ったものです。売れ方や不良の出方が違えば、同じAIでも数字は変わります。導入を決める前に、自社の過去の記録の一部を使って、学習に使っていない期間で試すのが確実です。

試した結果は、精度の数字だけでなく、外れた日に何が起きたかと一緒に見ます。外れた日の理由を残しておくと、AIを改善する材料にも、人が判断を足す場面を決める材料にもなります。記録の残し方は仕込み量が外れた日に何を記録するかで紹介しています。

文章を作る生成AIの場合は、公開されている性能の点数より、自社でよく受ける質問を用意し(当社の目安は10件ほどです)、答えが正しいかを人が確かめるほうが実情に合います。間違えやすい質問の傾向は生成AIの答えが間違っているのはなぜ?で整理しています。

この記事を書いた人

立石伊吹代表取締役 / DX・AIアドバイザー

北海道札幌市を拠点に、業務アプリやAIの開発を行っています。北海道内は直接うかがい、道外はオンラインで対応しています。専門用語を使わず、相手の言葉で話すことを大事にしています。

提案された数字の意味を、一緒に確かめます。

他社の見積もりや製品の説明にある精度の数字が、自社の仕事に当てはまるか分からない段階でも相談できます。データの提出は要りません。どんな判断にAIを使いたいかを伺い、見逃しと誤報のどちらが困るか、何と比べて試すかを一緒に整理します。

AIで何ができるか相談する (新しいタブで開きます)

メールでのお問い合わせ:info@evoquest.jp 解説記事一覧へ戻る

EvoQuest

AI相談窓口

EvoQuestについて、
気になることを聞いてください。

サービスの内容や制作実績、
費用の目安などをご案内します。

AIが回答します。個人情報・機密情報は入力しないでください。入力内容は回答のためにAI提供元へ送信されます。利用について(新しいタブ)

直接お問い合わせ

会話はこのタブに一時保存されます。