EvoQuest

AIの基礎・活用

社内の資料をもとに答えるAIとは?RAGの仕組み

社内のマニュアルや規程をもとに答えるAIは、多くの場合RAG(検索拡張生成)という方法で作ります。質問に関係する文章を先に検索し、見つかった文章を生成AIに渡して答えを書かせます。AIに資料を覚えさせ直す方法とは別物で、資料を差し替えれば答えの元も新しくなります。

この記事でわかること

  • 生成AIは、学習した文章に無いことを聞かれると、事実と違う答えをもっともらしく返すことがあります。社内の規程や商品の細かい条件は、その代表です。
  • RAG(検索拡張生成)は、文章検索で関連する文章を取り出し、それを生成AIへの指示の文章に入れて答えさせる方法です(デジタル庁のガイドブックの説明)。
  • 間違いが起きる場所は2つあります。質問に合う資料を探し損ねる場合と、見つけた資料に書かれていないことを答える場合です。
  • 向いているのは、文章で書かれた規程・手順書・よくある質問など。図や写真だけの資料や、古い版が混ざった資料は、先に整える必要があります。
  • 試す前に、よく聞かれる質問と、その答えが載っている資料の場所を書き出しておくと、使えるかどうかを1問ずつ確かめられます。

生成AIは、会社の中のことを知らない

ChatGPTのような生成AIは、大量の文章で前もって学習しています。自社の就業規則、商品の細かい仕様、取引先ごとの約束事のように外に公開していない情報は、ふつうその中に含まれていません。

デジタル庁の「テキスト生成AI利活用におけるリスクへの対策ガイドブック(アルファ版)」は、学習データに無い情報を聞くと、根拠のない事実と異なる答えを返すことがあると説明し、デジタル庁AI班の職員数を聞く場合を例に挙げています。学習データに情報があったとしても、確実に知識として学習できるとは限らないとも書いています。

そのため「有給休暇は何日前までに申請する?」と生成AIにそのまま聞いても、自社の規則どおりの答えは期待できません。答えの元になる社内の資料を、質問のたびに一緒に渡す仕組みが必要になります。

RAGは「探す」と「まとめる」の2段階で答える

RAGは日本語で検索拡張生成と呼ばれます。デジタル庁のガイドブックは、文章検索で関連文章を抽出し、それを大規模言語モデル(ChatGPTなどの中心にある仕組み)にプロンプト(指示の文章)として渡す手法と説明しています。

1. 探す

質問を受けたら、あらかじめ登録しておいた社内の資料の中から、関係がありそうな文章をいくつか取り出します。ここは、これまでの文書検索と同じ役割です。

2. まとめる

取り出した文章と質問を合わせて生成AIに渡し、渡した文章をもとに答えるよう指示します。答えと一緒に、元にした資料名や見出しを表示する作りにもできます。

就業規則とよくある質問を登録した場合

次は当社が想定した例で、導入事例ではありません。就業規則のファイルと、総務によく届く質問とその答えの一覧を登録したとします。

「有給休暇は何日前までに申請する?」と聞かれると、まず検索で就業規則の休暇の条文が取り出されます。生成AIはその条文をもとに答えを書き、どの条文を使ったかを添えます。

規則が改定されたら、ファイルを新しい版に差し替えます。次の質問からは新しい条文が検索の対象になり、生成AIを学習し直す作業はありません。

「AIに覚えさせる」方法との違い

大規模言語モデルは、大量の文章による事前学習のあと、特定の作業向けに追加で学習させる事後学習(ファインチューニング)で調整することもできます。社内の資料を使うと聞いて、こちらを思い浮かべる人も多いはずです。

デジタル庁のガイドブックは、以前はこの事後学習でさまざまな作業に対応させる手法が主流だったものの、大規模言語モデルではプロンプトによる指示を変えるだけで対応できるようになったと説明しています。RAGはこの性質を使い、モデルそのものは学習し直さずに、質問のたびに資料を指示の中へ入れます。

規程や価格表のように内容が変わる資料は、差し替えるだけで答えの元を新しくできます。取り出した文章を記録しておけば、どの資料をもとに答えたかをあとから確かめられる点も、社内で使ううえで扱いやすいところです。

間違いは「探す」と「まとめる」のどちらでも起きる

RAGにしても、答えが必ず正しくなるわけではありません。デジタル庁のガイドブックは、RAGを使うシステムを確かめるときの観点として、次のようなものを挙げています。

探す段階

質問に対して、想定していた関連文章をきちんと取り出せているか。取り出した文章に、関係のないものが混ざっていないか。

まとめる段階

答えに出てくる固有名詞が、取り出した文章の中にあるか。答えの内容が、取り出した文章で触れられているものか。

答え全体

質問した人にとって分かりやすいか。箇条書きや文字数など、決めた形式で出ているか。

向いている資料と、先に整える資料

ここからは、当社が考える目安です。答えが資料のどこかに文章で書いてあるかどうかが、分かれ目になります。

向いている資料

文章で書かれた就業規則や社内規程、作業手順書、よくある質問とその答え、商品やサービスの説明書。聞かれた内容の答えが、資料の中に文章で書いてあるものです。

図や写真が中心の資料

検索は文字で行うため、図や写真だけで説明している内容は見つかりにくくなります。デジタル庁のガイドブックも、図表や写真を検索の対象にするために、文章での説明を加える工程を挙げており、画像を扱える大規模言語モデルでその説明を作る方法を紹介しています。

古い版が残っている資料

改定前と改定後の規程が両方登録されていると、古い条文が取り出されることがあります。登録する前に、いま使っている版だけにそろえておきます。

答えが資料に無い質問

来週の発注量や、その場の状況で決める判断は、資料を探しても答えが見つかりません。過去の記録から数量を出す仕組みとの違いは機械学習と生成AIは何が違う?で説明しています。

試す前に、質問と答えの場所を書き出す

社内の資料で答えるAIが役に立つかは、実際に聞かれる質問で確かめます。新しく入った人からよく聞かれる質問を20問ほど書き出し、それぞれの答えが載っている資料の名前と、ページや見出しを横にメモしてください。

このメモがあれば、AIが正しい資料を取り出したか、資料に無いことを答えていないかを1問ずつ照らし合わせられます。デジタル庁のガイドブックも、正しい知識が反映されているかを確かめる方法として、選択問題を用意して回答させるやり方を挙げています。答えが載った資料が見つからない質問が多いなら、先に資料を書き足すほうが効果があります。

お客さんの名前や連絡先を含む資料を登録する場合は、使うサービスが入力内容をどう扱うかを先に確かめます。生成AIに入れる情報の注意点は賃貸仲介の反響対応にAIはどこまで使えるかでも取り上げています。

この記事を書いた人

立石伊吹代表取締役 / DX・AIアドバイザー

北海道札幌市を拠点に、業務アプリやAIの開発を行っています。北海道内は直接うかがい、道外はオンラインで対応しています。専門用語を使わず、相手の言葉で話すことを大事にしています。

社内の資料で答えるAIが合うか、一緒に確かめます。

マニュアルや規程はあるものの、どこから手をつければいいか分からない段階でも相談できます。資料の提出や決まった仕様は要りません。よく聞かれる質問と資料の置き場所を伺いながら、AIに答えさせられる質問と、先に資料を整えたほうがいい部分を分けて考えます。

AIで何ができるか相談する (新しいタブで開きます)

メールでのお問い合わせ:info@evoquest.jp 解説記事一覧へ戻る

EvoQuest

AI相談窓口

EvoQuestについて、
気になることを聞いてください。

サービスの内容や制作実績、
費用の目安などをご案内します。

AIが回答します。個人情報・機密情報は入力しないでください。入力内容は回答のためにAI提供元へ送信されます。利用について(新しいタブ)

直接お問い合わせ

会話はこのタブに一時保存されます。