ハルシネーション(幻覚)は,生成AI が事実と異なる内容や存在しない情報を,もっともらしい文章で出力する現象です。 その対策として広く使われているのが RAG(Retrieval-Augmented Generation:検索拡張生成)で, 質問に関係する文書を検索し,その内容を根拠として AI に与えてから回答を作らせます。
シラバスでの扱い
ハルシネーションは,IPA が 2023年12月25日に公開した応用情報技術者試験シラバス Ver.7.0 で, 「大分類8:経営戦略」の「AI」の項目の「AIを利活用する上での留意事項」に加わりました(その前の Ver.6.3 にはありません)。 そこでは,ハルシネーションなどの出力のリスクと,AI の出力を人間が確認することの重要性が並べて書かれています。 この改訂は,ペーパー方式では令和6年度秋期試験から適用されています。
RAG は,最新の応用情報技術者試験シラバス Ver.7.2(2026年1月8日公開)の用語例にもまだありません。 ただし用語例は出題の範囲を限るものではなく,ゼロトラストやパスキーのように,用語例に無いまま出題された語もあります。 当サイトが収録している過去問(令和7年度秋期まで)では,どちらの語もまだ出題されていません。
出典:IPA「情報処理技術者試験及び情報処理安全確保支援士試験における出題範囲・シラバスの一部改訂について」, 応用情報技術者試験 シラバス Ver.7.0, IPA「試験要綱・シラバスについて」(いずれも2026年10月3日に確認)
なぜハルシネーションが起きるのか
大規模言語モデル(LLM)は,事実を調べて答えているのではなく, 学習した文章の傾向から「次に続きそうな語」を予測して文章を作っています。 そのため,知らないことを聞かれても「分からない」とは限らず,それらしい文章を作ってしまいます。
- 実在しない論文・判例・URL を,それらしい題名付きで挙げる
- 数値や日付,人名をもっともらしく取り違える
- 学習した時点より後の出来事を,古い情報のまま答える
文章が自然で自信ありげなので,誤りに気づきにくいのが厄介なところです。 シラバスが「出力を人間が確認することの重要性」をあわせて挙げているのはこのためです。
RAG(検索拡張生成)の仕組み
- 検索:質問に関係する文書(社内規程,製品マニュアルなど)を,あらかじめ用意した文書の集まりから探す。 意味の近さで探せるよう,文章を数値の並び(ベクトル)に変えて保存しておく方法がよく使われる
- 拡張:見つかった文書の内容を,質問と一緒に LLM への指示に入れる
- 生成:LLM は与えられた文書を根拠に回答を作る。根拠にした文書を回答に添えれば,人が確かめやすくなる
| RAG | ファインチューニング | |
|---|---|---|
| 知識の与え方 | 回答のたびに,検索した文書を指示に入れる | 追加の学習で,モデルの中身(パラメータ)を変える |
| 情報の更新 | 文書を差し替えればすぐ反映できる | 学習し直しが要る |
| 根拠の示しやすさ | どの文書を使ったかを示せる | 示しにくい |
RAG は万能ではありません。検索で的外れな文書が見つかれば,回答も外れますし,文書そのものが古い・誤っていれば誤りを広めます。 また,検索の対象にその利用者が見てはいけない文書が混ざっていると,回答を通じて漏れてしまうので,文書ごとのアクセス権を検索にも反映させる必要があります。 外部の Web ページなどを検索の対象にすると,そこに仕込まれた指示に従ってしまうプロンプトインジェクションの入り口にもなります。
試験での問われ方(予想)
- 現象の名前を選ぶ:ハルシネーションを,過学習(訓練データに合わせすぎて未知のデータで精度が落ちる)や, 学習データの偏りによるバイアス,敵対的サンプルと見分ける形
- 対策を選ぶ:RAG の仕組みや,「出力を人が確認する」運用。ファインチューニングとの違い
- 午後の事例:社内向けの問合せ対応に生成AI を導入する事例で,回答の根拠の示し方,誤った回答への備え,参照する文書のアクセス権を問う
近い論点で出題された過去問
生成AI の出力の扱いや,AI の学習データの扱いを問う問題です。
- 午前Ⅰ(高度試験 共通) 令和7年度 春期 問30著作権法及び関連法令によれば,生成 AI を利用して画像を生成する行為又はその生成物の利用が著作…
- ITストラテジスト 午前Ⅱ 令和6年度 春期 問22公衆への提供などが行われた他人の著作物を AI の学習データとして利用する行為に関して,著作権法…
予想問題(オリジナル)
当サイトが作ったオリジナルの問題です。IPA の過去問ではありません。ほかの用語の予想問題の一覧
問1生成AI の利用で注意すべきハルシネーションの説明として,適切なものはどれか。
- ア学習に用いたデータに過剰に適合し,学習に用いていない未知のデータに対する予測の精度が下がる。
- イ学習に用いたデータの偏りによって,特定の属性をもつ人に不利な判断を出力する。
- ウ事実と異なる内容や実在しない情報を,もっともらしい文章として出力する。
- エ人間には知覚できない微小なノイズを加えた入力によって,誤った認識結果を出力する。
正解と解説
正解:ウ
生成AI は「もっともらしい続き」を作るので,誤りや実在しない情報も自然な文章で出力することがあります。出力を人が確かめることが欠かせません。
- ア:過学習の説明です。
- イ:学習データの偏りによるバイアスの説明です。公平性の問題として扱われます。
- エ:敵対的サンプル(Adversarial Examples)による攻撃です(SC 午前Ⅱ 令和6年度秋期 問2 で出題)。
問2社内規程に関する質問に答えるチャットボットを,LLM を使って構築する。RAG(検索拡張生成)を用いる場合の仕組みとして,適切なものはどれか。
- ア質問に関係する社内規程の文書を検索し,見つかった内容を質問と一緒に LLM に与えて,それを根拠に回答を生成させる。
- イ社内規程の文書をすべて追加の学習データとして LLM を再学習させ,規程が改定されるたびに学習をやり直す。
- ウLLM が生成した回答を,同じ LLM にもう一度入力して要約させ,回答の文字数を減らしてから利用者に返す。
- エ利用者の質問の文から社内規程の条文番号を取り出し,その条文番号に対応する定型の回答を返す。
正解と解説
正解:ア
RAG は,回答のたびに関係する文書を検索して LLM に与えます。規程が改定されても,検索の対象の文書を差し替えればすぐ反映できます。
- イ:ファインチューニングの説明です。改定のたびに学習し直す手間がかかります。
- ウ:要約しても,元の回答に含まれる誤りは取り除けません。
- エ:規則に基づく定型の応答で,LLM による生成でも RAG でもありません。