コース一覧
RAG入門:AIに知識を与える技術
LLMのハルシネーション問題とRAGによる解決策

RAG入門:AIに知識を与える技術

Embedding、ベクトル検索、チャンク分割、再ランキングなど、生成 AI に自社データや最新情報を読み込ませる RAG (Retrieval-Augmented Generation) の仕組みを、図解とハンズオンで学べる無料コースです。生成 AI の基礎を理解しているエンジニアや、AI プロダクト企画担当を対象としています。約 5 時間 (1 日 30 分 × 10 日) で 18 レッスンを修了でき、修了後は社内ドキュメント検索や FAQ ボットなど RAG アプリの設計を自分で進められるようになります。

1
第1章:RAGの基本概念と全体像
0. RAGとは?LLMに外部知識を与える検索拡張生成の仕組み5分
1. LLMのハルシネーション問題とRAGによる解決策5分
2. RAGの全体像:Indexing, Retrieval, Generationの3ステップ5分
3. RAGのユースケース:チャットボット、社内検索、文書要約5分
4. 第1章まとめクイズ5分
2
第2章:RAGのコア技術 - ベクトル検索の仕組み
0. チャンキングとは?テキストを効果的に分割する方法5分
1. 埋め込み(Embedding)とは?テキストをベクトル化する仕組み5分
2. ベクトル検索とは?意味の近さで情報を探し出す技術5分
3. 代表的なベクトルデータベース:Pinecone, ChromaDB, Weaviateなど5分
4. 第2章まとめクイズ5分
3
第3章:RAGの精度を高める実践テクニック
0. RAG精度改善(1):チャンキング戦略の見直し5分
1. RAG精度改善(2):高度な検索手法(HyDE, Reranking)5分
2. RAG精度改善(3):プロンプトエンジニアリングの勘所5分
3. 第3章まとめクイズ5分
4
第4章:RAGの実装と運用
0. ハンズオン:LangChainで基本的なRAGを実装する5分
1. RAGを業務利用する際の注意点:セキュリティ、コスト、精度管理5分
2. RAGの評価と継続的な改善サイクル5分
3. 第4章まとめクイズ5分

RAG入門:AIに知識を与える技術

01RAGとは?LLMに外部知識を与える検索拡張生成の仕組み
02LLMのハルシネーション問題とRAGによる解決策
03RAGの全体像:Indexing, Retrieval, Generationの3ステップ
04RAGのユースケース:チャットボット、社内検索、文書要約
05第1章まとめクイズ
06チャンキングとは?テキストを効果的に分割する方法
07埋め込み(Embedding)とは?テキストをベクトル化する仕組み
08ベクトル検索とは?意味の近さで情報を探し出す技術
09代表的なベクトルデータベース:Pinecone, ChromaDB, Weaviateなど
10第2章まとめクイズ
11RAG精度改善(1):チャンキング戦略の見直し
12RAG精度改善(2):高度な検索手法(HyDE, Reranking)
13RAG精度改善(3):プロンプトエンジニアリングの勘所
14第3章まとめクイズ
15ハンズオン:LangChainで基本的なRAGを実装する
16RAGを業務利用する際の注意点:セキュリティ、コスト、精度管理
17RAGの評価と継続的な改善サイクル
18第4章まとめクイズ

RAG入門:AIに知識を与える技術

LLMのハルシネーション問題とRAGによる解決策

「知りません」と言えないから、嘘になる

LLM は、入力の続きとして確率の高い言葉を選び続けることで文章を作ります。この仕組みには「答えを持っていない」という状態がありません。手持ちの材料が薄くても、確率がいちばん高い候補は必ず 1 つ選ばれるので、出力は止まらずに文章として完成します。

だから、存在しない条文や、社内にない休暇制度を、通常どおりの口調で書いてきます。人間なら口ごもるはずの場面で口ごもらない。これがハルシネーションの正体です。

しかも、材料が薄いときほど、書かれる内容は「世間一般でよくある形」に寄ります。もっともらしいのは偶然ではなく、確率の高い言葉を選んだ結果そのものです。読んで違和感が無いのは当然で、だから読むだけでは見抜けません。

幻覚と訳されるので不具合のように聞こえますが、モデルの内部では異常は起きていません。正常に動いた結果として、根拠の無い文章が出てきます。だから、直し方も不具合の修正とは別の形になります。

賢いモデルに替えても止まらない

「もっと新しいモデルにすれば減るのでは」と考えたくなりますが、これは半分しか効きません。学習量を増やせば、一般知識の間違いは確かに減ります。しかし、そもそも学習データに入っていない情報は、量をいくら積んでも埋まりません。あなたの会社の福利厚生規定は、どのモデルの学習データにも入っていないからです。

プロンプトで「正確に答えて」「嘘をつかないで」と念を押す方法も、同じ理由で頭打ちになります。指示を足しても、モデルの中に無い事実が生まれるわけではありません。

原因がモデルの外にある以上、打ち手もモデルの外に置くしかない。RAG がその答えになるのは、この一点においてです。

答えの出所を、モデルの外に移す

RAG がやっているのは、回答の材料を「モデルの記憶」から「その場で渡した資料」に付け替えることです。これをグラウンディング(根拠付け)と呼びます。

たとえば「リフレッシュ休暇の申請条件は」という質問に対して、資料を渡さない LLM は「勤続 5 年以上で最大 5 日」といった、世間一般でありがちな条件を書いてきます。実際の規定が「勤続 3 年で連続 10 日」なら、これは全部間違いです。

資料を先に渡してから同じ質問をすると、回答は「福利厚生規定によると、対象は勤続 3 年以上の正社員」という形になります。参照した規定の名前まで一緒に出せるので、読み手はその 1 か所を開いて確かめられます。

ここが決定的な違いです。RAG を入れてもハルシネーションはゼロにはなりません。しかし、失敗の形が変わります。根拠の無い断定が返ってくる状態から、根拠が並んで返ってくる状態へ。答えが間違っていれば、示された資料と突き合わせた瞬間に分かります。気づけない嘘と、気づける嘘の差が、業務で使えるかどうかの差になります。

そのため RAG のプロンプトには、資料の中に答えが無いときは無いと答えるよう、はっきり書いておきます。この一文が無いと、資料を渡しているのに、足りない部分をモデルが今までどおり埋めてしまいます。渡すだけでは足りず、外を使わせない縛りまで含めて、はじめてグラウンディングが成立します。

「資料に記載がありませんでした」という返事は、一見すると役に立たない回答です。それでも、間違った断定よりはるかに扱いやすい。足りない資料を足せば済むと、その場で分かるからです。

このレッスンに出てくる用語

意味があいまいなまま進んだ語は、ここから読み直せます。

  • LLM大規模言語モデル。次の単語を確率で予測する
  • ハルシネーションAIがもっともらしい嘘を生成する現象
  • プロンプトAIに送る指示文。出力品質を決める入力
  • RAG検索結果を渡して LLM に答えさせる手法
生田 陸人
監修生田 陸人
ゆめさくエンジニア / 現役ソフトウェアエンジニア監修者プロフィールを見る →
編集 ゆめさく編集部·公開 2025/12/23·更新 2026/08/26

関連レッスン

  • RAGの全体像:Indexing, Retrieval, Generationの3ステップ

    RAG(検索拡張生成)の根幹を成す3つのプロセス「Indexing」「Retrieval」「Generation」を徹底解説。データの整理から検索、回答生成までの流れを図解を交えて理解し、精度の高いAIシステムを構築する基礎を学びます。

  • RAGのユースケース:チャットボット、社内検索、文書要約

    RAG(検索拡張生成)の具体的なユースケースとして、チャットボット、社内検索、文書要約の3つを詳しく解説します。ビジネス現場での活用イメージや、導入時の注意点、精度の高い回答を得るためのコツを学べるレッスンです。

  • 第1章まとめクイズ

    RAG の基本概念、ハルシネーション対策としての役割、3ステップの処理フローを振り返るまとめクイズです。

  • チャンキングとは?テキストを効果的に分割する方法

    RAG(検索拡張生成)の精度を左右する「チャンキング」の基本と実践手法を解説。テキストを効果的に分割するサイズ設定や、情報断絶を防ぐオーバーラップのコツ、データ形式別の戦略まで、図解を交えて専門家が詳しくレクチャーします。

分からないところは Tap (AI先生) に質問できます

24 時間いつでも、あなたのレベルに合わせて日本語で答えます。

復習ミニクイズ

自社の社内規定など、LLMが学習していない特定の情報を扱う際にRAG(検索拡張生成)を活用すべき理由として、最も適切なものはどれですか?