Retrieval-Augmented Generation
RAG
RAGとは、LLMが持つ知識の限界を補うために、外部のデータベースや文書から関連情報を検索し、その情報をプロンプトに加えてLLMに回答させる技術です。LLMのパラメータを更新せずに最新情報や社内固有の知識に対応できるため、ファインチューニングより低コストで企業活用が可能です。
ベクトルデータベース(Pinecone・pgvector・Qdrantなど)に文書をエンベディングとして格納し、ユーザーのクエリに近い文書を検索してLLMへ渡す構成が一般的です。AIインフラとしてはエンベディングモデルの推論用GPUと検索基盤の両方が必要になります。




