AWS、RAG 基盤構築ツール Amazon Bedrock Knowledge Bases を公開──保険金請求データに対する自然言語クエリと引用付き回答を実現
Amazon S3 内の PDF や Word などの非構造化保険書類を自動パースし、AgenticRetrieveStream API を用いて複雑な複数条件の照会と典拠の提示を両立させた。
リリース: 2026-09-30 · 読了 3 分記事の要約
1. 核心(What)
- Amazon Bedrock Knowledge Bases を用いて、保険金請求関連の PDF、Word、テキスト文書を Amazon S3 から自動インデックス化する手法を解説
- AgenticRetrieveStream API により、自然言語での質問分解、複数回の検索パス実行、対話履歴の保持を実現
- メタデータファイル(.metadata.json)を併用することで、請求 ID や金額、日付に基づく高度なフィルタリング検索をサポート
- Amazon Bedrock Guardrails と連携し、取得されたソース文書に裏付けられた回答のみをストリーミング出力するグラウンディング機構を搭載
2. 影響(Why)
- 検索精度の向上と実装コストの圧縮: 非構造化データとメタデータの紐付けやエージェント型の検索プランニングを自前で実装する必要がなくなるため、高精度な業務特化型 RAG の開発工数を数分の一に圧縮できる。
- 国内エンタープライズの業務システムへの直結: 監査やコンプライアンス対応が不可欠な国内の金融・保険業のシステム開発において、全回答にソース引用を付与できる設計は、実運用の最大の障壁をクリアする。
3. 根拠・詳細(How)
- AgenticRetrieveStream API によるエージェント型検索: 質問を受け取った基盤モデルが自動でサブクエリを生成し、十分な証拠が集まるまで maxAgentIteration の制限内で繰り返し検索パスを実行する構成。
- マネージド型ベクトルストレージと同期パイプライン: knowledgeBaseConfiguration の type および embeddingModelType に MANAGED を指定し、AWS 側で埋め込みモデルとベクトルストアの管理・暗号化を統合処理する。
- サイドカファイルによるメタデータフィルタリング: 10 KB 制限の JSON ファイルをドキュメントと同一バケットに配置し、日付を YYYYMMDD 形式の整数で保持することで数値範囲フィルタリングを効率化する。
4. 展望・課題(Next)
- 本番運用に向けた検証と制約事項: 本チュートリアルは合成データを用いた検証用のため、実データを扱う際は PII(個人特定情報)の適切な管理やマルチリージョン展開時の対応モデルの制約を確認する必要がある。