業務向けLLMのデータセット設計
社内文書や業務フローに特化した大規模言語モデル(LLM)のファインチューニングでは、データの量だけでなく、質を確保することが重要です。
DigitalBaseが社内AI基盤の構築支援を通じて整理してきた知見をもとに、データ品質の判断基準、本番環境に合わせた設計、評価時の注意点を解説します。
高品質なファインチューニングデータセットに必要な4つの特性
高品質なデータセットは、多様性・正確性・関連性・清潔さの4軸で評価できます。
多様性については、タスクの種類(QA、要約、推論)、文体(フォーマル/カジュアル)、複雑さのレベル(単純な指示から多段階推論まで)を意図的に混合することが重要です。ただし、過度な多様性は学習を不安定にするため、本番環境で実際に遭遇するシナリオの代表的なサンプルに絞る必要があります。
正確性と一貫性については、すべてのサンプルが事実として正しく、内部的に矛盾がないことが求められます。ドメイン専門家による検証プロセスが必要です。
データの関連性とは、本番環境の入力形式と訓練データの形式が一致していることを意味します。また、出力の分布比率も重要です。例えば、訓練データの60%が「お答えできません」という回答である一方、本番では5%しか必要ない場合、モデルは過剰に拒否するようになります。
避けるべきデータセットの特徴と対策
データ汚染(test data contamination)は、評価の信頼性を損ないます。テストデータが訓練データに混入すると、ベンチマークスコアが人為的に高くなります。対策として、n-gramオーバーラップ除去に加え、パラフレーズ検出を含むセマンティック脱汚染が必要です。
過学習リスクへの対策には、早期停止(検証性能が低下した時点で学習を停止)や、ドロップアウト・重み減衰などの正則化があります。
破壊的忘却は、特定タスクにファインチューニングすると汎用能力が失われる現象です。EWC(Elastic Weight Consolidation)、リハーサル(元データセットのサンプルを定期的に提示)、PEFT使用(大部分のパラメータが凍結されるため)で軽減できます。
ファインチューニングがアライメントを損なうリスクも報告されています。良性のデータセットであってもアライメントを劣化させうる点に留意が必要です。
データセット設計チェックリスト
データ準備フェーズ
- タスク目標を明確に定義し、本番環境の入力形式を特定する
- ソースを特定する(ドメイン文書、タスクデモ、公開データセット、合成生成)
- PII除去、重複排除、ノイズフィルタリングのパイプラインを構築する
品質保証フェーズ
- 明確なアノテーションガイドラインを確立し、評価者間一致度を測定する
- ドメイン専門家による検証を実施する(特に専門分野)
- フォーマットの一貫性を確認する
- 応答タイプの分布が本番の期待分布と一致することを確認する
- テストデータ汚染チェックを実施する
継続的なデータ品質管理
人手作成・ネイティブ言語データを優先し、合成データは厳格な品質フィルタリングを経て使用します。
データ汚染チェック、out-of-distribution評価、汎用タスクでの破壊的忘却のモニタリングを継続することが重要です。
