DATA MANAGEMENT
AIのための非構造化データ管理 パート2:AIの成長に耐えうるストレージインフラストラクチャ
非構造化データを大規模に管理するには、適切なストレージアーキテクチャが必要です。このシリーズのパート1では、従来のストレージアーキテクチャは最新のAIワークロードが求める規模、経済性、またはデータアクセスの要求に合わせて構築されたことはないという主張を展開しました。そのアーキテクチャ上のギャップは現実のものであり、多くの組織においてその溝は広がり続けています。
そこで生じる次の疑問は、この課題に対してどう対処するかということです。
この記事では、従来のアプローチに代わる次世代のアーキテクチャについて解説します。具体的には、クラウドデータレイクとは何か、それがどのように構成されているか、そしてAIワークロードの増加に伴ってシステムが耐えうるかどうかを決定する重要な設計上の決定事項について説明します。適切なデータ基盤がどのようなものか、実装がどこで失敗しやすいか、そしてAIの取り組みを本格的に拡大する前にインフラストラクチャが何をサポートする必要があるかについて、明確な全体像を提供します。
クラウドデータレイクは実際に何をするのか?
クラウドデータレイクは、クラウドシステム、エッジデバイス、SaaSプラットフォーム、オンプレミスインフラストラクチャなど、組織全体の生データを一元化し、それらが必要になるまでネイティブフォーマットのまま安全に保存します。そこから分析エンジン、AIパイプライン、コンプライアンスツールが、事前にデータを別の場所へ移動したりフォーマットを変換したりすることなく、オンデマンドで直接アクセスできます。
その革新的なモデルは、連携して機能する3つのアーキテクチャコンポーネントに依存しています。
生データと処理済みデータのための一元化されたクラウドオブジェクトストレージ: 構造化データと非構造化データを元の形式のまま保持するための、非常にスケーラブルで耐久性の高い基盤を提供します。メタデータ管理、カタログ作成、データガバナンス、およびセキュリティの各種サービスがその上に配置され、保存されたデータが見つけやすく、保護され、信頼できる状態を維持します。
ストレージとコンピュートの分離: インジェストパイプラインがデータをデータレイクに継続的に供給する一方で、独立した処理およびコンピュートエンジンが分析やAIモデルのトレーニングのためにデータを変換、クエリ、準備します。各レイヤーはワークロードの需要に基づいて完全に独自の条件で拡張されます。
ツールやチームをまたいだAPI主導のアクセス: 標準化されたAPIと統合されたアクセスレイヤーにより、高度な分析プラットフォーム、ビジネスインテリジェンスツール、AIや機械学習システムが共有データに安全にアクセスできるようになり、巨大なデータセットを複製したり移動したりすることなくシームレスなコラボレーションをサポートします。
これらのコンポーネントが組み合わさることで、分散した生データが組織で実際に価値を生み出すための実用的なアセットへと変わります。
なぜオブジェクトストレージが適切な基盤なのか?
クラウドオブジェクトストレージは、多様なデータタイプに対して無制限でコスト効率が高く、卓越した耐久性のあるストレージ環境を提供するため、非構造化データ管理にとって理想的なソリューションです。メタデータが豊富で階層を持たないフラットなアーキテクチャにより、大規模なデータ構成、高速な検索、APIアクセスが容易になり、AI、ビッグデータ分析、機械学習のワークロードを強力にサポートします。
データ不変性、バージョニング、APIのアクセシビリティなどの機能により、データ量の爆発的な増加に伴う堅牢なガバナンス、法的なコンプライアンス、および将来の要件に対する適応性が確保されます。
クラウドオブジェクトストレージのアーキテクチャ上の利点
クラウドオブジェクトストレージにより、組織は非構造化データを実用的なビジネスの洞察に変えることができ、効率的なデータ管理、迅速なアクセス、AI対応のワークフローを実現できます。その主な利点は次のとおりです。
S3 APIアクセス: クラウドオブジェクトストレージは業界で広く採用されているS3 APIをサポートし、既存のツール、アプリケーション、AIや機械学習パイプラインとの幅広い互換性を提供します。これにより、シームレスな統合が保証されプラットフォーム間のデータアクセスが大幅に簡素化されます。
フラットな名前空間: オブジェクトは複雑な階層のないフラットな名前空間に保存されるため、従来のフォルダ構造の制約を受けることなく無制限のストレージ拡張と簡単な検索が可能になり、大規模なデータ構成とアクセスが簡素化されます。
圧倒的なスケーラビリティ: オブジェクトストレージは複雑な再構成を行うことなくエクサバイト単位のデータを処理できるため、組織はパフォーマンスやアーキテクチャの制限を受けることなく、必要に応じて非構造化データのリポジトリを無限に拡張できます。
メタデータ主導の管理: 各オブジェクトには豊富なメタデータ情報が含まれており、高度な検索、自動化されたデータ分類、ガバナンス、およびAIや機械学習ワークフローのサポートが可能になります。メタデータは厳格なデータベーススキーマに依存することなく、データのコンテキストと洞察を提供します。
高い耐久性: 組み込みの冗長性と高度な消去コーディング技術により、ハードウェアの障害、データの破損、損失から大切な情報が保護され、非構造化データの安全性と可用性が長期にわたって確保されます。
クラウドオブジェクトストレージの経済的利点
アーキテクチャ上の利点にとどまらず、オブジェクトストレージは大規模なデータレイクの運用における経済性を根本から変革します。
大規模運用におけるTBあたりのコスト削減: 使用していない空き容量に高い費用を支払うことなく、大規模なデータセットを手頃な価格で保存できます。
オーバープロビジョニングの排除: 実際に使用したストレージの分だけ支払う従量課金制のため、高額な先行投資によるインフラストラクチャの構築を回避できます。
長期保存戦略のサポート: 過去の履歴データや規制要件に紐づく重要なデータを数年または数十年にわたって経済的に保存できます。
予測可能なコストモデル: 透明性の高い価格設定により、AIやデータを多用するワークロードに対する正確な予算編成を簡素化します。
予期せぬコストの回避: AIの価値を最大限に引き出すには膨大なストレージ容量が必要です。データレイクが拡張するにつれて、多くのクラウドプロバイダーにおいて高額で予期せぬアクセス料金が発生するのが一般的ですが、これらを回避します。
データレイクのスケーラビリティを左右する決定要因とは?
アーキテクチャの強さは、その背後にある設計上の決定事項の強さに完全に依存します。特に以下の4つの要素が、クラウドデータレイクがクリーンに拡張できるか、それともワークロードの増加に伴って管理が困難な負債になるかを決定します。
生の非構造化データの一元化
生の非構造化データを一元化することで、すべての情報が単一のリポジトリに安全に収集され、分析やAIワークフローのための信頼できる基盤が構築されます。
すべての非構造化データに対する単一の基盤は、唯一の信頼できる情報源を提供し、データへのアクセスを簡素化して組織全体の混乱やサイロ化を軽減します。データを一元化することで、組織はデータの一貫性を維持し、無駄な重複を減らし、下流の分析作業の効率を大幅に向上させることができます。
ストレージとコンピュートの分離
ストレージとコンピュートの分離は、最新のクラウドデータレイクの最も基本的な設計原則であり、システムにスケーラビリティ、柔軟性、および優れたコスト管理をもたらします。これにより以下が可能になります。
独立した拡張: ストレージとコンピュートのリソースを別々に拡張できるため、リソースの割り当てが常に最適化され、無駄なオーバープロビジョニングを防ぎます。
従量課金制による効率化: コンピュートリソースは処理が必要なときにのみプロビジョニングされるため、ITコストを制御し、実際のワークロードに合わせて支出を細かく調整できます。
幅広いワークロードのサポート: ストレージの効率やパフォーマンスに影響を与えることなく、複数の分析ツールやAIツールが同じ基盤データに同時にアクセスできます。
ストレージとコンピュートを分離するということは、データが永続的でスケーラブルなストレージ層に配置される一方で、処理エンジンは個別に、かつ必要なときにのみプロビジョニングされることを意味します。
ライフサイクルと保持の自動化
データのライフサイクルと保持を自動化することで、コンプライアンスポリシーに従って情報の移動、アーカイブ、または確実な削除が行われ、手作業による労力とコンプライアンス違反のリスクが大幅に軽減されます。
ポリシー主導のライフサイクル自動化により、データが適切なストレージ層またはアーカイブ間で自動的に移動され、コストとパフォーマンスが常に最適化されます。また保持、削除、コンプライアンス、ガバナンスのポリシーを厳格に適用して、データを整理し、コンプライアンスを遵守し、長期にわたってコスト効率を維持します。
ライフサイクルの自動化とは、データをいつアーカイブし、保持し、または削除するかといったポリシールールを一度定義し、時間の経過とともにストレージプラットフォームがそれらのルールを自動的に適用できるようにすることです。
AIデータの成長を見据えた計画
AIワークロードは決して静的なものではありません。トレーニングデータセットは絶えず拡大し、検索拡張生成のRAGリポジトリは知識の蓄積に伴って飛躍的に大きくなり、モデルの出力データは時間とともに増大します。最初からその現実を見据えて設計することで、ワークロードが増加するたびに破壊的なアーキテクチャの再設計を行うことなく、データレイクがその成長をスムーズに吸収することができます。
AIワークロードに求められるインフラ要件とは?
Gartner社は、「2026年までに、AI対応のデータに支えられていないAIプロジェクトの60%を組織が放棄する」と予測しています。
真にAI対応のインフラストラクチャは、単に非構造化データを保存するだけではありません。生のコンテンツをAIトレーニング、推論、継続的なモデルの改善にすぐ使えるように、整理し、強化し、管理し、そしてセキュアに公開します。AIワークロードに不可欠な機能は次のとおりです。
メタデータの強化: 情報のソース、作成時間、エンティティ、機密性などのコンテキストを自動的に追加して、データを迅速に検索可能にし、AIに対応させます。
自動分類: AIを活用した高度なタグ付けを利用して、ガバナンス、コンプライアンス、およびトレーニングデータセットのためにコンテンツを適切に整理します。
統合されたスケーラブルなストレージ: オブジェクトストレージまたはクラウドデータレイクにデータを一元化して、部門間のサイロを排除し、将来の成長を確実にサポートします。
検索とインデックス作成: 大規模なアーカイブ、マルチメディアファイル、ログデータ全体にわたって、関連するデータセットを迅速に発見できるようにします。
ガバナンスとライフサイクル制御: 厳格なアクセスポリシー、保持ルール、およびデータの不変性を適用して、生データを保護し長期間保存します。
APIベースのアクセス: 最新のAIフレームワーク、データパイプライン、モデルトレーニング環境とのシームレスで高速な統合を確保します。
AIトレーニングのサポートと微調整
高忠実度の生のデータセットを一元化されたスケーラブルなストレージに保持することで、長期的な再利用が可能になります。データスナップショットとメタデータを使用してデータセットのバージョンを正確に追跡し、トレーニングサイクル全体で再現性、監査可能性、および一貫したモデルパフォーマンスを確保します。
元のコンテキストと詳細な情報を保持するために、生のデータセットをそのままの状態で、一元化された大規模にスケーラブルなオブジェクトストレージに長期保存する計画を立てる必要があります。長期保存により、データセットを新しいAIモデルに再利用したり、改良されたアルゴリズムを用いて再処理したり、あるいは現時点ではまだ定義されていない将来のユースケースに活用したりすることが可能になります。
また、バージョニングとモデルの再現性もサポートする必要があります。スナップショット、メタデータの詳細な追跡、およびデータセットのバージョン管理を使用して、トレーニングデータが時間の経過とともにどのように進化するかを文書化します。この徹底した追跡により、チームはモデルの結果を再現し、トレーニングの入力を正確に監査し、イテレーション間でパフォーマンスを比較し、AI開発サイクル全体を通じて一貫性とコンプライアンスを維持することができます。
RAGおよび生成AIナレッジベースのサポート
ソースコンテンツのための安全でスケーラブルなストレージを維持し、インデックスとデータの埋め込みを継続的に更新します。この厳密なキュレーションにより、ナレッジベースが常に最新の状態に保たれ、検索しやすく、RAGや生成AIのタスクにすぐに対応できる準備が整います。
ソースコンテンツのための安全でスケーラブルなストレージの維持: ドキュメント、トランスクリプト、画像、ログ、その他の非構造化ソース素材を、数十億のオブジェクトまでシームレスに拡張可能な、一元化された耐久性の高いオブジェクトストレージに保存します。
暗号化、アクセス制御、ガバナンスポリシーの適用: 機密コンテンツを強力に保護しながら、権限を持つユーザーやAIがいつでも簡単にアクセスできるようにします。
継続的なインデックス作成と埋め込み更新の実現: ナレッジベースの進化に合わせて、新規または更新されたコンテンツを継続的にインデックス化し、埋め込みを再生成する自動パイプラインをサポートします。これらの自動更新により、AIシステムが常に最新のデータと整合していることが保証されます。
モデルチェックポイントとアーティファクトのサポート
高い回復力を持つストレージを使用して、反復的なトレーニングサイクル全体でモデルのチェックポイント、出力データ、およびアーティファクトを保存します。このインフラストラクチャレベルのサポートにより、実験の再現、システム障害からの確実な復旧、AIパイプラインの信頼性と再現性の維持が確実になります。
ガバナンスとセキュリティ制御は組織の成長に対応できるか?
増え続ける非構造化データ全体で強力なセキュリティと規制コンプライアンスを確保するには、分析とAIの取り組みを強力にサポートしながら機密情報を保護する、慎重かつ包括的なガバナンスフレームワークが必要です。以下のコアとなるセキュリティ制御に焦点を当てます。
強力な暗号化と詳細なアクセス: ネットワーク転送中およびストレージ保存中のデータを強力に暗号化し、役割ベースまたはポリシーベースのアクセス制御を厳格に適用します。
不変性とランサムウェア対策: 不変のストレージポリシーを使用して、不正な変更や削除を完全に防止し、巧妙化するランサムウェア、内部の脅威、偶発的なデータ損失から企業資産を保護します。
監査可能性とコンプライアンス: 詳細な監査ログを維持してすべてのデータアクセスとアクティビティを追跡し、規制コンプライアンス要件、インシデント調査、社内の厳格なガバナンス要件をサポートします。
データ主権の考慮事項: 国の法律、業界基準、および契約上のデータ保存の規制を満たすために、承認された特定の地理的地域でデータが確実に保存および管理されていることを確認します。
どのような間違いがアーキテクチャの負債を生み出すのか?
非構造化データ管理において発生する最も一般的なエラーは、共通の根本原因があります。それは、ある決定が時間の経過とともにどのようにシステム全体に悪影響を及ぼすかを無視して、目の前の短期的な問題に対して最適化してしまうことです。これらには以下のものが含まれます。
非構造化データをアーカイブ専用データとして扱うこと: 高度な分析、AIトレーニング、再処理、および将来の革新的なユースケースのためにデータを保存するのではなく、純粋に保持要件を満たすためだけにデータをしまい込むこと。
AI主導のデータの成長を過小評価すること: AIワークフローによって生成される膨大な生データ、モデルの出力、運用ログ、派生データセットの急速な増加に対応するための事前の拡張計画を怠ること。
ライフサイクルコストよりも短期的なコストの最適化を優先すること: 長期的なスケーラビリティ、将来発生するアクセス料金、クラウド間のデータの移動、運用のオーバーヘッドを総合的に考慮せず、先行投資の価格のみに基づいてストレージソリューションを選択すること。
多すぎるプラットフォーム間でのデータの断片化を許容すること: 孤立した複数のシステム間にデータを分散させると、全体的なガバナンス、データ検索、システム統合、そしてAIからのアクセスがより複雑になり、莫大な追加コストがかかります。
これらの設計上の落とし穴を初期段階で回避する組織こそが、長期的なAIおよび分析のイニシアチブを推進する準備が整っていると言えます。
AIの成長に耐えうるストレージインフラの構築とは?
非構造化データ管理は、単なるIT部門の関心事から、企業のAIと分析戦略を左右するコア要素へと移行しました。これを適切に管理している組織は、ワークロードが進化しAIの取り組みが拡大する中で、データに常にアクセス可能であり、厳格に管理され、ビジネスですぐに使える状態を保つ強固なインフラストラクチャを構築しています。
現在行われているストレージプラットフォームに関する技術的な決定が、そのAIの可能性のどれだけを実現できるかを左右します。インフラストラクチャに何が必要かという問いに対する答えは、システム規模を犠牲にすることなくコストを制御し、予測可能な経済性と高いAIへの対応力が決してトレードオフにならないストレージアーキテクチャです。
WasabiがAIワークフローをどのようにサポートするかをご覧ください
Wasabi Hot Cloud Storageは、予測可能なシンプルな価格設定と予期せぬアクセス料金なしで、初期の生データの取り込みから完成したモデルの長期保存に至るまで、企業のAIパイプラインを止めることなく動かし続けるように構築されています。
AI時代に不可欠な「非構造化データ」を活用するための、クラウド型データレイクの基本から構築ステップまでを徹底解説。AIモデルの学習・推論を加速させ、次世代のビジネス成長を支えるデータ基盤の作り方がわかります。
AI対応のオブジェクトストレージは、アクセス、ガバナンス、レジリエンス、そして予測可能なコストから始まります。この10問のスコアカードを活用して自社のS3環境を評価し、課題を特定して、AIワークロードが拡大する前に対処すべき優先事項を把握しましょう。
AI対応のオブジェクトストレージは、アクセス、ガバナンス、レジリエンス、そして予測可能なコストから始まります。この10問のスコアカードを活用して自社のS3環境を評価し、課題を特定して、AIワークロードが拡大する前に対処すべき優先事項を把握しましょう。
&w=1920&q=75)