Skip to content

DATA MANAGEMENT

データ基盤の構築手順5ステップ!構成要素・費用・セキュリティ対策まで徹底解説

2026 August 21
Mayuko YoshitomeField Marketing Manager, Japan

データ基盤の構築とは、社内に散在するデータを収集・蓄積・加工し、分析に活用できる状態に整える仕組みづくりのことです。

この記事では、情報システム部門やインフラ担当者に向けて、データ基盤の構成要素と構築手順5ステップを整理します。あわせて、構築後に問題になりやすいストレージ費用の考え方や、ランサムウェア対策を含むバックアップ設計まで解説します。

クラウドストレージを運営する立場から、国内企業の導入事例も交えて紹介します。

記事のポイント:

  • データ基盤の定義と、データレイク・データウェアハウス・データマートの役割の違いがわかること

  • 目的設定から運用改善まで、5つのステップでデータ基盤を構築する方法

  • 下り転送料・APIリクエスト料を含めてストレージの総コストを比較すべき理由

  • 3-2-1ルールとObject Lockでランサムウェアに強いバックアップを設計する方法

 

データ基盤とは?構築前に押さえる基礎知識

データ基盤とは、社内外に散在するデータを収集・蓄積・加工し、分析や業務に活用できる状態で提供するシステムの土台です。構築を成功させるには、用語の整理と「なぜ自社に必要か」の明確化から始めます。

 

データ基盤の定義と役割

データ基盤の役割は、部門ごとにばらばらに保管されているデータを一元化し、誰もが同じデータを参照できる状態をつくることです。

基幹システム・販売管理・Webアクセスログなど、企業のデータは形式も保管場所も異なります。これらを集めて整え、経営判断や現場の分析に使える形で提供するのがデータ基盤です。

「必要になるたびに各部門へデータを依頼し、表計算ソフトで集計する」という運用は、データ量が増えるほど限界を迎えます。集計のたびに数字が食い違う、担当者しか手順がわからない、といった問題を仕組みで解決するのがデータ基盤の役割です。

データ基盤が整うと、次のような効果が期待できます。

  • 部門をまたいだデータの突き合わせが可能になり、意思決定が速くなる

  • 集計やレポート作成の手作業が減り、担当者の負荷が下がる

  • データの品質と管理ルールが統一され、ガバナンスが強化される

  • AI・機械学習など、新しいデータ活用の土台ができる

     

データレイク・データウェアハウス(DWH)・データマートの違い

データ基盤は、データの状態に応じて3つの層で構成されるのが一般的です。それぞれの役割を押さえておくと、設計段階の議論がかみ合いやすくなります。

データレイク・DWH・データマートの違い

データレイクにはAmazon S3やWasabiなどのオブジェクトストレージが、データウェアハウスにはGoogle BigQuery・Snowflake・Amazon Redshiftなどの製品がよく使われます。

3つの層を最初からすべてつくる必要はありません。自社の分析ニーズに応じて、必要な層から段階的に整備していきます。

 

データ基盤の構築が求められる背景


データ基盤が求められる背景には、企業が扱うデータ量の増加とクラウド活用の一般化があります。

総務省の「令和7年版情報通信白書」によると、クラウドサービスを利用する企業の割合は2024年時点で80.6%に達しています(出典:総務省 令和7年版情報通信白書)。利用理由では拡張性の高さに加え、「災害時のバックアップとして利用できるから」の伸びが目立ちます。

また、扱うデータの中身も変わりました。従来の売上・在庫といった構造化データに加え、IoTセンサーのログ、画像・映像、文書ファイルなどの非構造化データが増えています。生成AIの活用が広がり、これらの非構造化データも学習・参照の対象として価値を持つようになりました。

一方で、データが増え続けるなか、オンプレミスのストレージ増設には多額の投資が必要です。増え続けるデータを低コストで蓄積し、必要なときに取り出せる仕組みとして、クラウド型のデータ基盤を選ぶ企業が増えています。

 

データ基盤を構成する4つの機能

データ基盤は収集・蓄積・加工・活用の4つの機能で構成されます。この流れを理解しておくと、製品選定や要件定義で迷いにくくなります。

データ基盤を構成する4つの要素 

 

収集:各システムからデータを集める

収集は、基幹システムや業務アプリ、Webログなどからデータを取り込む機能です。ETL/ELTツール(Fivetran、troccoなど)やAPI連携を使い、定期的に自動で集める形が基本です。

収集設計のポイントは次のとおりです。

  • 取り込み頻度(日次・時間ごと・リアルタイム)を用途から逆算して決める

  • 元システムに負荷をかけない取得方法を選ぶ

  • 取り込みに失敗したときの再実行・通知の仕組みを用意する

たとえば月次の経営レポートが目的なら、日次バッチの取り込みで十分です。設備の異常検知のようにリアルタイム性が必要な用途だけ、ストリーミング処理を検討します。用途に対して過剰な頻度で集めると、構築・運用コストが不必要に増加します。

 

蓄積:データレイクとオブジェクトストレージ

蓄積は、集めたデータを保管する機能で、データ基盤の中核です。近年は、形式を問わず大量のデータを保存できるオブジェクトストレージをデータレイクとして使う構成が主流です。

オブジェクトストレージの事実上の標準はAmazon S3のAPIです。S3互換のストレージであれば、ETLツールや分析ツールの多くとそのまま連携できます。

また、蓄積層には高い耐久性が求められます。クラウドのオブジェクトストレージは冗長化を前提に設計されており、たとえばクラウドストレージのWasabiは、イレブンナイン(99.999999999%)のデータ耐久性を掲げています。

蓄積層は保存するデータ量が最も大きく、データ基盤の運用コストを左右します。ストレージの料金体系は、後述の「データ基盤の構築費用とストレージコストの考え方」で詳しく解説します。

 

加工:分析できる形にデータを整える

加工は、生データを分析に使える形に変換する機能です。表記ゆれの統一や重複の削除(クレンジング)、複数データの結合などを行います。

従来は取り込み前に加工するETL方式が主流でしたが、近年は生データをまず蓄積し、必要に応じて加工するELT方式も広がっています。ストレージが安価になり、「とりあえず全部ためておく」選択が現実的になったためです。

加工処理は一度つくって終わりではなく、データソースの追加や仕様変更のたびに再検討が発生します。処理内容を文書化し、属人化を防ぐことが運用のポイントです。

 

活用:BIツールやAIで価値に変える

活用は、整えたデータをBIツール(Tableau、Microsoft Power BI、Looker Studioなど)での可視化やAI・機械学習に使う機能です。経営ダッシュボード、需要予測、生成AIの参照データなど、用途は年々広がっています。

近年は、蓄積した社内文書やログを生成AIに参照させる使い方も広がっています。データ基盤が整っていれば、AI活用の際にデータを集め直す手間がかかりません。

活用の幅が広がるほど、蓄積したデータを何度も読み出すことになります。読み出しのたびに転送料が発生するストレージでは、活用が進むほど費用が膨らむ点に注意が必要です。

 

データ基盤の構築手順5ステップ

データ基盤の構築は、①目的の明確化、②体制づくり、③要件定義・設計、④構築・移行、⑤運用・改善の5ステップで進めます。技術選定より先に、目的と体制を固めることが成功の近道です。

 

ステップ1:目的とゴールを明確にする

最初に「データ基盤で何を実現したいか」を具体的に定義します。目的が曖昧なまま構築すると、使われない基盤になりがちです。

  • 悪い例:全社のデータを一元化する(手段が目的になっている)

  • 良い例:月次の経営会議資料の作成工数を月40時間から10時間に減らす

  • 良い例:在庫データと販売データを統合し、欠品による機会損失を減らす

目的が決まれば、必要なデータ・分析の頻度・利用者の範囲を逆算でき、過剰な投資を避けられます。

 

ステップ2:推進体制をつくる

データ基盤は情報システム部門だけではつくれません。データを持つ現場部門と、データを使う利用部門を巻き込んだ体制が必要です。

最低限、次の役割を決めておきます。

  • プロジェクトオーナー:目的と投資判断に責任を持つ(経営層が望ましい) 

  • データ基盤担当:設計・構築・運用を担う(情報システム部門や外部パートナー)

  • 各部門のデータ責任者:データの意味と品質に責任を持つ

社内に専門人材がいない場合は、初期の設計だけでも経験のある外部パートナーに相談すると、後工程の手戻りを減らせます。

 

ステップ3:要件定義とアーキテクチャ設計

目的と体制が固まったら、扱うデータの種類・量・増加ペースを洗い出し、基盤の構成を設計します。

設計で決める主な項目は次のとおりです。

  • 対象データソースと取り込み方法・頻度

  • 蓄積方式(データレイク・データウェアハウスの構成、クラウドかオンプレミスか)

  • データ量の見積もり(現在の総量と年間の増加率)

  • セキュリティ要件(アクセス権限、暗号化、バックアップ)

  • データの保管場所(国内リージョンの有無、災害対策としての拠点分散)

  • 予算(初期費用と月額のランニングコスト)

蓄積方式で迷いやすいのが、クラウドとオンプレミスの選択です。判断の観点を整理すると次のようになります。


クラウドとオンプレミスの選択

データの増加が読みにくい段階では、拡張が柔軟なクラウドを軸に検討するのが現実的です。クラウドを選ぶ場合は、ストレージの保存料金だけでなく、下り転送料やAPIリクエスト料を含めた総コストで比較することが重要です。

AI・機械学習まで活用範囲を広げる場合の設計判断(データレイクの構成、ストレージとコンピュートの分離、転送コストの考え方)は、白書「フィジカルAI時代のデータ戦略」で導入事例2社とともに詳しく解説しています(※白書公開後にダウンロードページへリンク)。

 

ステップ4:構築とデータ移行

設計に基づいてツールを導入し、データの取り込み・加工処理を実装します。最初から全データを対象にせず、優先度の高いデータソースから小さく始めるのが定石です。

既存システムからの移行では、移行中も業務を止めない計画が欠かせません。オンプレミスからクラウドストレージへ移す場合は、階層化ツールや移行サービスを使うと、業務を継続しながら段階的に移せます。

本格移行の前に、次の項目を小規模な検証で確認しておくと安全です。

  • 実データでの転送速度と、移行全体に必要な期間

  • 分析ツール・バックアップ製品からの接続と権限設定

  • 1か月運用した場合の実際の請求額

 

ステップ5:運用と改善を繰り返す

構築後は、利用状況とコストを定期的に確認し、改善を続けます。

  • 利用されていないデータ・レポートの棚卸し

  • データ量の増加に応じたコストの見直し

  • 新しいデータソースや分析ニーズへの対応

  • 障害・セキュリティインシデントを想定した復旧訓練

あわせて、ステップ1で定めた目的が達成できているかを数値で確認します。レポート作成工数の削減時間、基盤の利用者数、月額コストの推移などを定点観測すると、投資対効果を説明しやすくなります。

データ基盤はつくって終わりではなく、育てていくものです。運用の負荷とコストを抑えられる構成を最初に選んでおくと、改善に力を注げます。


 

 

データ基盤の構築費用とストレージコストの考え方

データ基盤の運用費用で見落とされやすいのが、保存料金以外にかかる下り転送料とAPIリクエスト料です。データを読み出すたびに課金される料金体系では、活用が進むほど費用を予測しにくくなります。

 

クラウドストレージの料金は3つの要素で決まる

一般的なクラウドストレージの請求は、次の3要素で構成されます。

  • 保存料金:保存しているデータ量に応じた月額

  • 下り転送料:クラウドの外へデータを転送した量に応じた従量課金

  • APIリクエスト料:データの読み書き操作の回数に応じた従量課金

データ基盤では、BIツールでの集計やAIの学習など、蓄積したデータを繰り返し読み出します。そのため、保存料金は安く見えても、転送とリクエストの従量課金で請求額が想定を超えるケースが少なくありません。

 
予算超過の典型例:

データレイクからBIツールへ毎日データを読み出す構成にしたところ、保存料金より下り転送料のほうが高くなり、月額予算を超過。読み出し回数を制限するという本末転倒な運用に陥りかねません。

 

Wasabiの単一料金プランとAWS S3との違い

クラウドストレージWasabi(Wasabi Hot Cloud Storage)は、保存データ量だけに課金する単一料金プランを採用しています。下り転送料とAPIリクエスト料は、合理的な利用の範囲で無料です(2026年7月時点)。

Wasabiの単一料金プランとAWS S3との違い

なお、各社の料金・仕様は変更される場合があります。契約前に必ず公式サイトで最新の条件を確認してください。

当社公式サイトでは、ハイパースケーラー比で最大80%低価格と紹介しています。読み出しの多いデータ基盤の蓄積層では、単一料金プランの効果が特に出やすくなります。

契約形態は、月ごとの従量課金制と、1年・3年・5年単位で容量を予約する容量予約制(RCS)の2種類です。データ量の増加ペースが読める場合は、容量予約制でさらに単価を下げられます。料金の詳細はWasabiの料金ページで確認できます。

保管場所も設計上の判断材料になります。当社は世界16のストレージリージョンを提供しており、日本国内には東京と大阪の2拠点があります。国内にデータを置きたい要件や、災害対策として拠点を分けたい場合にも対応できます。

ストレージコストを試算する際は、次の3つの数字をそろえるだけで比較できます。

  • 現在の総データ量と、年間の増加率

  • BIツールや分析処理が1か月に読み出すデータ量

  • バックアップ・リストア検証で発生する転送量

保存量だけに課金されるWasabiであれば、試算は「総データ量×単価」で完結します。読み出し量の見積もりが不要になるため、予算計画も立てやすくなります。

自社のワークロードでコストがどう変わるかを試したい場合は、30日間・1TBまでの無料トライアルで実際の環境を検証するのが近道です。データレイク・分析ソリューションのページでは、分析基盤での活用イメージも紹介されています。

 
データ基盤のセキュリティ・バックアップ設計

データ基盤のセキュリティ設計では、アクセス制御や暗号化に加えて、ランサムウェア対策としてのバックアップ設計が欠かせません。全社のデータを集約した基盤は、攻撃者にとっても価値の高い標的になるためです。

IPA(情報処理推進機構)の「情報セキュリティ10大脅威 2026」では、「ランサム攻撃による被害」が組織向け脅威の1位となっています。2016年の初選出以来11年連続でランクインしており、1位は2021年から6年連続です(出典:IPA 情報セキュリティ10大脅威 2026)。データを暗号化して身代金を要求する手口に加え、窃取した情報の公開で脅す二重恐喝も一般化しています。

前提となるアクセス制御・暗号化では、次の項目を設計に組み込みます。

  • IDおよびアクセス管理(IAM)で、利用者・システムごとに最小限の権限を付与する

  • 管理者アカウントには多要素認証(MFA)を必須にする

  • 保存時・転送時の暗号化を有効にする

  • アクセスログを取得し、不審な操作を検知できるようにする

 

3-2-1ルールでバックアップを設計する

バックアップ設計の基本は3-2-1ルールです。

  • データのコピーを3つ持つ(本番データ+バックアップ2つ)

  • 2種類の異なる媒体に保存する

  • 1つはオフサイト(遠隔地)に保管する

3-2-1ルール

オンプレミスのバックアップサーバーとクラウドストレージを組み合わせれば、「2種類の媒体」と「オフサイト保管」を同時に満たせます。テープ媒体の搬送・保管といった運用負荷をなくせるのも利点です。

  

Object Lockでバックアップを書き換え不能にする

近年のランサムウェアは、バックアップデータも暗号化・削除の標的にします。その対策として有効なのが、オブジェクトストレージのObject Lock(オブジェクトロック)機能です。

Object Lockを有効にすると、指定した期間はデータの上書きも削除もできない状態(イミュータブル)になります。管理者権限を奪われた場合でも、ロック期間中のバックアップは書き換えられません。

当社はObject Lockに標準で対応しており、Veeamをはじめとする主要なバックアップ製品との連携構成が用意されています。データ基盤の蓄積層とバックアップ先を同じS3互換ストレージでそろえると、運用もシンプルになります。

最後に、バックアップは「取得すること」ではなく「復旧できること」が目的です。リストア(復旧)の手順を文書化し、年に1回以上は実際に戻す訓練をしておくと、有事の対応時間を大きく短縮できます。

 

データ基盤の構築事例:Wasabi導入2社に学ぶ蓄積層の設計

データ基盤の蓄積層をどう設計するかは、実際の導入事例から学ぶのが近道です。ここでは、AIの学習データ基盤を構築した事例と、大規模なファイルサーバーを階層化した事例を取り上げます。

 

AIロボット協会:2.2PBの学習データハブを予算内で運用

一般社団法人AIロボット協会(AIRoA)は、ロボットの基盤モデル開発に使う実世界データを集約するデータハブを、Wasabi Hot Cloud Storage上に構築しています。データレイクを中核に据えたデータ基盤の実例です。

小売・製造・物流など複数の業界から集めたデータを一元化し、基盤モデルの開発やGPUクラスタへの学習データ供給に活用しています。

当社の導入事例資料(AIRoA協力)では、次の内容を紹介しています。

 

AIロボット協会の導入概要

  • 課題:数十TB規模のデータを継続的にアップロードする必要があり、非営利組織として変動費を避けたかった 

  • 構成:Wasabi Hot Cloud Storage をペタバイト規模のデータハブとして利用 

  • 効果:2026年3月時点で2.2PBを保管。他社比で1億円超のコスト削減を見込む

この事例が示すのは、読み出しの多いデータ基盤ほど料金体系の差が効くということです。AIの学習では同じデータを何度も読み出すため、転送のたびに課金される構成では将来コストの試算が難しくなります。詳細は当社公式サイトの導入事例(英語ページ)で確認できます。

 

東芝グループ:階層化でストレージコストを30%削減

東芝グループは、社員約10万人が使う1PB(ペタバイト)規模の全社ファイルサーバーで、NTTコミュニケーションズ提供の「ストレージ最適化ソリューション(Wasabi Tiering for NetApp)」を採用しました。2023年12月公開の当社プレスリリースによると、概要は次のとおりです。

 

東芝グループの導入概要

  • 課題:データ量が前年比10%で増加し、オンプレミスストレージの拡張に多額の投資が必要だった

  • 構成:NTTコミュニケーションズが提供するサービスで、NetAppの階層化機能によりアクセス頻度の低いデータを自動的にWasabiへ移動

  • 効果:ストレージ関連コストを30%削減。全データの85%をWasabiに格納

ポイントは、全データを一度にクラウドへ移すのではなく、アクセス頻度で自動的に振り分けたことです。頻繁に使うホットデータは高速なストレージに残し、大部分を占めるコールドデータを低コストなWasabiへ移しています。

データ基盤の蓄積層でも考え方は同じです。分析対象のホットデータと、保管が主目的のコールドデータを、同じ単価のストレージに置く必要はありません。詳細は当社の導入事例(東芝グループ)で確認できます。

 

データ基盤の構築でよくある質問

Q. データ基盤の構築にはどのくらいの期間がかかりますか?

A. 対象データの範囲によりますが、範囲を絞ったスモールスタートなら2〜3か月、全社規模では半年から1年以上が目安です。優先度の高いデータソースから段階的に広げる進め方にすると、期間とリスクを抑えられます。

Q. データ基盤の構築費用はどのくらいかかりますか?

A. 初期費用は、対象データの範囲とツール選定によって数十万円から数千万円まで幅があります。継続的にかかるのはストレージやツールの月額費用で、特にストレージはデータ量に比例して増え続けるため、保存単価と課金体系の確認が重要です。

Q. 構築は内製とベンダー委託のどちらがよいですか?

A. 社内にクラウドやデータエンジニアリングの経験者がいれば、内製も選択肢になります。いない場合は、設計と初期構築をベンダーやSIerに委託し、運用しながら社内へノウハウを移す方法が現実的です。

Q. データ量が少ない段階でもデータ基盤は必要ですか?

A. 大がかりな基盤は不要ですが、データの保管場所と管理ルールの統一は早めに始める価値があります。将来の移行コストを考えると、最初からS3互換のオブジェクトストレージに集約しておくと拡張が容易です。

Q. オンプレミスとクラウドのどちらで構築すべきですか?

A. データの増加が続く前提では、初期投資を抑えて容量を柔軟に増やせるクラウドが有利です。規制などでオンプレミスに残すデータがある場合は、階層化やバックアップだけにクラウドを使うハイブリッド構成も選べます。

Q. 既存のバックアップとデータ基盤は分けるべきですか?

A. 役割が異なるため設計上は分けますが、保存先は同じクラウドストレージに集約できます。S3互換ストレージなら、バックアップ製品と分析ツールの両方から同じストレージを利用でき、契約や運用の窓口を一本化できます。

ポイント:

期間・費用・体制の悩みは、多くの場合、最初から完璧な基盤を目指すことが原因です。優先度の高いデータから小さく始め、運用しながら広げる前提で計画すると、判断しやすくなります。

 

まとめ:データ基盤の構築を成功させるポイント

  • データ基盤とは、データを収集・蓄積・加工し、分析に活用できる状態で提供する仕組みである

  • 構築は目的の明確化、体制づくり、要件定義・設計、構築・移行、運用改善の5ステップで進める

  •  蓄積層のストレージは、保存料金だけでなく下り転送料・APIリクエスト料を含めた総コストで選ぶ

  • Wasabiは保存量だけに課金する単一料金プランで、読み出しの多いデータ基盤の蓄積層と相性がよい

  • ランサムウェア対策として、3-2-1ルールとObject Lockによる書き換え不能なバックアップを設計する

  •  AIロボット協会や東芝グループの事例のように、蓄積層は保存単価と読み出しコストの両面から選ぶ

このアプローチを採用する場合、標準的なSnowflakeとS3互換機能を用いて、以下のような手順でセットアップを進められます。

  1. 外部ステージを使用してストレージをSnowflakeに接続し、メタデータを更新する

  2. ガバナンス要件に応じて外部テーブルでオブジェクトをカタログ化する

  3. Document AIを使用してドキュメントを解析し、抽出されたコンテンツをJSON形式で保存する

  4. 解析されたテキストをチャンク単位に分割し、ベクトル対応テーブルに格納する

  5.  Cortex Searchを使用してチャンクデータをインデックス化し、ハイブリッド検索を可能にする

  6. SQL、Cortex関数、またはSnowpark APIを介してクエリを実行する

  7. エージェントやアプリケーションと統合し、自然言語によるアクセスやワークフロー連携を実現する

参考として、SQLの例を以下に示します:

CREATE OR REPLACE STAGE docs_stage

  URL = 's3compat://<wasabi-bucket-name>/'

  ENDPOINT = 's3.<region>.wasabisys.com'

  CREDENTIALS = (

    AWS_KEY_ID = '<AKIA...>'

    AWS_SECRET_KEY = '<SECRET>'

  );

 ALTER STAGE docs_stage REFRESH;

 CREATE OR REPLACE TABLE ai_ingest.raw_docs AS

SELECT PARSE_JSON(

         AI_PARSE_DOCUMENT(

           '@docs_stage',

           relative_path,

           OBJECT_CONSTRUCT('mode', 'LAYOUT', 'page_split', TRUE)

         )

       ) AS parsed

FROM DIRECTORY(@docs_stage)

WHERE relative_path ILIKE '%.pdf';

See the architecture in actionアーキテクチャの詳細を見る

WasabiとSnowflakeのソリューション概要では、統合アーキテクチャ、主なメリット、運用環境での活用方法についてご確認いただけます。

さらに詳しく
unstructured-data-management-for-ai-why-legacy-storage-falls-short
DATA MANAGEMENTAIのための非構造化データ管理 パート2:AIの成長に耐えうるストレージインフラストラクチャ

EDUCAUSE 2025:つながり、信頼、そして高等教育ITにおけるストレージの役割

EDUCAUSE 2025が示した高等教育ITの鍵は「つながり」。AI活用、クラウドコストの透明化、データ統合、セキュリティを支えるストレージ基盤の役割を、Wasabiの視点から解説します。予算縮小とAI時代に備える大学のためのインサイト。

CISOの役割とは?業務内容・必要スキルとデータ保護責任を徹底解説

CISO(最高情報セキュリティ責任者)の役割を徹底解説。主な業務内容や必要スキル、CIOとの違いに加え、外部の攻撃からも内部の事故からもデータを守り抜く保護・バックアップ責任まで、CISOが担うべき役割を網羅的に整理します。