DATA PROTECTION
AIパイプラインこそ、セキュリティ上の最大 の死角かもしれない
難しい部分は、すでに乗り越えています。自社ビジネスにおけるAIのユースケースを見極め、AIインフラを構築しました。モデルを丁寧に学習させ、ガードレールで守りもしました。あとは統合し、スケーリングし、成果を出していく段階です。
しかし、セキュリティ上の脅威は、見過ごされがちな場所に潜んでいるかもしれません。
AIの導入は、それを管理する能力を追い越してしまい、攻撃者はそこに目をつけています。Gartnerによれば、この1年でおよそ3社に1社が、すでに自社のAIインフラに対する攻撃を経験しています。
狙われているのは、モデルではない
AIセキュリティの議論の多くは、モデル層に始まりモデル層で終わります。モデルこそが顧客や従業員に向き合うリスクである以上、それは理にかなった考え方です。しかし、その下にあるデータパイプラインはより長く、より無防備で、同じレベルの精査を受けることはめったにありません。
生データが複数のソースから流れ込みます。ラベリング、クレンジング、特徴量のワークフローが、それを使える学習データへと整えます。GPUを大量に使う学習では、モデルの重み、チェックポイント、オプティマイザの状態、実験ログ、評価結果、そして来歴(リネージ)メタデータが生み出されます。デプロイと推論のシステムが、承認済みのモデル、アダプター、プロンプト、ポリシーを実際に動かします。そしてストレージインフラが、ソースデータや学習成果物から、推論ログ、監査証跡、ロールバック用のバージョン、イミュータブルな復旧用コピーに至るまで、AIデータのライフサイクル全体を統合して保持しています。
各段階には、それぞれ固有のアクセス要件、固有の受け渡し、そして固有の脆弱性があります。
攻撃者はモデルの裏をかく必要などありません。パイプラインのどこか1か所に足がかりを得れば、それで十分なのです。
データパイプラインが侵害されると何が起こるか
データパイプラインを悪用しようとする試みが増える中、パイプラインを狙う攻撃者が組織に何をなしうるのかを理解しておくことが重要です。
認証情報の侵害:攻撃者が管理者権限を取得し、学習データやモデルの重みを削除・持ち出しする可能性があります。バケットの削除のような破壊的操作に対して、組織が第三者の目によるチェックを義務づけていなければ、アカウントが1つ侵害されるだけで事足りてしまいます。
データポイズニング:取り込みやラベリングの上流工程で、汚染されたデータが注入される可能性があります。バックドアが仕込まれたり、モデルの精度がひそかに劣化させられたりします。気づいたときには、AIが何週間も誤った判断を下し続けていた、ということになりかねません。
AIストレージへのランサムウェア:データセット、チェックポイント、バックアップが一挙に暗号化・破壊される恐れがあります。学習データの収集とキュレーションには数か月かかることもあり、そのデータを失うことは、そのデータに基づいて築き上げられた競争優位を失うことを意味します。
モデルの改ざん:デプロイ済みのモデルが学習後に変更されたり、モデルの成果物が丸ごと消去されたりする可能性があります。不変性(イミュータビリティ)が確保されていなければ、今日動いているモデルが、検証したモデルそのものであるという保証はありません。
監査可能性の喪失:攻撃者にログや管理の連鎖(チェーン・オブ・カストディ)を消去されれば、何が起きたのかを再構成する手立てがなくなります。規制の厳しい業界では、それはセキュリティインシデントをコンプライアンス上の大惨事へと変えてしまいます。
一つの壁だけでは守り切れない
多層防御(Defense in Depth)は軍事戦略から借用された概念であり、攻撃を阻止するために単一の防御手段に依存してはならないことを意味します。代わりに、セキュリティの層を重ねて構築し、一つの層が破られても次の層がそれを阻止できるようにします。
サイバーセキュリティの観点では、攻撃者と最も価値ある資産との間に立ちはだかるものが、たった1つだけの認証情報、ポリシー、ベンダーであってはならない、ということです。
AIインフラにおいてそれは、セキュリティが、データが実際に存在するストレージ層まで到達していなければならない、ということを意味します。
学習データセット、モデルの重み、チェックポイント、バックアップこそが、攻撃者の最終的な狙いです。そこに手が届いてしまえば、上流のすべてが危険にさらされます。土台を守らなければ、その上に積み上げたものには何の意味もありません。
実務上、それは次のような形になります。
アクセス制御:多要素認証(MFA)、IDとアクセスの管理(IAMポリシー)、シングルサインオン(SSO)、ロールベースの権限設定は、セキュリティの基盤となる対策です。IBMの『2025 Cost of a Data Breach Report』によると、「AI関連の侵害を経験した組織のうち、97%が適切なアクセス制御を欠いていた」ことが判明しており、土台の部分に穴があることを示しています。
オブジェクトロック:ランサムウェアは、変更できないものは暗号化できません。いったんデータが書き込まれたら、自ら定めた保持期間中は、変更も上書きも削除もできないようにするべきです。これにより、アプリケーション層で何が起きようとも、学習データセットとモデルのチェックポイントは損なわれずに保たれます。
複数の確認手段:管理者アカウントを1つ侵害した攻撃者が、その直後に次の壁にぶつかるようにすべきです。ストレージバケットの削除やアカウントレベルの変更といった破壊的操作は、実行前に複数の管理者による承認を必要とすべきであり、これはマルチユーザー承認(MUA)と呼ばれます。これは上位機能や上位プランのオプションであってはなりません。あらゆるAIストレージプラットフォームにとって、構造上の必須要件です。
暗号化:AIパイプラインを流れるすべてのデータが攻撃の標的です。システム間の転送中も、ストレージに保存されている状態でも同じです。暗号化により、攻撃者がそのデータを傍受し、あるいは到達したとしても、利用できないようにします。具体的には、転送中のデータにはTLS、保存データにはAES-256を、エンドポイントだけでなくパイプラインの全段階に一貫して適用することを意味します。
隠しバックアップ:最後の防衛線として、ネットワークから見えないデータのバックアップが必要です。WasabiのCovert Copy™(コバート コピー)テクノロジーは、データの隠された、イミュータブルなコピーを作成します。それを必要とする際には、厳格なMUAのプロセスを経る必要があります。管理者権限をすべて手にした攻撃者であっても、それを見つけることも、盗むことも、削除することも、暗号化することもできません。
網羅的なログ:残る抜け穴を塞ぐには、ログ取得と権限範囲の設定が不可欠です。これによりインシデント後の影響範囲を限定でき、どの防御壁がどのように破られたのかを正確に再現するための、フォレンジック上の手がかりが得られます。
レジリエンスに、追加コストは要らない
使うたびに費用がかかるセキュリティ機能は、使われなくなります。災害復旧訓練を実施すれば下り転送料がかかり、不変性を有効にすればオブジェクトごとに課金され、バックアップを戻せば取り出し料金が発生する ― こうした状況では、採算がこれらの機能に不利に働きます。予算が引き締められると、真っ先に削られるのは、たいてい「効果が目に見えない」制御措置です。その結果生まれるのが、書類上はレジリエンスがあるのに、実務では穴だらけ、という組織です。
Wasabiは、下り転送、不変性、データの取り出しのいずれにも課金しません。訓練を実施し、バックアップを復元し、自社の体制に負荷をかけて検証できます。料金は一切発生しません。
築き上げたものと、その土台を守る
今日のAIインフラを守るには、基本的なアクセス制御だけではやはり不十分です。ストレージ層における多層防御により、データパイプラインを影の中から引き出し、それを守る備えを整える、包括的なAIセキュリティ戦略が実現します。
AIを今の状態にまで持ってくるために、多大な投資をしてきたはずです。ユースケースを見極め、インフラを構築し、モデルを学習させ、ガードレールを設けました。多くの組織はそこで手を止め、難所は越えたと考えます。確かにその通りです ― パイプラインが攻撃されるまでは。モデル構築の土台となったデータ、数か月の学習の成果であるチェックポイント、そしてそのすべてを支えるストレージインフラ。攻撃者が狙っているのは、まさにそこです。ここまでと同じ厳格さで、確実に守ってください。
AIの「土台」を、今日から守る
学習データ、モデルの重み、チェックポイントは攻撃者が最も狙う資産です。Wasabiなら、オブジェクトロックによる改ざん防止、マルチユーザー承認(MUA)、見えないバックアップ「Covert Copy」で、AIパイプラインを保管層から守れます。まずは30日間、無料でお試しください。
製造業のデジタルツインとは、設備や工場を仮想空間に再現し現実と同期させる仕組みです。フィジカルAIとの関係、2026年の動向、導入課題、シミュレーションやAI学習で増えるデータの保管・移動方法まで、情シス目線で解説します。
ランサムウェアはバックアップと復旧経路そのものを狙う時代へ。不変性だけでは守れない今、WasabiのCovert Copy™は論理的エアギャップで最後のクリーンなコピーを不可視化し、確実な復旧を実現します。詳細は近日開催のウェビナーで。
データレイク構築の手順を5ステップで解説。Raw・Cleansed・Curatedのゾーン設計、S3互換ストレージの選定基準、データスワンプを防ぐ運用まで、AI活用を見据えた実装のポイントを整理します。
&w=1920&q=75)