非構造化データは、事前定義された形式、モデル、構造に従わない情報です。行と列にきれいに収まりません。そのため、従来型のリレーショナル データベース管理システム(RDBMS)を使用して保存、処理、分析することが困難な場合があります。これは、毎日ビジネス システムに流れ込む自由形式の情報です。エンタープライズ アーキテクチャにどのような影響があるかを考えてみましょう。
さまざまな業界で非構造化データソースが急速に増加しており、アーキテクチャ上の課題がいくつか生じています。
この非構造化情報を取得、保存、理解する方法を見つけることは、最新のデータ アーキテクチャが解決する必要がある中核的な問題です。
非構造化データの定義的な特徴は、事前定義されたデータモデルがないことです。テキスト、画像、動画、音声、IoT テレメトリーなど、さまざまな形式で提供されます。クリーンなスプレッドシート データとは異なり、この情報は通常、ペタバイト規模の膨大な量で蓄積されます。複雑で、極めて多様性に富み、常に変化しています。
このような自由形式のファイルを処理するには、いくつかの重要な理由から、まったく異なる技術的アプローチが必要になります。
これらの形式を比較することで、どのように組み合わされているかを理解できます。構造化データは SQL に依存し、厳密なスキーマを適用するため、簡単に検索できます。非構造化データはスキーマレスで、ネイティブでの検索が難しく、データレイクや NoSQL データベース ソリューションを必要とします。その中間にあるのが、JSON や XML などの半構造化データです。これには、ある程度の組織タグが含まれていますが、厳密なリレーショナル スキーマはありません。
データの種類 | データモデル | ストレージ | クエリ方法 | 例 | ボリューム プロファイル |
構造化データ | 厳格な事前定義スキーマ | リレーショナル データベース | SQL | 財務記録、在庫 | 中 |
半構造化データ | 柔軟で自己記述型 | NoSQL、ドキュメント ストア | NoSQL API、SQL 拡張機能 | JSON、XML、CSV | 拡大 |
非構造化データ | 事前定義されたモデルなし | データレイク、オブジェクト ストレージ、NoSQL | AI、ML、NLP、検索インデックス | テキスト、動画、画像、音声 | 85~90% で優勢 |
データの種類
データモデル
ストレージ
クエリ方法
例
ボリューム プロファイル
構造化データ
厳格な事前定義スキーマ
リレーショナル データベース
SQL
財務記録、在庫
中
半構造化データ
柔軟で自己記述型
NoSQL、ドキュメント ストア
NoSQL API、SQL 拡張機能
JSON、XML、CSV
拡大
非構造化データ
事前定義されたモデルなし
データレイク、オブジェクト ストレージ、NoSQL
AI、ML、NLP、検索インデックス
テキスト、動画、画像、音声
85~90% で優勢
適切なデータ パイプラインを構築するには、扱う情報の種類と、企業のチームが Google Cloud データベースを実際に使用してその情報を管理する方法を正確に把握することが重要です。非構造化データは、人間が生成したデータとマシンが生成したデータの 2 つの主要なカテゴリに分類できます。
ユーザーや従業員が毎日手動で作成しているコンテンツの例としては、次のようなものがあります。
コンピュータ、センサー、サーバーは、人間の入力なしでバックグラウンドで大量のデータを作成します。
スケーラブルなアプリケーションを構築するために、デベロッパーはデータを適切なストレージ環境に一致させることができます。構造化データと非構造化データでは、パフォーマンスを維持し、インフラストラクチャ費用を管理可能なレベルに抑えるために、まったく異なるアーキテクチャが必要になります。
構造化データの場合、組織はエンタープライズ データ ウェアハウス(EDW)を利用しています。この環境は、厳格なルールと予測可能な形式に従った情報を処理することを目的として構築されています。
非構造化データには、はるかに柔軟なアプローチが必要です。動画、音声録音、未処理のテキストログなどの大きなファイルは、整然としたテーブルに収まらないため、デベロッパーはデータレイクと Cloud Storage バケットを使用して保存します。
デベロッパーやアーキテクトから寄せられる、非構造化データに関するよくある質問とその回答をご紹介します。
一般的な例としては、メール、ソーシャル メディアの投稿、PDF、音声ファイルや動画ファイルなどの人間が生成したコンテンツがあります。また、衛星画像や IoT センサーのテレメトリーなど、機械生成された形式もあります。これらの多様な自由形式のフォーマットは、企業が日常的に扱うデータの大部分を占めており、標準的なデータベースの行と列にきれいに整理することはできません。
CSV ファイルは、行、列、一貫した区切り文字を使用するため、一般的に構造化データまたは半構造化データとみなされます。厳密なリレーショナル スキーマの適用はありませんが、表形式であるため、高度に整理されています。そのため、CSV は動画、画像、自由形式のテキストなどの真の非構造化データよりもはるかに構造化されています。
SQL は、データ型そのものではなく、構造化されたリレーショナル データに使用される標準的なクエリ言語です。厳格なスキーマとテーブルを使用して情報を取得します。そのため、追加の処理や拡張機能なしでは、画像、音声、自由形式のテキストなどの非構造化データをネイティブにクエリできません。
非構造化データは、事前定義されたデータモデルがないことで識別できます。情報が列と行にうまく収まらず、SQL を使用して直接クエリできない場合は、非構造化データである可能性が高いです。実用的な指標には、メールやチャットログなどのテキスト形式のほか、動画、画像、音声、センサーデータなどのテキスト以外の形式も含まれます。
メールの本文は、固定スキーマのない自由形式のテキストで構成されているため、非構造化データです。ただし、送信者、受信者、タイムスタンプ、件名などの関連するメタデータは構造化されています。このような二面性は非常に一般的であり、組織が NLP と AI を使用してメール コンテンツから大規模に分析情報を抽出する理由を説明しています。
構造化データは固定スキーマに依存し、SQL テーブルを使用するリレーショナル データベースに格納されます。半構造化データには、ある程度の組織的な要素が含まれていますが、厳密なスキーマはありません。一般的な例としては、JSON、XML、CSV ファイルが挙げられます。非構造化データには事前定義されたフォーマットがなく、動画や自由形式のテキストなどのファイルが含まれ、企業データの大部分を占めています。
ほとんどのエンタープライズ アーキテクチャは、最終的には単一のストレージ プラットフォームでは対応できなくなります。システムがスケールするにつれて、データレイクとストレージ バケットは自然にさまざまな地域やクラウド プロバイダに分散されます。この断片化は、すべての非構造化ファイルに一度にアクセスする必要がある ML パイプラインを構築しようとする際に制約となります。
Google Cloud は、Agentic Data Cloud を使用して、この特定のアーキテクチャ上の課題に対処します。分散ストレージ環境を 1 つの統合アクセス ポイントに接続する、AI ネイティブのクロスクラウド レイクハウスを備えています。
テキスト、画像、動画に隠された情報を引き出すことで、組織に大きなメリットをもたらすことができます。非構造化データを構造化することの主なメリットは次のとおりです。
より詳細な顧客インサイト:
従来のデータベースでは、顧客が何を購入したかがわかります。非構造化データは、その理由を説明するのに役立ちます。ソーシャル メディアの投稿、商品レビュー、カスタマー サポートの通話などを分析することで、感情のセンチメントを測定し、ユーザーが何を求めているかを正確に把握できます。これにより、ユーザーの問題を真に解決するプロダクトを構築できます。
運用効率の向上:
手動タスクを自動化することで、時間とリソースを節約できます。自然言語処理ツールは、受信したサポートメールを読み取り、適切な部門に即座に転送できます。また、複雑な法的契約をスキャンして、重要な日付や条項を自動的に抽出することもできます。
先を見越したリスク マネジメント:
企業は機密データを保護する必要がありますが、膨大なデータレイクに隠された個人情報を見つけるのは困難です。ML モデルは、数百万件の自由形式のドキュメントや画像を迅速にスキャンして、機密データを特定し、保護できます。これにより、厳格なプライバシー法を遵守できます。
予測メンテナンスとモニタリング:
AI モデルは、構造化されていないイベントログと IoT センサー ストリームを分析することで、人間が見逃す可能性のある微妙なパターンを特定できます。たとえば、機械の故障が差し迫っていることを示す正確な音声周波数を特定できます。これにより、機器が故障する前に修理できるため、費用のかかるダウンタイムを削減できます。
より優れた AI と機械学習モデル:
AI モデルは、学習と改善のために膨大な量の情報を必要とします。画像、音声、自由形式のテキストなど、さまざまな非構造化データをモデルにフィードすることで、モデルは現実世界をより広く把握できるようになります。これにより、より正確で信頼性の高い予測を生成するようにモデルがトレーニングされます。
これらの複雑なファイルから有意義な価値を引き出すには、専用のフレームワークが必要です。AI と ML は、このプロセスのエンジンとして機能します。たとえば、AI を活用した自動パイプラインは、動画ファイルや未加工のテキスト ドキュメントを、大量のバイナリコードのブロックから読み取り可能なデータに変換するのに役立ちます。
デベロッパーは、特定の AI 技術を適用して、次のようなさまざまな種類のファイルを処理します。
最新の AI パイプラインがこの情報を処理して、現実世界のソリューションを推進する仕組みは次のとおりです。
管理ソリューションの選択は、特定のワークロードと成長軌跡によって異なります。まずは、オンプレミスのファイル ストレージとクラウドのオブジェクト ストレージを比較することから始めるとよいでしょう。複雑さが増すにつれて、クラウドネイティブのデータレイクや、フルマネージドの AI 統合プラットフォームが選択されることが多くなります。
選択肢を評価する際は、次の技術チェックリストを考慮してください。
AI ワークロードが増加するにつれ、ストレージは単なる受動的なリポジトリではなくなっています。ストレージは、AI パフォーマンス パスのアクティブなコンポーネントです。デベロッパーとデータベース管理者のインフラストラクチャの速度低下を解消するために、Google Cloud はいくつかの高度な非構造化ストレージ機能を導入しました。
高パフォーマンスのデータ アーキテクチャを設計している場合に、非構造化形式を大規模に処理および管理するために使用できる具体的なツールを以下に示します。
これらの専用ストレージ ツールを活用することで、基盤となるインフラストラクチャが、最新のエージェント アプリケーションに求められる膨大なスループットと高い同時実行性を容易にサポートできるようになります。