En quoi consistent les données non structurées ?

Les données non structurées sont des informations qui ne suivent pas un format, un modèle ou une structure prédéfinis. Elles ne s'intègrent pas parfaitement dans des lignes et des colonnes. De ce fait, il peut être difficile de les stocker, de les traiter et de les analyser à l'aide d'un système de gestion de bases de données relationnelles (SGBDR) traditionnel. Il s'agit des informations non structurées qui circulent chaque jour dans vos systèmes d'entreprise. Voyons comment cela impacte les architectures d'entreprise :

  • Elles représentent la majorité du stockage d'entreprise : ce type de données représente en fait environ 70 % à 90 % de toutes les informations qu'une entreprise collecte aujourd'hui. 
  • Elles incluent des types de fichiers courants : vous les utilisez constamment sous forme de fichiers texte, d'e-mails, de vidéos, d'images, d'enregistrements audio et de posts sur les réseaux sociaux.
  • Elles remettent en question l'architecture moderne : à mesure que votre application se développe, la gestion de ce volume massif de données variées devient une priorité pour les développeurs et les architectes système.

Quels sont les principaux défis liés à la gestion des données non structurées ?

Les sources de données non structurées ont connu une croissance rapide dans plusieurs secteurs, ce qui pose des problèmes architecturaux spécifiques :

  • Génération massive de données : les applications modernes génèrent en permanence des e-mails, des PDF, des flux de données de capteurs IoT, des images de surveillance, des contenus de réseaux sociaux, des enregistrements vocaux et des images satellite. Les utilisateurs créent des contenus à l'échelle du téraoctet et du pétaoctet, et ces contenus peuvent s'accumuler rapidement.
  • Le fossé des bases de données traditionnelles : les SGBDR ont été conçus pour les données structurées et tabulaires. Elles ne peuvent tout simplement pas stocker, indexer ni interroger efficacement les formats libres.
  • Risques liés aux performances et aux coûts : si vous essayez de forcer un fichier vidéo ou un flux de capteur brut dans une table SQL standard, les performances de votre application peuvent chuter et vos coûts augmenter.

Trouver un moyen de capturer, de stocker et de comprendre ces informations non structurées est un problème fondamental que les architectures de données modernes doivent résoudre.

Quelles sont les caractéristiques des données non structurées ?

La caractéristique principale des données non structurées est l'absence de modèle de données prédéfini. Elles se présentent sous différents formats, tels que du texte, des images, des vidéos, de l'audio et des données de télémétrie IoT. Contrairement aux données de tableur propres, ces informations s'accumulent généralement à un volume massif, à l'échelle du pétaoctet. Elles sont complexes, très variables et en constante évolution.

Le traitement de ces fichiers de format libre nécessite une approche technique complètement différente pour plusieurs raisons clés :

  • Les bases de données traditionnelles ne sont pas adaptées : les données non structurées ayant un format totalement libre, les bases de données SQL standards ne peuvent pas les lire ni les interroger de manière native.
  • SQL a des limites claires : vous ne pouvez pas écrire une simple commande SQL pour déterminer l'humeur générale d'un appel au service client ou identifier un objet spécifique dans une photo.
  • Des outils spécialisés sont nécessaires : pour donner du sens à ces informations, les organisations doivent s'appuyer sur des solutions spécialement conçues à cet effet.
  • L'IA pilote l'analyse : les équipes utilisent l'intelligence artificielle, le machine learning et le traitement du langage naturel pour analyser, interpréter et extraire de la valeur du chaos.

Il est utile de comparer ces formats pour comprendre comment ils s'articulent. Les données structurées reposent sur SQL, appliquent des schémas stricts et sont faciles à rechercher. Les données non structurées sont sans schéma, difficiles à rechercher de manière native et nécessitent des solutions de lacs de données ou de bases de données NoSQL. Entre les deux se trouvent les données semi-structurées, comme JSON ou XML, qui contiennent des balises d'organisation, mais n'ont pas de schéma relationnel rigide.

Type de données

Modèle de données

Stockage

Méthode query

Exemples

Profil de volume

Données structurées

Schéma strict et prédéfini

Bases de données relationnelles

SQL

Documents financiers, inventaire

Modérée

Données semi-structurées

Flexible, autodescriptif

NoSQL, magasins de documents

API NoSQL, extensions SQL

JSON, XML, CSV

Croissance

Données non structurées

Aucun modèle prédéfini

Lacs de données, stockage d'objets, NoSQL


IA, ML, TLN, index de recherche

Texte, vidéo, images, audio

Dominant à 85 % ou 90 %


Type de données

Modèle de données

Stockage

Méthode query

Exemples

Profil de volume

Données structurées

Schéma strict et prédéfini

Bases de données relationnelles

SQL

Documents financiers, inventaire

Modérée

Données semi-structurées

Flexible, autodescriptif

NoSQL, magasins de documents

API NoSQL, extensions SQL

JSON, XML, CSV

Croissance

Données non structurées

Aucun modèle prédéfini

Lacs de données, stockage d'objets, NoSQL


IA, ML, TLN, index de recherche

Texte, vidéo, images, audio

Dominant à 85 % ou 90 %


Utiliser des données non structurées avec Google Cloud

Pour créer le pipeline de données approprié, il est utile de savoir exactement à quel type d'informations vous avez affaire et comment les équipes d'entreprise utilisent les bases de données Google Cloud pour les gérer. Les données non structurées peuvent être divisées en deux catégories principales : celles générées par l'humain et celles générées par la machine.

Données non structurées générées par l'humain

Ce sont des exemples de contenus que vos utilisateurs et employés créent manuellement chaque jour.

  • Documents textuels et communications : pour de nombreuses applications, les données non structurées peuvent se présenter sous la forme de volumes importants d'e-mails, de messages de chat et de demandes d'assistance client.
  • Cas d'utilisation : les développeurs peuvent créer un pipeline de traitement du langage naturel (TLN) dans lequel les demandes d'assistance brutes sont stockées dans Cloud Storage. Ensuite, Gemini Enterprise Agent Platform analyse le texte pour identifier le problème principal, et le système enregistre ces tags nouvellement structurés directement dans une base de données Firestore. Comme Firestore synchronise les données instantanément, votre application Web interne se met à jour en temps réel, ce qui permet de transmettre directement les bugs urgents à l'équipe d'ingénierie concernée.
  • Rich media : fichiers audio de centres d'appels, images importées par les utilisateurs et enregistrements vidéo
  • Cas d'utilisation : si vous créez une application d'assurance, vous devez pouvoir traiter les photos d'accidents de voiture que les utilisateurs importent depuis leur téléphone. Vous pouvez enregistrer ces fichiers volumineux dans Cloud Storage, utiliser un modèle de machine learning pour estimer les dommages visuels, puis stocker cette estimation structurée des réparations dans une base de données AlloyDB pour PostgreSQL. Cela peut aider vos applications d'entreprise standards à accéder rapidement et de manière fiable aux résultats de l'IA.

Données non structurées générées par une machine

Les ordinateurs, les capteurs et les serveurs créent d'énormes quantités de données en arrière-plan, sans aucune intervention humaine.

  • Données de capteurs IoT et télémétrie : les machines d'usine, les thermostats intelligents et les voitures connectées transmettent constamment des données brutes. La plupart de ces données de télémétrie brutes sont présentées dans des formats complexes, imbriqués et libres.
  • Cas d'utilisation : une usine de fabrication diffuse des millions d'événements bruts audio et de capteurs par seconde. Comme les tables relationnelles standards ne peuvent pas gérer cette vitesse d'ingestion, les développeurs utilisent Bigtable. Bigtable absorbe ces données de séries temporelles à haut débit sans accuser de retard. Ensuite, les modèles de ML lisent ces données pour identifier le son spécifique d'une pièce défectueuse, ce qui peut aider à déclencher une maintenance prévisionnelle avant que la machine ne tombe en panne.
  • Imagerie satellite et vidéosurveillance : les caméras de sécurité et les satellites météorologiques génèrent des flux continus et volumineux de données visuelles.
  • Cas d'utilisation : une entreprise de transport maritime internationale génère d'importants flux de vidéos satellites brutes. Elle stocke ces fichiers volumineux de manière économique dans Cloud Storage, utilise la vision par ordinateur pour identifier ses cargos, puis transfère ces notifications de position structurées dans Spanner. Cela peut aider à fournir à leurs applications de chaîne d'approvisionnement mondiale une base de données relationnelle très précise, sans temps d'arrêt, pour le suivi en temps réel.

Stockage de données non structurées : lacs de données ou entrepôt de données d'entreprise

Pour créer une application évolutive, les développeurs peuvent faire correspondre leurs données à l'environnement de stockage approprié. Les données structurées et non structurées nécessitent des architectures complètement différentes pour maintenir les performances et maîtriser les coûts d'infrastructure.

Pour les données structurées, les entreprises s'appuient sur un entrepôt de données d'entreprise (enterprise data warehouse, EDW). Cet environnement est conçu spécifiquement pour traiter des informations qui suivent des règles strictes et des formats prévisibles.

  • Vous pouvez utiliser un entrepôt de données d'entreprise pour centraliser les informations structurées provenant de plusieurs bases de données relationnelles, y compris vos systèmes de facturation et vos outils de gestion de la relation client.
  • Votre équipe doit nettoyer et formater les données avant de les enregistrer, afin que chaque information s'intègre parfaitement dans une table prédéfinie.
  • Les outils d'informatique décisionnelle peuvent ensuite exécuter des requêtes SQL complexes sur des milliards de lignes en quelques secondes pour fournir des rapports historiques et des prévisions fiables.

Les données non structurées nécessitent une approche beaucoup plus flexible. Les fichiers volumineux comme les vidéos, les enregistrements audio et les journaux de texte brut ne tiennent pas dans des tables bien ordonnées. Les développeurs utilisent donc des lacs de données et des buckets Cloud Storage pour les stocker.

  • Un lac de données fournit un dépôt flexible dans lequel vous pouvez stocker des fichiers dans leur format brut natif, sans avoir à les structurer au préalable.
  • Les buckets Cloud Storage alimentent ces lacs de données à l'aide du stockage d'objets, ce qui permet à votre système d'atteindre une capacité de plusieurs pétaoctets sans que vous ayez à recompiler vos bases de données.
  • Stocker des fichiers non structurés volumineux dans une base de données traditionnelle est extrêmement coûteux. Les buckets de stockage sont donc une option beaucoup plus économique pour les grands volumes de données.
  • En conservant les données sous leur forme brute, vos pipelines d'intelligence artificielle et de machine learning peuvent facilement extraire les fichiers dont ils ont besoin pour entraîner des modèles de vision par ordinateur et de traitement du langage naturel.

Questions fréquentes

Voici les réponses aux questions fréquentes que les développeurs et les architectes se posent à propos des données non structurées.

Les exemples courants incluent les contenus générés par des humains, comme les e-mails, les posts sur les réseaux sociaux, les PDF et les fichiers audio ou vidéo. Vous verrez également des formats générés par des machines, comme l'imagerie satellitaire et la télémétrie des capteurs IoT. Ces formats divers et libres constituent la grande majorité des données d'entreprise au quotidien et ne peuvent pas être organisés de manière ordonnée en lignes et en colonnes de base de données standard.


Un fichier CSV est généralement considéré comme un fichier de données structurées ou semi-structurées, car il utilise des lignes, des colonnes et un délimiteur cohérent. Même si elles ne sont pas soumises à un schéma relationnel strict, leur format tabulaire les rend très organisées. Cela rend un fichier CSV beaucoup plus structuré que de véritables données non structurées comme des vidéos, des images ou du texte libre.


SQL est le langage de requête standard utilisé pour les données relationnelles structurées, et non un type de données en soi. Il s'appuie sur des schémas et des tables stricts pour récupérer les informations. Par conséquent, il ne peut pas interroger de manière native des données non structurées telles que des images, de l'audio ou du texte libre sans traitement ni extension supplémentaires.

Vous pouvez identifier les données non structurées par l'absence de modèle de données prédéfini. Si les informations ne s'intègrent pas parfaitement dans des lignes et des colonnes, et que vous ne pouvez pas les interroger directement à l'aide de SQL, elles sont probablement non structurées. Les indicateurs pratiques incluent les formats textuels tels que les e-mails et les journaux de chat, ainsi que les formats non textuels tels que les vidéos, les images, les fichiers audio et les données de capteurs.


Le corps d'un e-mail est non structuré, car il s'agit d'un texte libre sans schéma fixe. Cependant, les métadonnées associées, comme l'expéditeur, le destinataire, le code temporel et l'objet, sont structurées. Cette double nature est très courante et explique pourquoi les organisations utilisent le TLN et l'IA pour extraire des insights du contenu des e-mails à grande échelle.



Les données structurées reposent sur un schéma fixe et résident dans des bases de données relationnelles utilisant des tables SQL. Les données semi-structurées contiennent certains éléments d'organisation, mais ne disposent pas d'un schéma rigide. Les fichiers JSON, XML et CSV en sont des exemples courants. Les données non structurées n'ont pas de format prédéfini. Elles incluent des fichiers tels que des vidéos et du texte libre, et constituent la grande majorité des données d'entreprise.

Quels sont les avantages de l'analyse des données non structurées ?

Débloquer les informations cachées dans du texte, des images et des vidéos peut donner un avantage considérable à votre organisation. Voici quelques-uns des principaux avantages de la structuration des données non structurées :

Des insights plus poussés sur les clients :

Les bases de données traditionnelles vous indiquent ce qu'un client a acheté. Les données non structurées peuvent vous aider à comprendre pourquoi. En analysant les posts sur les réseaux sociaux, les avis sur les produits et les appels au service client, vous pouvez mesurer le sentiment émotionnel et comprendre exactement ce que veulent les utilisateurs. Cela vous aide à créer des produits qui résolvent réellement leurs problèmes.

Amélioration de l'efficacité opérationnelle :

Vous pouvez gagner du temps et économiser des ressources en automatisant les tâches manuelles. Les outils de traitement du langage naturel peuvent lire les e-mails d'assistance entrants et les acheminer instantanément vers le service approprié. Ils peuvent également analyser des contrats juridiques denses pour en extraire automatiquement les dates et les conditions clés.

Gérer les risques de façon proactive :

Les entreprises doivent protéger les données sensibles, mais il peut être difficile de trouver des informations personnelles cachées dans un lac de données volumineux. Les modèles de machine learning peuvent analyser rapidement des millions de documents et d'images au format libre pour localiser et sécuriser les données sensibles. Cela permet à votre entreprise de respecter les lois strictes sur la confidentialité.

Maintenance prévisionnelle et surveillance :

En analysant les journaux d'événements non structurés et les flux de capteurs IoT, les modèles d'IA peuvent repérer des schémas subtils qui pourraient échapper aux humains. Par exemple, ils peuvent identifier la fréquence audio exacte qui indique qu'une machine est sur le point de tomber en panne. Cela vous permet de réparer les équipements avant qu'ils ne tombent en panne, ce qui réduit les temps d'arrêt coûteux.

Des modèles d'IA et de machine learning plus performants :

Les modèles d'IA ont besoin d'énormes quantités d'informations pour apprendre et s'améliorer. En alimentant vos modèles avec un mélange varié de données non structurées, comme des images, de l'audio et du texte libre, vous leur donnez une vision beaucoup plus large du monde réel. Cela permet d'entraîner les modèles à générer des prédictions plus précises et fiables.

Comment l'IA et le machine learning dégagent de la valeur des données non structurées

Pour exploiter ces fichiers complexes, vous avez besoin d'un framework dédié. L'intelligence artificielle et le machine learning peuvent servir de moteur à ce processus. Un pipeline automatisé assisté par l'IA peut, par exemple, aider à transformer un fichier vidéo ou un document texte brut d'un bloc massif de code binaire en données lisibles.

Les développeurs appliquent des techniques d'IA spécifiques pour traiter différents types de fichiers, y compris :

  • Le TLN pour lire des documents contenant beaucoup de texte, comme des e-mails, des demandes d'assistance et des contrats juridiques
  • La vision par ordinateur pour analyser des images et des vidéos, ce qui facilite des tâches comme l'examen de séquences de surveillance, l'évaluation d'imagerie médicale ou le traitement de photos satellites
  • Les modèles de reconnaissance vocale pour transcrire des fichiers audio afin que le texte puisse être recherché

Voici comment un pipeline d'IA moderne traite ces informations pour générer des solutions concrètes :

  1. Collecter des sources non structurées : les utilisateurs, les appareils et les applications génèrent constamment des données brutes. Les e-mails contenant beaucoup de texte, les fichiers vidéo, les flux de capteurs IoT, les PDF et les posts sur les réseaux sociaux en sont des exemples courants.
  2. Acheminement via la couche d'ingestion : le système collecte les données entrantes de manière sécurisée et les achemine vers la destination de stockage appropriée. Les développeurs utilisent souvent des pipelines de données à volume élevé, des passerelles API ou des importations de fichiers par lot pour déplacer ces données sans ralentir l'application principale.
  3. Sécurité au niveau de la couche de stockage : le système stocke les informations de manière sécurisée en fonction de la fréquence et de la rapidité d'accès dont vous avez besoin. Vous pouvez utiliser Cloud Storage pour les lacs de données brutes, Bigtable pour les journaux IoT rapides ou Firestore pour le contenu d'application flexible.
  4. Analyse dans la couche de traitement : c'est là que les modèles d'IA peuvent être utiles. Des modèles de calcul spécialisés lisent, analysent et interprètent les fichiers au format libre pour en extraire le sens à l'aide des outils de TLN, de vision par ordinateur et de reconnaissance vocale mentionnés ci-dessus.
  5. Fournir la couche d'insights : enfin, le système transforme les données traitées en informations décisionnelles claires et exploitables. Vous obtenez ainsi des résultats précieux, comme des scores de sentiment client à partir d'enregistrements de centres d'appel, des classifications de documents automatisées pour la conformité et des alertes de maintenance prévisionnelle à partir de capteurs d'usine.
  6. Commentaires et optimisation continus : les prédictions de l'IA dont le niveau de confiance est faible sont transmises à des examinateurs humains pour vérification et correction. Ces données corrigées sont réinjectées à l'étape 1 en tant que nouvelles données d'entraînement pour réentraîner et améliorer les modèles d'IA. Le système suit en permanence la justesse et la latence des modèles pour s'assurer que l'IA ne se dégrade pas sur la durée.

Choisir la bonne solution de gestion des données non structurées

Le choix d'une solution de gestion dépend de votre charge de travail spécifique et de votre trajectoire de croissance. Vous pouvez commencer par comparer le stockage de fichiers sur site avec le stockage d'objets dans le cloud. À mesure que la complexité augmente, le choix se porte souvent sur un lac de données cloud natif ou une plate-forme entièrement gérée intégrant l'IA.

Lorsque vous évaluez vos options, tenez compte de cette liste de contrôle technique :

  • Architecture de stockage (stockage basé sur des fichiers, stockage d'objets ou lac de données)
  • Évolutivité à l'échelle du pétaoctet et rentabilité
  • Intégration native de l'IA et du ML (TLN, vision par ordinateur, embeddings)
  • Flexibilité NoSQL (Bigtable pour les charges de travail à haut débit, Firestore pour le contenu au niveau de l'application)
  • Fonctionnalités de gouvernance des données, de contrôle des accès et de conformité
  • Prise en charge multiformat (texte, image, vidéo, audio, IoT)
  • Intégration avec les entrepôts, les outils d'informatique décisionnelle et les plates-formes d'analyse existants
  • Coût total de possession pour les volumes de données cibles

Fonctionnalités de stockage non structuré spécialement conçues

À mesure que les charges de travail d'intelligence artificielle se développent, le stockage n'est plus seulement un dépôt passif. C'est un élément actif du parcours de performance de l'IA. Pour éliminer les ralentissements de l'infrastructure pour les développeurs et les administrateurs de bases de données, Google Cloud a introduit plusieurs fonctionnalités avancées de stockage non structuré.

Si vous concevez une architecture de données hautes performances, voici les outils spécifiques que vous pouvez utiliser pour traiter et gérer des formats non structurés à grande échelle :

  • Stockage intelligent pour les métadonnées automatisées : le stockage intelligent génère automatiquement du contexte, comme des annotations d'image, pour vos objets non structurés au moment précis où ils sont écrits dans le bucket. Les développeurs n'ont donc plus besoin de créer des pipelines d'annotation manuels et personnalisés. Il intègre également un serveur Model Context Protocol (MCP), qui permet aux agents IA de lire, d'écrire et d'analyser vos données Cloud Storage de manière native.
  • Insights sur les données non structurées : cette fonctionnalité de Knowledge Catalog utilise Gemini Enterprise Agent Platform pour analyser le contenu réel des fichiers bruts et non structurés, tels que les PDF, stockés dans votre lac de données. Il déduit automatiquement les schémas et extrait les relations, en cataloguant les fichiers non structurés directement dans les tables d'objets BigQuery afin que vous puissiez les interroger immédiatement.
  • Cloud Storage Rapid : conçu spécifiquement pour les pics soudains de traitement par l'IA, cette famille de stockage offre une bande passante extrêmement élevée et une faible latence. Rapid Bucket fournit une bande passante de plus de 15 Tbit/s, tandis que Rapid Cache accélère le débit de lecture jusqu'à 2,5 Tbit/s pour les tâches intensives comme le chargement de modèles, sans nécessiter de modifier le code de vos buckets existants.
  • Managed Lustre : si vos équipes chargées de l'infrastructure créent des clusters d'entraînement à grande échelle, Google Cloud Managed Lustre offre désormais un débit allant jusqu'à 10 To/s via RDMA (Remote Direct Memory Access). Cela permet de s'assurer que vos accélérateurs de calcul hautes performances reçoivent en permanence les données dont ils ont besoin, sans délai.
  • Instances Z4M : pour les organisations qui créent des architectures de stockage personnalisées, la nouvelle instance Z4M est compatible avec les systèmes de fichiers parallèles de confiance, avec jusqu'à 168 Tio de capacité de SSD local par instance.

En utilisant ces outils de stockage spécialement conçus, vous vous assurez que votre infrastructure sous-jacente peut prendre en charge sans effort le débit massif et la simultanéité élevée requis par les applications agentiques modernes.



Passez à l'étape suivante

Profitez de 300 $ de crédits gratuits et de plus de 20 produits Always Free pour commencer à créer des applications sur Google Cloud.

  • Produits Google Cloud
  • Parcourez plus de 100 produits. Les nouveaux clients bénéficient de 300 $ de crédits gratuits pour exécuter, tester et déployer des charges de travail. Tous les clients peuvent utiliser plus de 25 produits gratuitement, dans les limites mensuelles spécifiées.
Google Cloud