Cosa sono i dati non strutturati?

I dati non strutturati sono informazioni che non seguono un formato, un modello o una struttura predefiniti. Non si adatta perfettamente a righe e colonne. Per questo motivo, può essere difficile archiviarli, elaborarli e analizzarli utilizzando un sistema di gestione di database relazionali (RDBMS) tradizionale. Si tratta di informazioni in formato libero che confluiscono ogni giorno nei sistemi aziendali. Considera l'impatto sulle architetture aziendali:

  • Rappresenta la maggior parte dello spazio di archiviazione aziendale: questo tipo di dati costituisce in realtà circa il 70-90% di tutte le informazioni che un'azienda raccoglie oggi 
  • Include i tipi di file di uso quotidiano: lo usi costantemente sotto forma di file di testo, email, video, immagini, registrazioni audio e post sui social media
  • Mette alla prova l'architettura moderna: man mano che l'applicazione cresce, capire come gestire questo enorme volume di dati variegati diventa un obiettivo primario per sviluppatori e architetti di sistema

Quali sono le principali sfide della gestione dei dati non strutturati?

In diversi settori si è assistito a una rapida crescita delle origini dati non strutturate, il che presenta alcune sfide architettoniche specifiche:

  • Generazione massiva di dati: le applicazioni moderne generano costantemente email, PDF, flussi di sensori IoT, filmati di sorveglianza, contenuti di social media, registrazioni vocali e immagini satellitari. Gli utenti creano questi contenuti su scale di terabyte e petabyte, che possono accumularsi rapidamente.
  • Il divario dei database tradizionali: gli RDBMS sono stati creati per dati strutturati e tabulari. Semplicemente non possono archiviare, indicizzare o eseguire query in modo efficiente su formati in formato libero.
  • Rischi legati a prestazioni e costi: se provi a forzare un file video o un flusso di sensori non elaborati in una tabella SQL standard, le prestazioni della tua applicazione possono diminuire mentre i costi aumentano.

Trovare un modo per acquisire, archiviare e comprendere queste informazioni non strutturate è un problema fondamentale che le moderne architetture di dati devono risolvere.

Quali sono le caratteristiche dei dati non strutturati?

La caratteristica distintiva dei dati non strutturati è la mancanza di un modello di dati predefinito. Arriva in diversi formati, come testo, immagini, video, audio e telemetria IoT. A differenza dei dati puliti dei fogli di lavoro, queste informazioni di solito si accumulano in un volume enorme, nell'ordine dei petabyte. È complesso, altamente variabile e in continua evoluzione.

L'elaborazione di questi file in formato libero richiede un approccio tecnico completamente diverso per alcuni motivi principali:

  • I database tradizionali non sono sufficienti: poiché i dati non strutturati sono completamente in formato libero, i database SQL standard non possono leggerli o eseguire query in modo nativo
  • SQL ha limiti chiari: non puoi scrivere un semplice comando SQL per trovare l'umore generale di una chiamata all'assistenza clienti o identificare un oggetto specifico in una foto
  • Sono necessari strumenti specializzati: per dare un senso a queste informazioni, le organizzazioni devono affidarsi a soluzioni appositamente create
  • L'AI guida l'analisi: i team utilizzano l'intelligenza artificiale, il machine learning e l'elaborazione del linguaggio naturale per scansionare, interpretare ed estrarre valore dal caos

È utile confrontare questi formati per capire come si integrano tra loro. I dati strutturati si basano su SQL, applicano schemi rigidi e sono facilmente ricercabili. I dati non strutturati sono privi di schema, difficili da cercare in modo nativo e richiedono soluzioni di data lake o database NoSQL. Nel mezzo si trovano i dati semistrutturati, come JSON o XML, che contengono alcuni tag organizzativi ma non hanno uno schema relazionale rigido.

Tipo di dati

Modello dei dati

Spazio di archiviazione

Metodo di query

Esempi

Profilo del volume

Dati strutturati

Schema rigido e predefinito

Database relazionali

SQL

Documenti finanziari, inventario

Moderata

e semistrutturati

Flessibile, autodescrittivo

NoSQL, archivi di documenti

API NoSQL, estensioni SQL

JSON, XML, CSV

crescere

Dati non strutturati

Nessun modello predefinito

Data lake, archiviazione di oggetti, NoSQL


AI, ML, NLP, indici di ricerca

Testo, video, immagini, audio

Dominante all'85-90%


Tipo di dati

Modello dei dati

Spazio di archiviazione

Metodo di query

Esempi

Profilo del volume

Dati strutturati

Schema rigido e predefinito

Database relazionali

SQL

Documenti finanziari, inventario

Moderata

e semistrutturati

Flessibile, autodescrittivo

NoSQL, archivi di documenti

API NoSQL, estensioni SQL

JSON, XML, CSV

crescere

Dati non strutturati

Nessun modello predefinito

Data lake, archiviazione di oggetti, NoSQL


AI, ML, NLP, indici di ricerca

Testo, video, immagini, audio

Dominante all'85-90%


Utilizzo di dati non strutturati con Google Cloud

Per creare la pipeline di dati giusta, è utile sapere esattamente con che tipo di informazioni hai a che fare e come i team aziendali utilizzano effettivamente i database Google Cloud per gestirle. Puoi suddividere i dati non strutturati in due categorie principali: generati dall'uomo e generati dalla macchina.

Dati non strutturati generati da persone

Questi sono esempi dei contenuti che i tuoi utenti e dipendenti creano manualmente ogni giorno.

  • Documenti di testo e comunicazioni: per molte applicazioni, i dati non strutturati possono presentarsi sotto forma di enormi volumi di email, messaggi di chat e ticket di assistenza clienti
  • Caso d'uso: gli sviluppatori possono creare una pipeline di elaborazione del linguaggio naturale (NLP) in cui i ticket di assistenza non elaborati vengono inseriti in Cloud Storage. Da lì, Gemini Enterprise Agent Platform scansiona il testo per trovare il problema principale e il sistema salva i tag appena strutturati direttamente in un database Firestore. Poiché Firestore sincronizza i dati istantaneamente, la tua app web interna si aggiorna in tempo reale, indirizzando i bug urgenti direttamente al team di progettazione giusto.
  • Rich media: include file audio dei call center, immagini caricate dagli utenti e registrazioni video
  • Caso d'uso: se crei un'app per le assicurazioni, ti serve un modo per elaborare le foto degli incidenti automobilistici che gli utenti caricano dai loro smartphone. Puoi salvare questi file pesanti in Cloud Storage, utilizzare un modello di machine learning per stimare i danni visivi e quindi archiviare la stima di riparazione strutturata in un database AlloyDB per PostgreSQL. Questo può aiutare le tue applicazioni aziendali standard ad accedere in modo rapido e affidabile ai risultati dell'AI.

Dati non strutturati generati da macchine

Computer, sensori e server creano enormi quantità di dati in background senza alcun input umano.

  • Dati dei sensori IoT e telemetria: le macchine di fabbrica, i termostati intelligenti e le auto connesse trasmettono costantemente flussi di dati non elaborati. Gran parte di questa telemetria non elaborata arriva in formati complessi, nidificati e in formato libero.
  • Caso d'uso: uno stabilimento di produzione trasmette in streaming milioni di eventi audio e di sensori non elaborati al secondo. Poiché le tabelle relazionali standard non sono in grado di gestire questa velocità di importazione, gli sviluppatori utilizzano Bigtable. Bigtable assorbe questi dati di serie temporali a throughput elevato senza ritardi. Quindi, i modelli di ML leggono i dati per individuare il suono specifico di una parte difettosa, il che può contribuire ad attivare la manutenzione predittiva prima che la macchina si rompa fisicamente.
  • Immagini satellitari e video di sorveglianza: le telecamere di sicurezza e i satelliti meteorologici generano flussi di dati visivi pesanti e continui.
  • Caso d'uso: una società di spedizioni globale genera flussi pesanti di video satellitari non elaborati. Archivia questi file di grandi dimensioni in modo conveniente in Cloud Storage, utilizza la computer vision per identificare le navi cargo e quindi invia questi aggiornamenti strutturati sulla posizione a Spanner. In questo modo, le app della catena di fornitura globale possono disporre di un database relazionale estremamente accurato e senza tempi di inattività per eseguire query per il monitoraggio in tempo reale.

Archiviazione di dati non strutturati: data lake e data warehouse aziendale

Per creare un'applicazione scalabile, gli sviluppatori possono abbinare i propri dati all'ambiente di archiviazione giusto. I dati strutturati e non strutturati richiedono architetture completamente diverse per mantenere le prestazioni e contenere i costi dell'infrastruttura.

Per i dati strutturati, le organizzazioni si affidano a un data warehouse aziendale (EDW). Questo ambiente è creato appositamente per gestire informazioni che seguono regole rigide e formati prevedibili.

  • Puoi utilizzare un data warehouse aziendale per centralizzare le informazioni strutturate provenienti da più database relazionali, inclusi i sistemi di fatturazione e gli strumenti di gestione delle relazioni con i clienti
  • Il tuo team deve pulire e formattare i dati prima di salvarli in modo che ogni informazione si adatti perfettamente a una tabella predefinita
  • Gli strumenti di business intelligence possono quindi eseguire query SQL complesse su miliardi di righe in pochi secondi per fornire report e previsioni storiche affidabili

I dati non strutturati richiedono un approccio molto più flessibile. Poiché i file di grandi dimensioni come video, registrazioni audio e log di testo non elaborati non si adattano a tabelle ordinate, gli sviluppatori utilizzano data lake e bucket di archiviazione cloud per contenerli.

  • Un data lake fornisce un repository flessibile in cui puoi archiviare i file nei loro formati nativi non elaborati senza doverli prima forzare in una struttura specifica
  • I bucket Cloud Storage alimentano questi data lake utilizzando l'archiviazione di oggetti, consentendo al tuo sistema di fare lo scale up fino a petabyte di capacità senza richiedere la ricostruzione dei database.
  • L'archiviazione di file pesanti non strutturati in un database tradizionale è incredibilmente costosa, il che rende i bucket di archiviazione un'opzione molto più conveniente per grandi volumi di dati
  • Mantenere i dati nella loro forma non elaborata significa che le pipeline di intelligenza artificiale e machine learning possono facilmente estrarre i file di cui hanno bisogno per addestrare i modelli di visione artificiale e di elaborazione del linguaggio naturale

Domande frequenti

Ecco le risposte alle domande più comuni che sviluppatori e architetti si pongono sui dati non strutturati.

Gli esempi più comuni includono contenuti generati da persone come email, post sui social media, PDF e file audio o video. Vedrai anche formati generati dalle macchine, come immagini satellitari e telemetria dei sensori IoT. Questi formati diversi e liberi costituiscono la stragrande maggioranza dei dati aziendali quotidiani e non possono essere organizzati in modo ordinato in righe e colonne di database standard.


Un file CSV è generalmente considerato un dato strutturato o semistrutturato perché utilizza righe, colonne e un delimitatore coerente. Anche se non applica rigorosamente lo schema relazionale, il suo formato tabulare lo rende altamente organizzato. Questo rende un file CSV molto più strutturato rispetto ai veri dati non strutturati come video, immagini o testo in formato libero.


SQL è il linguaggio di query standard utilizzato per i dati relazionali strutturati, non un tipo di dati. Si basa su schemi e tabelle rigidi per recuperare le informazioni. Pertanto, non può eseguire query in modo nativo su dati non strutturati come immagini, audio o testo in formato libero senza ulteriori elaborazioni o estensioni.

Puoi identificare i dati non strutturati per la mancanza di un modello di dati predefinito. Se le informazioni non si adattano perfettamente a righe e colonne e non puoi interrogarle direttamente utilizzando SQL, è probabile che non siano strutturate. Gli indicatori pratici includono formati testuali come email e log di chat, nonché formati non testuali come video, immagini, audio e dati dei sensori.


Il corpo effettivo di un'email è non strutturato perché è costituito da testo in formato libero senza uno schema fisso. Tuttavia, i metadati associati, come mittente, destinatario, timestamp e riga dell'oggetto, sono strutturati. Questa duplice natura è molto comune e spiega perché le organizzazioni utilizzano l'NLP e l'AI per estrarre insight dai contenuti delle email su larga scala.



I dati strutturati si basano su uno schema fisso e risiedono in database relazionali che utilizzano tabelle SQL. I dati semi-strutturati contengono alcuni elementi organizzativi, ma non hanno uno schema rigido. Esempi comuni sono i file JSON, XML e CSV. I dati non strutturati non hanno un formato predefinito, includono file come video e testo in formato libero e costituiscono la stragrande maggioranza dei dati aziendali.

Quali sono i vantaggi dell'analisi dei dati non strutturati?

Sbloccare le informazioni nascoste in testi, immagini e video può dare alla tua organizzazione un enorme vantaggio. Ecco alcuni dei principali vantaggi di strutturare i dati non strutturati:

Approfondimenti più dettagliati sui clienti:

I database tradizionali ti dicono cosa ha acquistato un cliente. I dati non strutturati possono aiutare a spiegarne il motivo. Analizzando i post sui social media, le recensioni prodotto e le chiamate all'assistenza clienti, puoi misurare il sentiment emotivo e capire esattamente cosa vogliono gli utenti.Questo ti aiuta a creare prodotti che risolvano davvero i loro problemi.

Migliore efficienza operativa:

Puoi risparmiare tempo e risorse automatizzando le attività manuali. Gli strumenti di elaborazione del linguaggio naturale possono leggere le email di assistenza in arrivo e indirizzarle immediatamente al reparto giusto. Possono anche analizzare contratti legali complessi per estrarre automaticamente date e termini chiave.

Gestione proattiva dei rischi:

Le aziende devono proteggere i dati sensibili, ma trovare informazioni personali nascoste all'interno di un enorme data lake può essere difficile. I modelli di machine learning possono scansionare rapidamente milioni di documenti e immagini in formato libero per individuare e proteggere i dati sensibili. In questo modo, la tua attività può rispettare le rigide leggi sulla privacy.

Manutenzione e monitoraggio predittivi:

Analizzando i log degli eventi non strutturati e i flussi di sensori IoT, i modelli di AI possono individuare pattern sottili che gli esseri umani potrebbero non notare. Ad esempio, possono identificare l'esatta frequenza audio che indica che una macchina sta per guastarsi. Questo ti consente di riparare le attrezzature prima che si rompano, riducendo i costosi tempi di inattività.

Modelli di AI e machine learning più potenti:

I modelli di AI hanno bisogno di enormi quantità di informazioni per apprendere e migliorare. Fornendo ai tuoi modelli un mix diversificato di dati non strutturati, come immagini, audio e testo in formato libero, offri loro una visione molto più ampia del mondo reale. In questo modo, i modelli vengono addestrati a generare previsioni più accurate e affidabili.

In che modo l'AI e il machine learning sbloccano il valore dei dati non strutturati

Per ottenere un valore significativo da questi file complessi, è necessario un framework dedicato. L'intelligenza artificiale e il machine learning possono fungere da motore per questo processo. Una pipeline automatizzata assistita dall'AI può, ad esempio, aiutare a trasformare un file video o un documento di testo non elaborato da un enorme blocco di codice binario in dati leggibili.

Gli sviluppatori applicano tecniche di AI specifiche per elaborare diversi tipi di file, tra cui:

  • NLP per leggere documenti con molto testo come email, ticket di assistenza e contratti legali
  • Visione artificiale per analizzare immagini e video, che aiuta in attività come la revisione di filmati di sorveglianza, la valutazione di immagini mediche o l'elaborazione di foto satellitari
  • Modelli di conversione da voce a testo per trascrivere file audio in modo che il testo diventi ricercabile

Ecco una panoramica di come una pipeline di AI moderna elabora queste informazioni per fornire soluzioni concrete:

  1. Raccogli origini non strutturate: i dati non elaborati vengono costantemente generati da utenti, dispositivi e applicazioni. Tra gli esempi più comuni figurano email ricche di testo, file video, flussi di sensori IoT, PDF e post sui social media.
  2. Instradamento attraverso il livello di importazione: il sistema raccoglie in modo sicuro i dati in entrata e li indirizza alla destinazione di archiviazione corretta. Gli sviluppatori spesso utilizzano pipeline di dati ad alto volume, gateway API o caricamenti di file batch per spostare questi dati senza rallentare l'applicazione principale.
  3. Sicurezza nello strato di archiviazione: il sistema conserva le informazioni in modo sicuro in base alla frequenza e alla rapidità di accesso. Potresti utilizzare Cloud Storage per i data lake di dati non elaborati, Bigtable per i log IoT veloci o Firestore per contenuti di app flessibili.
  4. Analisi nel livello di elaborazione: è qui che i modelli di AI possono essere d'aiuto. Modelli di calcolo specializzati leggono, scansionano e interpretano i file in formato libero per trovare un significato utilizzando gli strumenti di NLP, visione artificiale e conversione della voce in testo menzionati sopra.
  5. Fornire il livello di insight: infine, il sistema trasforma i dati elaborati in una business intelligence chiara e fruibile. Si ottengono risultati preziosi come i punteggi del sentiment dei clienti dalle registrazioni dei call center, le classificazioni automatiche dei documenti per la conformità e gli avvisi di manutenzione predittiva dai sensori di fabbrica.
  6. Feedback e ottimizzazione continui: le previsioni dell'AI con bassa affidabilità vengono inviate a revisori umani per la verifica e la correzione. Questi dati appena corretti vengono reinseriti nel passaggio 1 come nuovi dati di addestramento per riaddestrare e migliorare i modelli di AI.Il sistema monitora costantemente l'accuratezza e la latenza del modello per garantire che l'AI non si degradi nel tempo.

Scegliere la soluzione di gestione dei dati non strutturati più adatta

La scelta di una soluzione di gestione dipende dal carico di lavoro specifico e dalla traiettoria di crescita. Potresti iniziare confrontando l'archiviazione di file on-prem con l'archiviazione di oggetti nel cloud. Con l'aumento della complessità, la scelta spesso si sposta verso un data lake cloud-native o una piattaforma completamente gestita integrata con l'AI.

Quando valuti le opzioni, considera questo elenco di controllo tecnico:

  • Architettura di archiviazione (basata su file, archiviazione di oggetti o data lake)
  • Scalabilità nell'ordine di petabyte con efficienza dei costi
  • Integrazione nativa di AI e ML (NLP, visione artificiale, incorporamenti)
  • Flessibilità NoSQL (Bigtable per carichi di lavoro ad alta velocità effettiva, Firestore per contenuti a livello di applicazione)
  • Funzionalità di governance dei dati, controllo degli accessi e conformità
  • Supporto multiformato (testo, immagine, video, audio, IoT)
  • Integrazione con warehouse, strumenti di BI e piattaforme di analisi esistenti
  • Costo totale di proprietà ai volumi di dati target

Funzionalità di archiviazione non strutturata create appositamente

Con la crescita dei carichi di lavoro di intelligenza artificiale, lo storage non è più solo un repository passivo. È un componente attivo del percorso di rendimento dell'AI. Per eliminare i rallentamenti dell'infrastruttura per sviluppatori e amministratori di database, Google Cloud ha introdotto diverse funzionalità avanzate di archiviazione non strutturata.

Se stai progettando un'architettura di dati ad alte prestazioni, ecco gli strumenti specifici che puoi utilizzare per elaborare e gestire formati non strutturati su larga scala:

  • Archiviazione intelligente per i metadati automatizzati: Archiviazione intelligente genera automaticamente il contesto, ad esempio le annotazioni delle immagini, per gli oggetti non strutturati esattamente quando vengono scritti nel bucket. In questo modo, gli sviluppatori non devono più creare pipeline di annotazione manuali e personalizzate. Dispone inoltre di un'integrazione del server Model Context Protocol (MCP), che consente agli agenti AI di leggere, scrivere e analizzare i dati di Cloud Storage in modo nativo.
  • Insight sui dati per i dati non strutturati: questa funzionalità di Knowledge Catalog utilizza Gemini Enterprise Agent Platform per analizzare i contenuti effettivi dei file non strutturati non elaborati, come i PDF, archiviati nel tuo data lake. Deduce automaticamente gli schemi ed estrae le relazioni, catalogando i file non strutturati direttamente nelle tabelle degli oggetti BigQuery in modo da poterli interrogare immediatamente. 
  • Cloud Storage Rapid: progettata specificamente per picchi improvvisi di elaborazione con l'AI, questa famiglia di archiviazione offre una larghezza di banda estremamente elevata e una bassa latenza. Rapid Bucket fornisce oltre 15 TB/s di larghezza di banda, mentre Rapid Cache accelera la velocità effettiva di lettura fino a 2,5 TB/s per attività intensive come il caricamento del modello, senza richiedere modifiche al codice dei bucket esistenti.
  • Managed Lustre: se i tuoi team dell'infrastruttura stanno creando cluster di addestramento su larga scala, Google Cloud Managed Lustre ora offre fino a 10 TB/s di velocità effettiva tramite RDMA(Remote Direct Memory Access). In questo modo, i tuoi acceleratori di computing ad alte prestazioni ricevono costantemente i dati di cui hanno bisogno senza ritardi. 
  • Istanze Z4M: per le organizzazioni che creano architetture di archiviazione personalizzate, la nuova istanza Z4M supporta file system paralleli affidabili con un massimo di 168 TiB di capacità SSD locale per istanza.

Utilizzando questi strumenti di archiviazione appositamente creati, ti assicuri che l'infrastruttura sottostante possa supportare senza sforzo l'enorme velocità effettiva e l'elevata concorrenza richieste dalle moderne applicazioni agentiche.



Fai il prossimo passo

Inizia a creare su Google Cloud con 300 $ di crediti gratuiti e oltre 20 prodotti Always Free.

Google Cloud