비정형 데이터는 사전 정의된 형식, 모델 또는 구조를 따르지 않는 정보입니다. 행과 열에 깔끔하게 들어맞지 않습니다. 이러한 특성 때문에 기존의 관계형 데이터베이스 관리 시스템(RDBMS)을 사용해 저장, 처리, 분석하기가 어려울 수 있습니다. 매일 비즈니스 시스템으로 유입되는 자유 형식의 정보입니다. 엔터프라이즈 아키텍처에 미치는 영향을 고려해 보세요.
여러 산업에서 비정형 데이터 소스가 급격히 증가하면서 다음과 같은 특정 아키텍처 문제가 발생하고 있습니다.
이러한 비정형 정보를 캡처, 저장, 이해하는 방법을 찾는 것은 최신 데이터 아키텍처가 해결해야 하는 핵심 문제입니다.
비정형 데이터의 가장 큰 특징은 사전 정의된 데이터 모델이 없다는 것입니다. 텍스트, 이미지, 동영상, 오디오, IoT 원격 분석 등 다양한 형식으로 제공됩니다. 정리된 스프레드시트 데이터와 달리 이러한 정보는 일반적으로 페타바이트 규모의 방대한 양으로 축적됩니다. 복잡하고, 변동성이 크며, 끊임없이 변화합니다.
이러한 자유 형식 파일을 처리하려면 몇 가지 주요 이유로 완전히 다른 기술적 접근 방식이 필요합니다.
이러한 형식을 대조해 보면 서로 어떻게 어울리는지 이해하는 데 도움이 됩니다. 정형 데이터는 SQL을 사용하고 엄격한 스키마를 적용하며 쉽게 검색할 수 있습니다. 비정형 데이터는 스키마가 없으며 기본적으로 검색하기 어렵고 데이터 레이크 또는 NoSQL 데이터베이스 솔루션이 필요합니다. 중간에는 JSON 또는 XML과 같은 반정형 데이터가 있습니다. 반정형 데이터에는 일부 조직 태그가 포함되어 있지만 엄격한 관계형 스키마는 없습니다.
데이터 유형 | 데이터 모델 | 스토리지 | 쿼리 메서드 | 예시 | 볼륨 프로필 |
구조화된 데이터 | 엄격하고 사전 정의된 스키마 | 관계형 데이터베이스 | SQL | 재무 기록, 인벤토리 | 보통 |
반정형 데이터 | 유연한 자체 설명 | NoSQL, 문서 저장소 | NoSQL API, SQL 확장 프로그램 | JSON, XML, CSV | 성장 |
비정형 데이터 | 사전 정의된 모델 없음 | 데이터 레이크, 객체 스토리지, NoSQL | AI, ML, NLP, 검색 색인 | 텍스트, 동영상, 이미지, 오디오 | 85%~90%로 우세 |
데이터 유형
데이터 모델
스토리지
쿼리 메서드
예시
볼륨 프로필
구조화된 데이터
엄격하고 사전 정의된 스키마
관계형 데이터베이스
SQL
재무 기록, 인벤토리
보통
반정형 데이터
유연한 자체 설명
NoSQL, 문서 저장소
NoSQL API, SQL 확장 프로그램
JSON, XML, CSV
성장
비정형 데이터
사전 정의된 모델 없음
데이터 레이크, 객체 스토리지, NoSQL
AI, ML, NLP, 검색 색인
텍스트, 동영상, 이미지, 오디오
85%~90%로 우세
적절한 데이터 파이프라인을 빌드하려면 어떤 종류의 정보를 다루고 있는지, 엔터프라이즈팀이 실제로 Google Cloud 데이터베이스를 사용하여 정보를 어떻게 관리하는지 정확히 파악하는 것이 좋습니다. 비정형 데이터는 인간이 생성한 데이터와 머신이 생성한 데이터라는 두 가지 주요 카테고리로 나눌 수 있습니다.
이는 사용자와 직원이 매일 수동으로 생성하는 콘텐츠의 예시입니다.
컴퓨터, 센서, 서버는 사람의 입력 없이도 백그라운드에서 엄청난 양의 데이터를 생성합니다.
확장 가능한 애플리케이션을 빌드하기 위해 개발자는 데이터를 적절한 스토리지 환경에 매칭할 수 있습니다. 정형 데이터와 비정형 데이터는 성능을 유지하고 인프라 비용을 관리 가능한 수준으로 유지하기 위해 완전히 다른 아키텍처가 필요합니다.
정형 데이터의 경우 조직은 엔터프라이즈 데이터 웨어하우스(EDW)를 사용합니다. 이 환경은 엄격한 규칙과 예측 가능한 형식을 따르는 정보를 처리하도록 특별히 설계되었습니다.
비정형 데이터에는 훨씬 더 유연한 접근방식이 필요합니다. 동영상, 오디오 녹음, 원시 텍스트 로그와 같은 대용량 파일은 깔끔한 테이블에 맞지 않기 때문에 개발자는 데이터 레이크와 Cloud Storage 버킷을 사용하여 이러한 파일을 보관합니다.
다음은 개발자와 설계자가 비정형 데이터에 관해 자주 묻는 질문에 대한 답변입니다.
일반적인 예로는 이메일, 소셜 미디어 게시물, PDF, 오디오 또는 동영상 파일과 같은 사람이 생성한 콘텐츠가 있습니다. 위성 이미지, IoT 센서 원격 분석과 같은 머신 생성 형식도 볼 수 있습니다. 이러한 다양한 자유 형식의 데이터는 일상적인 엔터프라이즈 데이터의 대부분을 차지하며 표준 데이터베이스 행과 열로 깔끔하게 정리할 수 없습니다.
CSV 파일은 행, 열, 일관된 구분자를 사용하므로 일반적으로 정형 또는 반정형 데이터로 간주됩니다. 엄격한 관계형 스키마 적용은 없지만 테이블 형식으로 되어 있어 고도로 체계적입니다. 따라서 CSV는 동영상, 이미지, 자유 형식 텍스트와 같은 진정한 비정형 데이터보다 훨씬 더 정형화되어 있습니다.
SQL은 데이터 유형 자체가 아니라 정형 관계형 데이터에 사용되는 표준 쿼리 언어입니다. 엄격한 스키마와 테이블에 의존하여 정보를 검색합니다. 따라서 추가 처리나 확장 프로그램 없이는 이미지, 오디오, 자유 형식 텍스트와 같은 비정형 데이터를 기본적으로 쿼리할 수 없습니다.
비정형 데이터는 사전 정의된 데이터 모델이 없다는 특징으로 식별할 수 있습니다. 정보가 행과 열에 깔끔하게 맞지 않고 SQL을 사용하여 직접 쿼리할 수 없는 경우 비정형일 가능성이 높습니다. 실용적인 지표에는 이메일 및 채팅 로그와 같은 텍스트 형식뿐만 아니라 동영상, 이미지, 오디오, 센서 데이터와 같은 비텍스트 형식도 포함됩니다.
이메일의 실제 본문은 고정된 스키마가 없는 자유 형식 텍스트로 구성되어 있으므로 비정형입니다. 그러나 발신자, 수신자, 타임스탬프, 제목과 같은 관련 메타데이터는 정형 데이터입니다. 이러한 이중적 특성은 매우 일반적이며 조직에서 NLP와 AI를 사용하여 이메일 콘텐츠에서 대규모로 인사이트를 추출하는 이유를 설명해 줍니다.
정형 데이터는 고정된 스키마를 사용하며 SQL 테이블을 사용하는 관계형 데이터베이스에 저장됩니다. 반정형 데이터는 일부 조직적 요소를 포함하지만 엄격한 스키마가 없으며, 일반적인 예로는 JSON, XML, CSV 파일이 있습니다. 비정형 데이터는 사전 정의된 형식이 없으며 동영상, 자유 형식 텍스트 등의 파일이 포함되어 있고 기업 데이터의 대부분을 차지합니다.
대부분의 엔터프라이즈 아키텍처는 결국 단일 스토리지 플랫폼을 넘어 확장됩니다. 시스템이 확장됨에 따라 데이터 레이크와 스토리지 버킷은 자연스럽게 여러 리전과 클라우드 제공업체에 분산됩니다. 이러한 단편화는 모든 비정형 파일에 한 번에 액세스해야 하는 머신러닝 파이프라인을 빌드하려고 할 때 제약이 됩니다.
Google Cloud는 에이전트형 데이터 클라우드를 통해 이러한 특정 아키텍처 과제를 해결합니다. 분산된 스토리지 환경을 하나의 통합 액세스 포인트로 연결하는 AI 네이티브 크로스 클라우드 레이크하우스를 특징으로 합니다.
텍스트, 이미지, 동영상에 숨겨진 정보를 활용하면 조직에 큰 이점을 가져다줄 수 있습니다. 비정형 데이터에 구조를 적용하면 다음과 같은 이점이 있습니다.
더욱 심층적인 고객 인사이트:
기존 데이터베이스는 고객이 무엇을 구매했는지 알려줍니다. 비정형 데이터는 그 이유를 설명하는 데 도움이 될 수 있습니다. 소셜 미디어 게시물, 제품 리뷰, 고객 지원 통화를 분석하여 감정을 식별하고 사용자가 원하는 바를 정확히 파악할 수 있습니다. 이를 통해 사용자의 문제를 진정으로 해결하는 제품을 만들 수 있습니다.
운영 효율성 개선:
수동 작업을 자동화하여 시간과 리소스를 절약할 수 있습니다. 자연어 처리 도구는 수신되는 지원 이메일을 읽고 즉시 적절한 부서로 전달할 수 있습니다. 또한 복잡한 법률 계약을 스캔하여 주요 날짜와 조건을 자동으로 추출할 수 있습니다.
위험 사전 관리:
기업은 민감한 정보를 보호해야 하지만, 대규모 데이터 레이크에 숨겨진 개인 정보를 찾는 것은 어려울 수 있습니다. 머신러닝 모델은 수백만 개의 자유 형식 문서와 이미지를 빠르게 스캔하여 민감한 정보를 찾아 보호할 수 있습니다. 이를 통해 비즈니스는 엄격한 개인 정보 보호법을 준수할 수 있습니다.
예측 유지보수 및 모니터링:
AI 모델은 비정형 이벤트 로그와 IoT 센서 스트림을 분석하여 사람이 놓칠 수 있는 미묘한 패턴을 찾아낼 수 있습니다. 예를 들어, 기계 고장 전조 증상을 나타내는 정확한 오디오 주파수를 식별할 수 있습니다. 이를 통해 장비가 고장 나기 전에 수리하여 비용이 많이 드는 다운타임을 줄일 수 있습니다.
더 강력한 AI 및 머신러닝 모델:
AI 모델은 학습하고 개선하기 위해 방대한 양의 정보가 필요합니다. 이미지, 오디오, 자유 형식 텍스트와 같은 다양한 비정형 데이터를 모델에 공급하면 모델이 실제 세계를 훨씬 더 폭넓게 파악할 수 있습니다. 이를 통해 모델을 학습시켜 보다 정확하고 신뢰할 수 있는 예측을 생성할 수 있습니다.
이러한 복잡한 파일에서 의미 있는 가치를 얻으려면 전용 프레임워크가 필요합니다. 인공지능과 머신러닝은 이 프로세스의 엔진 역할을 할 수 있습니다. 예를 들어 AI 지원 자동화 파이프라인은 동영상 파일이나 원시 텍스트 문서를 대규모 바이너리 코드 블록에서 읽을 수 있는 데이터로 변환하는 데 도움이 될 수 있습니다.
개발자는 다음과 같은 다양한 유형의 파일을 처리하기 위해 특정 AI 기법을 적용합니다.
최신 AI 파이프라인이 이 정보를 처리하여 실제 솔루션을 도출하는 방법을 자세히 살펴보겠습니다.
관리 솔루션 선택은 구체적인 워크로드와 성장 궤도에 따라 달라집니다. 온프렘 파일 스토리지와 클라우드 객체 스토리지를 비교하는 것으로 시작할 수 있습니다. 복잡성이 증가함에 따라 클라우드 네이티브 데이터 레이크 또는 완전 관리형 AI 통합 플랫폼으로 전환하는 경우가 많습니다.
옵션을 평가할 때는 다음 기술 체크리스트를 고려하세요.
인공지능 워크로드가 증가함에 따라 스토리지는 더 이상 수동적인 저장소에 그치지 않습니다. 이는 AI 성능 경로의 활성 구성요소입니다. 개발자와 데이터베이스 관리자의 인프라 속도 저하를 없애기 위해 Google Cloud는 몇 가지 고급 비정형 스토리지 기능을 도입했습니다.
고성능 데이터 아키텍처를 설계하는 경우 비정형 형식을 대규모로 처리하고 관리하는 데 사용할 수 있는 구체적인 도구는 다음과 같습니다.
이러한 목적에 맞게 빌드된 스토리지 도구를 활용하면 기본 인프라가 최신 에이전트형 애플리케이션에 필요한 대규모 처리량과 높은 동시 실행을 손쉽게 지원할 수 있습니다.