Template Kompresi Massal File Cloud Storage

Template Kompresi Massal File Cloud Storage adalah pipeline batch yang mengompresi file di Cloud Storage ke lokasi tertentu. Template ini dapat berguna saat Anda perlu mengompresi batch besar file sebagai bagian dari proses pengarsipan berkala. Mode kompresi yang didukung adalah: BZIP2, DEFLATE, GZIP. File yang dikeluarkan ke lokasi tujuan akan mengikuti skema penamaan nama file asli yang ditambahkan dengan ekstensi mode kompresi. Ekstensi yang ditambahkan akan menjadi salah satu dari: .bzip2, .deflate, .gz.

Setiap error yang terjadi selama proses kompresi akan ditampilkan ke file kegagalan dalam format CSV dari nama file, pesan error. Jika tidak terjadi kegagalan saat menjalankan pipeline, file error tetap akan dibuat, tetapi tidak berisi data error.

Persyaratan pipeline

  • Kompresi harus dalam salah satu format berikut: BZIP2, DEFLATE, GZIP.
  • Direktori output harus ada sebelum menjalankan pipeline.

Parameter template

Parameter yang diperlukan

  • inputFilePattern: Lokasi Cloud Storage dari file yang ingin Anda proses. Contoh, gs://your-bucket/your-files/*.txt.
  • outputDirectory: Jalur dan awalan nama file untuk menulis file output. Harus diakhiri dengan garis miring. Pemformatan DateTime digunakan untuk mengurai jalur direktori untuk pemformat tanggal & waktu. Contoh, gs://your-bucket/your-path.
  • outputFailureFile: File output log error yang akan digunakan untuk kegagalan penulisan yang terjadi selama kompresi. Kontennya akan berupa satu baris untuk setiap file yang gagal dikompresi. Perhatikan bahwa parameter ini akan memungkinkan pipeline terus diproses jika terjadi kegagalan. Contoh, gs://your-bucket/compressed/failed.csv.
  • compression: Algoritma kompresi yang digunakan untuk mengompresi file yang cocok. Algoritma yang valid: BZIP2, DEFLATE, GZIP.

Parameter opsional

  • outputFilenameSuffix: Suffix nama file output dari file yang akan ditulis. Secara default adalah .bzip2, .deflate, atau .gz, bergantung pada algoritma kompresi.

Menjalankan template

Konsol

  1. Buka halaman Dataflow Membuat tugas dari template.
  2. Buka Membuat tugas dari template
  3. Di kolom Nama tugas, masukkan nama tugas yang unik.
  4. Opsional: Untuk Endpoint regional, pilih nilai dari menu drop-down. Region default-nya adalah us-central1.

    Untuk mengetahui daftar region tempat Anda dapat menjalankan tugas Dataflow, lihat Lokasi Dataflow.

  5. Dari menu drop-down Template Dataflow, pilih template Bulk Compress Files on Cloud Storage.
  6. Di kolom parameter yang disediakan, masukkan nilai parameter Anda.
  7. Klik Jalankan tugas.

gcloud

Di shell atau terminal Anda, jalankan template:

gcloud dataflow jobs run JOB_NAME \
    --gcs-location gs://dataflow-templates/VERSION/Bulk_Compress_GCS_Files \
    --region REGION_NAME \
    --parameters \
inputFilePattern=gs://BUCKET_NAME/uncompressed/*.txt,\
outputDirectory=gs://BUCKET_NAME/compressed,\
outputFailureFile=gs://BUCKET_NAME/failed/failure.csv,\
compression=COMPRESSION

Ganti kode berikut:

  • JOB_NAME: nama tugas unik pilihan Anda
  • REGION_NAME: region tempat Anda ingin men-deploy tugas Dataflow—misalnya, us-central1
  • VERSION: versi template yang ingin Anda gunakan

    Anda dapat menggunakan nilai berikut:

    • latest untuk menggunakan template versi terbaru, yang tersedia di folder induk tanpa tanggal di bucket— gs://dataflow-templates/latest/
    • nama versi, seperti 2023-09-12-00_RC00, untuk menggunakan template versi tertentu, yang dapat ditemukan bertingkat di masing-masing folder induk yang diberi tanggal dalam bucket— gs://dataflow-templates/
  • BUCKET_NAME: nama bucket Cloud Storage Anda
  • COMPRESSION: algoritma kompresi pilihan Anda

API

Untuk menjalankan template menggunakan REST API, kirim permintaan POST HTTP. Untuk mengetahui informasi selengkapnya tentang API dan cakupan otorisasinya, lihat projects.templates.launch.

POST https://dataflow.googleapis.com/v1b3/projects/PROJECT_ID/locations/LOCATION/templates:launch?gcsPath=gs://dataflow-templates/VERSION/Bulk_Compress_GCS_Files
{
   "jobName": "JOB_NAME",
   "parameters": {
       "inputFilePattern": "gs://BUCKET_NAME/uncompressed/*.txt",
       "outputDirectory": "gs://BUCKET_NAME/compressed",
       "outputFailureFile": "gs://BUCKET_NAME/failed/failure.csv",
       "compression": "COMPRESSION"
   },
   "environment": { "zone": "us-central1-f" }
}

Ganti kode berikut:

  • PROJECT_ID: Google Cloud Project ID tempat Anda ingin menjalankan tugas Dataflow
  • JOB_NAME: nama tugas unik pilihan Anda
  • LOCATION: region tempat Anda ingin men-deploy tugas Dataflow—misalnya, us-central1
  • VERSION: versi template yang ingin Anda gunakan

    Anda dapat menggunakan nilai berikut:

    • latest untuk menggunakan template versi terbaru, yang tersedia di folder induk tanpa tanggal di bucket— gs://dataflow-templates/latest/
    • nama versi, seperti 2023-09-12-00_RC00, untuk menggunakan template versi tertentu, yang dapat ditemukan bertingkat di masing-masing folder induk yang diberi tanggal dalam bucket— gs://dataflow-templates/
  • BUCKET_NAME: nama bucket Cloud Storage Anda
  • COMPRESSION: algoritma kompresi pilihan Anda

Langkah berikutnya