Lompat ke konten utama

Data Quality & Entity Resolution

Berhenti menyerahkan data kotor ke tim data Anda

Dataklin dipakai data engineer untuk memprofilkan, memvalidasi, mendeduplikasi, dan menstandardisasi data sebelum diserahkan ke data scientist dan analyst — supaya beban pembersihan tidak terus berpindah ke hilir.

  • Tanpa kode untuk rule dasar
  • Audit trail penuh
  • PII ter-mask saat ekspor
Komposisi khas dataset mentah
Terpantau
  • Sudah bersih73%Lolos semua rule
  • Duplikat12%Terdeteksi entity resolution
  • Format tidak konsisten9%HP, tanggal, alamat
  • Kosong / anomali6%IQR + z-score
  • Total 100 baris · 27% bermasalah

Setiap kotak mewakili 1% baris. Bagian yang bermasalah inilah yang biasanya baru ketahuan setelah data sampai ke tim analitik.

5
dimensi kualitas diukur
9
tipe rule bawaan
2
database terhubung langsung
3
kanal notifikasi

Semua yang dibutuhkan untuk menyiapkan data

Dari profiling awal sampai monitoring setelah data dipakai — satu tempat, satu audit trail.

  • Profiling & Scorecard
    • Profiling otomatis: statistik lengkap per kolom
    • Skor kualitas 0–100 dengan histori tren
    • Scorecard siap ekspor PDF/CSV
    • Data dictionary: skema + rule aktif per kolom
  • Rule Engine & Validasi
    • Rule siap pakai: email, HP Indonesia, NIK, tanggal, rentang angka
    • Regex kustom & aturan antar kolom
    • Halaman violation: lihat baris mana yang gagal
    • Referential integrity: deteksi foreign key terputus
  • Rule dari Bahasa Natural (AI)
    • Tulis aturan dalam bahasa sehari-hari → rule terstruktur
    • Auto-suggest rule proaktif dari skema dataset
    • Selalu lewat review Anda sebelum aktif
    • Nonaktif secara graceful jika LLM belum dikonfigurasi
  • Entity Resolution & Golden Record
    • Blocking key + fuzzy match → cluster duplikat
    • Review queue: konfirmasi, split, atau keluarkan record
    • Cluster cohesion scoring
    • Survivorship configurable per kolom + pratinjau live
  • Standardisasi & Anomali
    • Normalisasi HP, email, nama, alamat, tanggal
    • Pratinjau sebelum apply — tidak ada perubahan diam-diam
    • Deteksi outlier IQR + z-score dengan penjelasan
    • Consistency check nilai yang sama antar dua sistem
  • Monitoring & Alert
    • Drift monitoring terjadwal: re-validasi otomatis
    • Alert saat skor kualitas turun melewati ambang
    • Timeliness/freshness check + alert keterlambatan
    • Notifikasi Email, Slack, dan Webhook
  • PII & Governance
    • Deteksi PII: NIK, nomor HP, email, nama, alamat
    • Opsi masking saat ekspor
    • Autentikasi JWT + role admin/analyst/viewer
    • Audit trail pada golden record
  • Sumber Data & Ekspor
    • Upload CSV/XLSX: delimiter, encoding, tipe terdeteksi otomatis
    • Koneksi langsung PostgreSQL & MySQL
    • Clean dataset export: terstandardisasi + terdedup
    • API key per organisasi untuk akses programatik

Cara kerjanya

Data mengalir lewat lima tahap. Setiap tahap menyisakan jejak: baris mana yang gugur, karena rule apa, dan siapa yang menyetujui penggabungan.

Baris mentah masuk1.000.000 baris · 100.0% dari totalLolos parsing & standardisasi987.000 baris · 98.7% dari total · 98.7% lolos tahap iniLolos validasi rule912.000 baris · 91.2% dari total · 92.4% lolos tahap iniUnik setelah entity resolution847.000 baris · 84.7% dari total · 92.9% lolos tahap iniGolden record siap konsumsi841.000 baris · 84.1% dari total · 99.3% lolos tahap ini

Penurunan terbesar: Lolos validasi rule(−75.000 baris)Angka ilustratif untuk menjelaskan alur.

Lihat tahapan sebagai daftar
  1. Baris mentah masukUpload CSV/XLSX atau tarik dari PostgreSQL/MySQL1.000.000 baris · 100.0% dari total
  2. Lolos parsing & standardisasiNormalisasi HP, email, nama, alamat, tanggal987.000 baris · 98.7% dari total · 98.7% lolos · turun 13.000 baris
  3. Lolos validasi ruleRule engine + rule hasil generate LLM912.000 baris · 91.2% dari total · 92.4% lolos · turun 75.000 baris
  4. Unik setelah entity resolutionBlocking key + fuzzy match → cluster847.000 baris · 84.7% dari total · 92.9% lolos · turun 65.000 baris
  5. Golden record siap konsumsiSurvivorship + audit trail841.000 baris · 84.1% dari total · 99.3% lolos · turun 6.000 baris

Setiap keputusan tercatat

Golden record menyimpan asal nilai dan siapa yang menyetujuinya.

Berjalan terjadwal

Scheduler mengulang validasi dan memberi tahu saat skor turun.

Siap dikonsumsi

API key per organisasi untuk mengambil data bersih secara programatik.

Contoh use case

Tiga skenario yang paling sering muncul, dengan kondisi data sebelum dan sesudah diproses.

Angka pada bagian ini ilustratif — dibuat untuk menggambarkan bentuk masalah dan hasilnya, bukan hasil pengukuran pelanggan.

Kesehatan / Layanan Publik

Satu identitas pasien dari banyak faskes

Pasien yang sama terdaftar berulang di beberapa fasilitas dengan ejaan nama berbeda, NIK tidak lengkap, dan format nomor HP campur-campur. Laporan cakupan jadi menggelembung.

Yang dilakukan Dataklin

  • Blocking key pada NIK + tanggal lahir, fuzzy match pada nama & alamat
  • Rule NIK 16 digit dan normalisasi HP ke format +62
  • Review queue untuk cluster yang skor kohesinya rendah
  • Golden record dengan survivorship 'data terbaru menang'

Sebelum → Sesudah

Perbandingan kondisi data sebelum dan sesudah diproses Dataklin
MetrikSebelumSesudah
Baris duplikatmakin rendah makin baik12,4%0,3%
NIK validmakin tinggi makin baik78%99,1%
Format HP seragammakin tinggi makin baik61%100%

Ritel / Multi-cabang

Konsolidasi CRM dari 30 cabang

Tiap cabang punya spreadsheet sendiri. Nama pelanggan sama muncul di beberapa cabang, kolom wajib banyak yang kosong, dan tidak ada yang tahu versi mana yang benar.

Yang dilakukan Dataklin

  • Tarik langsung dari PostgreSQL tiap cabang, bukan ekspor manual
  • Auto-suggest rule dari skema untuk kolom yang belum punya aturan
  • Consistency check: nilai berbeda untuk kunci pelanggan yang sama
  • Clean dataset export untuk dipakai tim analitik

Sebelum → Sesudah

Perbandingan kondisi data sebelum dan sesudah diproses Dataklin
MetrikSebelumSesudah
Skor kualitasmakin tinggi makin baik54/10093/100
Kolom wajib kosongmakin rendah makin baik18%1,2%
Waktu konsolidasimakin rendah makin baik3 minggu2 hari

Data Science / ML

Data siap latih tanpa pembersihan ulang

Data scientist menghabiskan sebagian besar waktu membersihkan ulang data yang sama setiap kali ada permintaan baru — dan tiap orang membersihkannya dengan cara berbeda.

Yang dilakukan Dataklin

  • Rule & standardisasi dijalankan sekali di hulu, dipakai semua konsumen
  • Data dictionary sebagai kontrak skema yang bisa dibaca mesin
  • PII di-mask saat ekspor, jadi dataset aman dibagikan
  • Drift monitoring memberi tahu saat distribusi berubah

Sebelum → Sesudah

Perbandingan kondisi data sebelum dan sesudah diproses Dataklin
MetrikSebelumSesudah
Waktu data prepmakin rendah makin baik60% waktu kerja15% waktu kerja
Dataset punya kontrak skemamakin tinggi makin baik0%100%
Kebocoran PII ke notebookmakin rendah makin baikTidak terkontrolTer-mask

Bersihkan data di hulu, sekali saja

Mulai dari satu dataset: unggah, lihat skornya, dan biarkan Dataklin menunjukkan apa yang perlu diperbaiki.