Data Quality
ML-Powered Deduplication
★ 4.4
Open-Source Data Quality Platform
★ 4.2
pip install dedupepip install dqopspip install dedupepip install dqopsData engineers use Dedupe to clean messy customer or product data where the same entity appears with slightly different names or addresses. Engineers label a small training set via the interactive CLI, Dedupe learns a similarity model, then applies it at scale to cluster duplicate records — outputting canonical entity IDs for use in downstream analysis.
Python data engineers use DQOps via its Python client library to define and run data quality checks on warehouse tables as part of a pipeline. After each pipeline run, a DQOps scan validates row counts, null rates, and business rules — failed checks are logged and can trigger Airflow task failures to prevent bad data from reaching downstream consumers.
Individual Tool Pages