Remove duplicates
Remove duplicates — removeDuplicates
Drop duplicate rows.
Use cases
- Collapse exact duplicate records.
- Keep one row per key (e.g. one row per
customer_id) by choosing asubset.
What it does
With subset: ["email"], any two rows sharing the same email are considered
duplicates and only the first is kept.
Before
| name | score | |
|---|---|---|
| [email protected] | Grace H | 92 |
| [email protected] | Ada L | 88 |
| [email protected] | Grace Hop | 95 |
| [email protected] | Linus T | 74 |
4 rows · 3 cols
Remove duplicates (subset=email, keep=first)
After
| name | score | |
|---|---|---|
| [email protected] | Grace H | 92 |
| [email protected] | Ada L | 88 |
| [email protected] | Linus T | 74 |
3 rows · 3 cols
Configuration
| Config key | Type | Required | Description |
|---|---|---|---|
subset | string[] | No | Only consider these columns when deciding duplicates |
keep | string | false | No | first (default), last, or false (drop all duplicates) |
Generated Python code
df_2 = df_1.drop_duplicates()
Tips & common mistakes
subsetcontrols "duplicate by what". Without it, two rows must match on every column to count as duplicates.keep: falsedrops every copy of a duplicated row — use it to find rows that are truly unique.- Pair with Sort rows first when
keep: first/lastshould pick a specific record per key.