Skip to main content
Brave Programmer Logo

BraveProgrammer

BraveProgrammer

HomeProjectsBlogsCoursesLessonsAbout

Site footer

BraveProgrammer

Free coding courses, practical tutorials, and real projects from BraveProgrammer. Learn web development with React, Next.js, and TypeScript.

Navigation

  • Home
  • Projects
  • Blogs
  • Courses

Resources

  • About
  • Lessons

© 2026 BraveProgrammer. All rights reserved.

  1. Courses
  2. /
  3. Master Data Science with Python

Lesson 23 of 60 · python

Data Cleaning: Duplicates, Renaming, and Type Conversion

Duration: 20 minutes

Data Cleaning Essentials

Cleaning data is often 80 % of a data scientist's workload.

Removing duplicates

duplicates = df.duplicated()
print('Duplicate rows:', duplicates.sum())

df_nodup = df.drop_duplicates()

Renaming columns for clarity

df.rename(columns={'emp_id': 'employee_id', 'dept': 'department'}, inplace=True)

Changing data types

# Convert a column to datetime
df['date'] = pd.to_datetime(df['date'], format='%Y-%m-%d')

# Convert categorical column to `category` dtype for memory savings
df['department'] = df['department'].astype('category')

Stripping whitespace in string columns

df['city'] = df['city'].str.strip()

Applying a custom cleaning function

def clean_name(name):
    return name.title().strip()

df['name'] = df['name'].apply(clean_name)

Info

Consistent naming conventions and correct dtypes simplify later analysis.

Previous: Handling Missing Data in PandasNext: GroupBy and Aggregations