Data Science Essentials
7 Topics
1
NumPy Basics
High-performance numerical computing with multi-dimensional arrays (ndarrays).
Foundation of data science and ML. Vital for understanding memory layout (C-contiguous vs Fortran-contiguous), vectorization, and matrix manipulation.
2
Pandas Basics
Data analysis and manipulation with Series and DataFrames.
Industry standard for data engineering and preprocessing. Crucial for understanding dataset slicing, aggregation, and merging.
3
Matplotlib
A comprehensive library for creating static, animated, and interactive visualizations in Python.
Reporting and analysis. Tested on basic plotting mechanics (figure vs axis), custom styling, and layout adjustment.
4
Jupyter Notebooks
An open-source web application for creating documents containing live code, visualizations, and narrative text.
Standard development environment for data scientists. Tested on interactive cell executions, kernel states, and workflow best practices.
5
Data Cleaning
Techniques for preprocessing raw, messy data by handling missing values, duplicates, and type mismatches.
Core data engineering. Crucial for showing how to clean real-world data safely and handle missing values.
6
Scikit-learn Introduction
Basic machine learning modeling using Python's Scikit-learn library.
Machine learning fundamentals. Frequently questioned on model API (fit/predict), preprocessing, train-test splits, and evaluation metrics.
7
Statistics with Python
Performing core statistical calculations using built-in libraries and NumPy.
Analytical roles. Tested on computing metrics, probability distributions, outlier boundaries, and correlation analysis.