WeAreDevelopers LIVE Dec 15, 2023

Overview of Machine Learning in Python

Adrian Schmitt

Are unaddressed demographic biases secretly destroying your predictive algorithms? Learn essential Python machine learning workflows to prevent data leakage, optimize hyperparameters, and build truly robust models.

Pause
Mute Enter Fullscreen
#1 about 3 min

Introduction to machine learning paradigms

High-level overview mapping unsupervised, supervised, and reinforcement learning paradigms.

#2 about 2 min

Core objectives of supervised machine learning

How to distinguish regression for continuous variables and classification for separating class labels.

#3 about 6 min

Preparing and encoding tabular data

Transforming string-based categorical data into machine-readable numerical encodings to prevent model bias.

#4 about 2 min

Scaling numerical data for model stability

Utilizing min-max scaling and Z-score normalization to align extreme numerical values appropriately.

#5 about 2 min

Strategies for missing values in datasets

Choosing between row deletion and specific imputation methods when data is structurally incomplete.

#6 about 1 min

Preventing data leakage during pre-processing

Executing data manipulation steps strictly after data splitting to ensure separate independent evaluation.

#7 about 3 min

Identifying demographic bias in raw datasets

Identifying unrepresentative demographic distributions in the adult census dataset before applying predictive models.

#8 about 5 min

Data splitting methodologies for model training

Structuring train, test, and validation sets through techniques like cross-validation and stratification.

#9 about 2 min

Computing machine learning performance metrics

Using confusion matrix ratios and error distance functions to numerically grade classification and regression outputs.

#10 about 4 min

Balancing underfitting and overfitting in model training

Managing training duration to reach optimal generalization capacity without memorizing pure training data.

#11 about 2 min

Parameter optimization via grid and randomized searches

Setting configuration algorithms like randomized search and Bayesian optimization to automatically tune models efficiently.

#12 about 2 min

Automating optimal algorithm selection techniques

Applying meta-learning functionality to predict the most effective classification algorithm based on incoming datasets.

#13 about 4 min

Navigating decision trees and random forests

Combining randomized subsets of decision structures into random forests to dramatically improve predictive stability.

#14 about 7 min

Coding decision trees in scikit-learn

Pre-processing features and training a decision tree model utilizing integrated Python frameworks against baselines.

#15 about 4 min

Constructing multi-layer perceptrons iteratively

Mapping biological neuron structures into digital input, hidden, and output network topologies via backpropagation.

#16 about 5 min

Architecture choices for deep neural networks

Deciding when to escalate simple structures into specialized deep networks like convolutional iterations utilizing TensorFlow.

#17 about 3 min

Scaling model training for large datasets

Speeding up machine learning analysis using component parallelization or adapting pre-trained transfer learning layers.

#18 about 3 min

Using scikit-learn for standardized model comparisons

Generating reproducible scoring seamlessly across various algorithmic attempts to accurately identify top runtime performance.

#19 about 3 min

Overcoming structurally imbalanced target variables

Resolving dataset representation skews using programmatic oversampling duplicates or principal component analysis abstractions.

#20 about 2 min

Choosing specialized libraries beyond scikit-learn

Moving outside native scikit-learn boundaries when requiring intricate parameter controls within specific deep neural architectures.

#21 about 2 min

Identifying major red flags in source datasets

Recognizing extreme rates of missing values or unanonymized sensitive intelligence as blockers for responsible analysis.

Matching moments

15:08 min

Audience questions on practical machine learning operational strategies

Lina Weichbrodt · LIVE

3:07 min

Overview of presentation structure and interactive Slido setup

Radovan Kavický · LIVE

2:31 min

Exploring common regression and classification machine learning algorithms

Lutske van der Meer Lutske van der Meer · WWC 2024

1:20 min

Uncovering the hidden technical debt in machine learning

Nico Axtmann · WWC 2022

3:45 min

Familiarizing with machine learning and neural network basics

Tillman Radmer +2 · WWC 2021

1:07 min

Navigating the complexities of machine learning model lifecycles

Iryna Kondrashchenko Iryna Kondrashchenko +1 · WWC 2025

Upcoming sessions on this topic

Open session

World Congress 2026 North America

You Can’t Re-Run Sunlight: Designing ML Data Architectures for Physical AI

An Phan

Senior Data Infrastructure Engineer @ Hippo Harvest

An Phan
Open session

World Congress 2026 North America

Building Stuff with GenAI - The Open Minded Workshop beyond OpenAI

Andreas Erben

CTO for Applied AI and Metaverse at daenet

Andreas Erben
Open session

World Congress 2026 North America

Proactive AI That Doesn’t Annoy Users: Building Context-Aware Notification Systems

Raju Dandigam Dandigam

Engineering Manager at Navan

Raju Dandigam Dandigam
Open session

World Congress 2026 North America

Understanding LLM Architectures: Inside the Design of Modern Models

Jofia Jose Prakash

Enterprise AI Architect at American Chemical Society

Jofia Jose Prakash
Open session

World Congress 2026 North America

No Single Model to Rule Them All: Building Resilient AI Agents Across Open & Closed LLMs

Emmanuel Acheampong

Senior Manager Developer Relations at Crusoe AI

Emmanuel Acheampong
Open session

World Congress 2026 North America

Building Pragmatic AI: 10 AI Features Your Users Actually Want

Jonathan "J." Tower

.NET Foundation Board | 12x Microsoft MVP | Founder & Consultant

Jonathan "J." Tower